Potion of Intelligence
Продолжаю рассказ про свои эксперименты с «народными» (открытыми) LLM.
Я тестировал только писательство и отыгрыш, то есть просил превратить сценарий в полноценный текст, вести диалог от лица заданного персонажа, помогать с проработкой мира, придумывать сюжетные повороты. Почему именно эти задачи? Потому, что именно в них я лучше всего ощущаю уровень «интеллекта». Через глубину, креативность, правдоподобность. Добавлю, что в этих задачах даже флагманские закрытые модели мне не кажутся безупречными. И хорошо чувствуется иерархия, Grok, например, более поверхностный, чем ChatGPT.
Но «народные» модели это ужас. Более-менее приемлемые, содержательные тексты и диалоги получаются только с моделями 70B+. Но даже они значительно хуже чем Grok, который хуже чем ChatGPT. Модели 24B на грани применимости. То есть с трудом тянут на очень скучного, однообразного, глуповатого и ленивого писателя, сценариста или игрока. Общаться или совместно творить с ними совершенно не увлекательно и не интересно, но может быть они всё же не совсем бесполезны для творческих задач. 11B и всё что ниже это совсем мрак. Это хуже чем GPT-4 2023 года, живой сущности на том конце провода не ощущается совсем. Это автоответчик, который возвращает тебе твои же слова, полностью лишённую содержания воду или тривиальные истины.
Отдельная большая беда это размеры контекста. Моего железа хватает только на 8-16k токенов (4 токена = 3 слова), это само по себе очень мало и это серьёзный бич всей лавочки с локальным запуском моделей. Но даже на этих 8-16к модели начинают плыть и забывать детали. С этим, кстати, и у закрытых флагманских моделей есть проблемы, их эффективный контекст на порядок меньше максимального и это видно даже в синтетических тестах. Тут надо смотреть не на примитивные бенчмарки «поиск слова в контексте», а на более продвинутые в духе NoLiMa, RULERv2 или Oolong (поиск по латентным ассоциациям без явного лексического совпадения, агрегация множества локальных наблюдений в длинном контексте и т.п.)
У современных флагманов максимальный контекст 1 млн. токенов, но относительно эффективный в районе 128к. Это хорошая цифра. Для сравнения, Llama 3.1 70B, лежащая в основе многих любимых в народе моделей, начинает сыпаться уже на 4к. Лично мне, по ощущениям, для реальной совместной креативной работы нужно минимум 32к честного, эффективного контекста. Ничего из того, что я могу запустить локально, даже не близко к этой цифре.
Ещё один момент — флагманские модели одинаково хорошо работают почти на любом языке, но народные «дистилляты» только на английском.
Что касается других задач, в первую очередь программирования, я верю, что там ситуация лучше, но мне это не сильно интересно. Мои потребности закрывает Cursor.
Агенты мне тоже не интересны, у меня нет для них работы. Ну то есть как — я бы точно не отказался, например, сделать себе цифрового двойника, у которого лежало бы в контексте подробной информации обо мне тысяч эдак на 100 токенов, и который бы симулировал мои взаимодействия с сайтами, подкастами, товарами, людьми, а потом давал бы мне рекомендации на основе симуляций. Но пытаться сделать двойника или ассистента с интеллектом этих табуреток это себя не уважать. А примитивный чат-бот, присылающий напоминалки или to-do лист, я могу сделать и без всяких локальных ИИ.
4 · 338 ·