Веб-версияОткрыть в Telegram

ПостПродолжаю рассказ про свои эксперименты с «народными» (открытыми) LLM.

30 марта 2026
P
Potion of Intelligence
Продолжаю рассказ про свои эксперименты с «народными» (открытыми) LLM. Я тестировал только писательство и отыгрыш, то есть просил превратить сценарий в полноценный текст, вести диалог от лица заданного персонажа, помогать с проработкой мира, придумывать сюжетные повороты. Почему именно эти задачи? Потому, что именно в них я лучше всего ощущаю уровень «интеллекта». Через глубину, креативность, правдоподобность. Добавлю, что в этих задачах даже флагманские закрытые модели мне не кажутся безупречными. И хорошо чувствуется иерархия, Grok, например, более поверхностный, чем ChatGPT. Но «народные» модели это ужас. Более-менее приемлемые, содержательные тексты и диалоги получаются только с моделями 70B+. Но даже они значительно хуже чем Grok, который хуже чем ChatGPT. Модели 24B на грани применимости. То есть с трудом тянут на очень скучного, однообразного, глуповатого и ленивого писателя, сценариста или игрока. Общаться или совместно творить с ними совершенно не увлекательно и не интересно, но может быть они всё же не совсем бесполезны для творческих задач. 11B и всё что ниже это совсем мрак. Это хуже чем GPT-4 2023 года, живой сущности на том конце провода не ощущается совсем. Это автоответчик, который возвращает тебе твои же слова, полностью лишённую содержания воду или тривиальные истины. Отдельная большая беда это размеры контекста. Моего железа хватает только на 8-16k токенов (4 токена = 3 слова), это само по себе очень мало и это серьёзный бич всей лавочки с локальным запуском моделей. Но даже на этих 8-16к модели начинают плыть и забывать детали. С этим, кстати, и у закрытых флагманских моделей есть проблемы, их эффективный контекст на порядок меньше максимального и это видно даже в синтетических тестах. Тут надо смотреть не на примитивные бенчмарки «поиск слова в контексте», а на более продвинутые в духе NoLiMa, RULERv2 или Oolong (поиск по латентным ассоциациям без явного лексического совпадения, агрегация множества локальных наблюдений в длинном контексте и т.п.) У современных флагманов максимальный контекст 1 млн. токенов, но относительно эффективный в районе 128к. Это хорошая цифра. Для сравнения, Llama 3.1 70B, лежащая в основе многих любимых в народе моделей, начинает сыпаться уже на 4к. Лично мне, по ощущениям, для реальной совместной креативной работы нужно минимум 32к честного, эффективного контекста. Ничего из того, что я могу запустить локально, даже не близко к этой цифре. Ещё один момент — флагманские модели одинаково хорошо работают почти на любом языке, но народные «дистилляты» только на английском. Что касается других задач, в первую очередь программирования, я верю, что там ситуация лучше, но мне это не сильно интересно. Мои потребности закрывает Cursor. Агенты мне тоже не интересны, у меня нет для них работы. Ну то есть как — я бы точно не отказался, например, сделать себе цифрового двойника, у которого лежало бы в контексте подробной информации обо мне тысяч эдак на 100 токенов, и который бы симулировал мои взаимодействия с сайтами, подкастами, товарами, людьми, а потом давал бы мне рекомендации на основе симуляций. Но пытаться сделать двойника или ассистента с интеллектом этих табуреток это себя не уважать. А примитивный чат-бот, присылающий напоминалки или to-do лист, я могу сделать и без всяких локальных ИИ.
4 · 338 ·

Рядом в ленте

PPotion of IntelligenceСегодня был на концерте, где исполняли музыку композитора-минималиста Людовико Эйнауди. Это было моё первое вдумчивое знакомство с его творчеством. И оно заставPPotion of IntelligenceПоследние несколько дней активно тестирую открытые (open weights) языковые модели ИИ. И это оказался весьма отрезвляющий опыт, спускающий с небес на землю. Для
это сообщение
PPotion of IntelligenceДавно ничего не писал в канал, но встретил хороший повод оформить мысли, которые у меня давно на уме. Я как-то уже упоминал Виктора Таелина, одного из людей, чьPPotion of IntelligenceОпубликовал у себя в блоге на Medium довольно длинный и глубоко личный пост о том, с чего началось моё увлечение аниме, и почему это увлечение играет такую важн
PPotion of IntelligencePotion of Intelligence@intelligencepotion · канал · Технологии
308подписчиков147постов в индексе
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем