ChatCrawlerпоиск по публичному Telegram Открыть приложение
D

DigEd chat

сообщение · 2026-09-08 10:08 UTC
I
Ссылка
нажмите — покажем
​​«Предсказатель следующего токена» — это неправильная ментальная модель для LLM Автор Гаррин Макголдрик Вопрос, чему современная LLM фактически обучается после предварительного обучения. - Pretraining: модель учится повышать вероятность токена, который действительно следовал за предыдущими токенами в корпусе. Это действительно next-token prediction. - RLVR: модель генерирует различные варианты решения, получает за них вознаграждение и повышает вероятность тех последовательностей, которые привели к хорошему результату. Здесь уже нет «правильного следующего токена» — есть цель, которую нужно оптимизировать. - RLHF: модель дополнительно обучается вести себя как полезный ассистент, а не просто воспроизводить статистические закономерности обучающих данных. Аналогия автора — шахматы. Можно обучить систему предсказывать ход, который обычно сделал бы гроссмейстер, а можно обучить её выбирать ход, который максимизирует вероятность победы. Внешне обе системы делают одно и то же — выбирают следующий ход, — но внутренне оптимизируют разные цели. Отсюда главный тезис: «next-token prediction» описывает форму работы LLM, но не обязательно её функциональную сущность после постобучения. Если воспринимать LLM только как «предсказатель следующего слова», легко прийти к выводу: LLM = статистическая имитация существующих знаний. А если учитывать RL, reasoning и exploration, появляется другая модель: LLM = обучаемая система, которая может не только воспроизводить паттерны, но и искать решения в пространстве возможных последовательностей, если существует критерий качества. Возникает очень интересный переход и для педагогики: передать модели правильный ответ → научить модель находить правильный ответ → научить модель оптимизировать образовательный результат. Последний шаг потенциально ведёт уже к AI-агентам и Human–AI Learning Systems, а не просто к использованию чат-ботов в обучении. Читать 3мин)
96 ·

Все сообщения за 8 сентября 2026 · Вся лента · оригинал в Telegram

Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог