Ссылка
нажмите — покажем
нажмите — покажем
«Предсказатель следующего токена» — это неправильная ментальная модель для LLM
Автор Гаррин Макголдрик
Вопрос, чему современная LLM фактически обучается после предварительного обучения.
- Pretraining: модель учится повышать вероятность токена, который действительно следовал за предыдущими токенами в корпусе. Это действительно next-token prediction.
- RLVR: модель генерирует различные варианты решения, получает за них вознаграждение и повышает вероятность тех последовательностей, которые привели к хорошему результату. Здесь уже нет «правильного следующего токена» — есть цель, которую нужно оптимизировать.
- RLHF: модель дополнительно обучается вести себя как полезный ассистент, а не просто воспроизводить статистические закономерности обучающих данных.
Аналогия автора — шахматы. Можно обучить систему предсказывать ход, который обычно сделал бы гроссмейстер, а можно обучить её выбирать ход, который максимизирует вероятность победы. Внешне обе системы делают одно и то же — выбирают следующий ход, — но внутренне оптимизируют разные цели.
Отсюда главный тезис: «next-token prediction» описывает форму работы LLM, но не обязательно её функциональную сущность после постобучения.
Если воспринимать LLM только как «предсказатель следующего слова», легко прийти к выводу:
LLM = статистическая имитация существующих знаний.
А если учитывать RL, reasoning и exploration, появляется другая модель:
LLM = обучаемая система, которая может не только воспроизводить паттерны, но и искать решения в пространстве возможных последовательностей, если существует критерий качества.
Возникает очень интересный переход и для педагогики:
передать модели правильный ответ → научить модель находить правильный ответ → научить модель оптимизировать образовательный результат.
Последний шаг потенциально ведёт уже к AI-агентам и Human–AI Learning Systems, а не просто к использованию чат-ботов в обучении.
Читать 3мин)
96 ·