Data Portal | DS & ML
Ссылка
нажмите — покажем
нажмите — покажем
Reasoning from Scratch, шестой выпуск. Себастьян Рашка
Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO.
00:00 — Введение
01:54 — Чем reasoning-модель отличается от обычной
04:25 — Цепочки рассуждений и возможности модели
08:29 — Награды за точность и формат ответа
11:34 — «Aha-моменты» и обучение DeepSeek-R1
14:41 — Глубина рассуждений и длина ответа
18:38 — RLHF и RLVR
23:04 — GRPO против PPO
26:40 — Объяснение GRPO на аналогии с готовкой
31:43 — KL-компонент и упрощённый GRPO
35:04 — Загрузка предобученной модели
36:07 — Загрузка обучающих данных MATH
39:26 — Генерация ответов модели
46:30 — Расчёт проверяемых наград
49:55 — Расчёт преимуществ
51:54 — Логарифмические вероятности токенов и последовательностей
55:29 — Реализация логарифмических вероятностей последовательностей
57:37 — Исправление ошибки режима инференса
1:02:24 — Расчёт функции потерь GRPO
1:04:37 — Собираем один шаг GRPO целиком
1:09:19 — Цикл обучения GRPO
1:12:57 — Настройки обучения, логирование и чекпоинты
1:17:24 — Запуск обучения и разбор результатов
1:19:28 — Загрузка и оценка чекпоинтов
1:22:33 — Результаты MATH-500 и стабильность обучения
1:24:05 — Требования к памяти и следующие шаги
https://www.youtube.com/watch?v=237Hf7Q3lgg
62 · 1.2K ·