Data Portal | DS & ML
Фотография
нажмите — покажем
нажмите — покажем
Гайд по RL от Unsloth.
В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO.
Полный материал — от базового уровня до продвинутого.
Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide
35 · 922 ·