Веб-версияОткрыть в Telegram

ПостHugging Face исследовали multi-harness RL: обучение с подкреплением сразу через Claude Code, Codex, OpenCode и Mini-SWE-…

4 октября 2026
P
Python RU
Фотография
нажмите — покажем
Hugging Face исследовали multi-harness RL: обучение с подкреплением сразу через Claude Code, Codex, OpenCode и Mini-SWE-Agent. Для этого объединили три проекта: • OpenEnv записывает обращения к модели, токены и вероятности генерации. • Harbor запускает одинаковые задачи в контейнерах через разные обвязки. • TRL использует собранные данные для обучения. Каждая обвязка сохраняет собственные инструменты, промпты и цикл работы. Модель учится внутри настоящих агентов. По данным авторов, у LFM2.5-2.6B доля тестовых задач, решённых с первой попытки, выросла с 42,2% до 54,2%. Улучшения появились во всех четырёх обвязках. На задачах, которые решили обе версии модели, обученная использовала на 31% меньше вызовов инструментов. Эксперимент ограничен одним семейством задач, но показывает перспективный подход: адаптацию к разным обвязкам можно закладывать прямо в обучение. 📖 Руководство: https://huggingface.co/spaces/FineEnvs/multi-harness-rl
11 · 454 ·

Рядом в ленте

PPython RUПишем игру на Python: неоновая аркада с разбором кода и ИИ Pygame часто считают библиотекой для школьных проектов, и зря. На нём за вечер собирается динамичная PPython RUDeepSeek Harness вышел на десктоп: плагины без терминала и задачи по расписанию DeepSeek выпустила превью Harness v0.2 с десктопным приложением для macOS и Wind
это сообщение
PPython RU🐍 Python умеет сравнивать числа как в математике Проверку диапазона можно записать короче: # Вместо if 60 < heart_rate and heart_rate < 100: print("В пределах д

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем