ChatCrawlerпоиск по публичному Telegram Открыть приложение
M

Machine learning chat

сообщение · 2026-05-29 11:45 UTC
I
Фотография
нажмите — покажем
🧩 Microsoft показала SkillOpt - способ обучать навыки агентов без дообучения модели Обычно agent skills пишут руками, генерируют один раз через LLM или правят хаотично после неудачных запусков. Проблема в том, что такие правки легко делают навык хуже: текст звучит убедительно, но агент начинает чаще ошибаться. SkillOpt предлагает относиться к skill-файлу как к обучаемому артефакту. Модель не трогают. Меняется только небольшой документ с инструкциями, привычками и процедурой выполнения задачи. Как это работает: агент решает задачи, система смотрит на успешные и провальные траектории, затем отдельная optimizer-модель предлагает точечные правки в skill-документ. Правка принимается только если новый вариант даёт прирост на отдельной validation-выборке. В итоге получается не новый чекпоинт и не набор хрупких промптов, а компактный readable-файл, который можно проверить, перенести в другой agent loop и использовать без дополнительных вызовов optimizer-модели. По статье, SkillOpt тестировали на 6 бенчмарках, 7 моделях и 3 режимах работы: direct chat, Codex и Claude Code. Он оказался лучшим или разделил первое место во всех 52 проверенных случаях. На GPT-5.5 средняя точность выросла на 23.5 пункта в direct chat, на 24.8 в Codex и на 19.1 в Claude Code. arxiv.org/abs/2605.23904
5.7K ·

Вся лента · оригинал в Telegram

Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог