Фотография
нажмите — покажем
нажмите — покажем
🧩 Microsoft показала SkillOpt - способ обучать навыки агентов без дообучения модели
Обычно agent skills пишут руками, генерируют один раз через LLM или правят хаотично после неудачных запусков. Проблема в том, что такие правки легко делают навык хуже: текст звучит убедительно, но агент начинает чаще ошибаться.
SkillOpt предлагает относиться к skill-файлу как к обучаемому артефакту. Модель не трогают. Меняется только небольшой документ с инструкциями, привычками и процедурой выполнения задачи.
Как это работает: агент решает задачи, система смотрит на успешные и провальные траектории, затем отдельная optimizer-модель предлагает точечные правки в skill-документ. Правка принимается только если новый вариант даёт прирост на отдельной validation-выборке.
В итоге получается не новый чекпоинт и не набор хрупких промптов, а компактный readable-файл, который можно проверить, перенести в другой agent loop и использовать без дополнительных вызовов optimizer-модели.
По статье, SkillOpt тестировали на 6 бенчмарках, 7 моделях и 3 режимах работы: direct chat, Codex и Claude Code. Он оказался лучшим или разделил первое место во всех 52 проверенных случаях. На GPT-5.5 средняя точность выросла на 23.5 пункта в direct chat, на 24.8 в Codex и на 19.1 в Claude Code.
arxiv.org/abs/2605.23904
5.7K ·