Веб-версияОткрыть в Telegram

ПостOneReason Technical Report [2/2]

27 августа 2026
Р
Рекомендательная [RecSys Channel]
OneReason Technical Report [2/2] В первой части разобрали, как устроен OneReason-Bench и почему авторы вообще вводят многоступенчатый ризонинг вместо next-item prediction. Теперь посмотрим, как модель учат работать с itemic-токенами и почему претрейн оказался здесь так важен. На претрейне модель прежде всего учат воспринимать историю пользователя и связывать семантические ID с текстом. Каждый айтем представляют четырьмя токенами: токеном домена и тремя семантическими ID. От завершающего токена из OpenOneRec отказались, чтобы сократить представление айтема и оставить больше контекста. Данные для претрейна делят на четыре уровня гранулярности: 🔴на уровне токенов модель учат связывать с текстом отдельные itemic-токены, их префиксы и полные токеновые последовательности; 🔴на уровне айтемов — генерировать описания, восстанавливать itemic-токены по тексту и отвечать на вопросы о свойствах контента; 🔴на уровне отношений — понимать связи и переходы между айтемами через естественно-языковые объяснения; 🔴на уровне пользователя — работать с доменно сгруппированными и хронологически перемешанными историями, моделируя кросс-доменные связи и эволюцию интересов. То есть претрейн не сводят к одному next-item objective. Обучающая смесь одновременно охватывает задачи от семантики отдельных токенов до моделирования полной пользовательской истории. Около 28,4% токенов претрейна приходится на данные общего назначения: 26,85% составляют текстовые корпуса, а ещё 1,59% — мультимодальные. Они нужны, чтобы во время специализации на рекомендациях модель сохраняла общие reasoning- и instruction-following-способности. С такой смесью итоговая модель остаётся близка к исходному Qwen3-8B на общих LLM-бенчмарках. Сам претрейн проходит в три этапа. 1) Сначала при замороженном бэкбоне обучают только новые эмбеддинги и соответствующие веса LM-головы для itemic-токенов. 2) Затем размораживают все параметры и продолжают обучение с меньшим learning rate. 3) На последнем этапе максимальную длину отдельных примеров увеличивают с 4K до 32K токенов, чтобы модель научилась обрабатывать полные пользовательские истории. OneReason обгоняет рекомендательные бейзлайны и почти не просаживается на LLM-бенчмарках — в отличие от Open OneRec, которая заметно теряла в языковых способностях. При этом модель, обученная получать качество за счёт рассуждений, становится лучше и в режиме без ризонинга. Аблейшны показывают, что добавление каждого следующего уровня гранулярности улучшает качество, а лучший результат даёт весь претрейн-рецепт целиком. @RecSysChannel Разбор подготовил ❣ Илья Мурзин
8 · 1.4K ·

Рядом в ленте

РРекомендательная [RecSys Channel]InterFormer: Effective Heterogeneous Interaction Learning for CTR Prediction Сегодня разбираем статью InterFormer об архитектуре под задачу CTR-prediction на геРРекомендательная [RecSys Channel]OneReason Technical Report [1/2] Сегодня разбираем хайповый техрепорт от Kuaishou на 108 страниц, в котором авторы научились получать существенный профит от риз
это сообщение
РРекомендательная [RecSys Channel]GRank: Towards Target-Aware and Streamlined Industrial Retrieval with a Generate-Rank Framework Сегодня разбираем статью о том, как построить ретривал для миллиРРекомендательная [RecSys Channel]Три статьи на стыке LLM и Recsys Сегодня делимся сразу тремя работами о том, как LLM встраивают в разные части рекомендательных и шопинговых систем. Building a
РРекомендательная [RecSys Channel]Рекомендательная [RecSys Channel]@RecSysChannel · канал · Технологии
3 234подписчиков1 113средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем