Веб-версияОткрыть в Telegram
AAI[ex]Time

AI[ex]Time

@AIexTime · канал · Технологии · в индексе с 2026-04-17
2 851подписчиков+21 за неделю
179постов в индексе
AI[ex]Time
🎄 Релизим 67 074 траектории Qwen3-Coder с OpenHands + 2 RFT чекпоинта. > Мы выкладываем: 67 000+ траекторий по 3 800 решенным задачам в 1 800+ Python репозиториях. > Примерно в 3 раза больше успешных траекторий и в 1.5 раза больше репозиториев, чем в нашем прошлом датасете. > Траектории длинные: в среднем 64 шага, до 100 шагов и контекст до 131k токенов. > RFT на этих данных, SWE-bench Verified: Qwen3-30B-Instruct: 25.7% → 50.3% Pass@1. Qwen3-235B-Instruct: 46.2% → 61.7% Pass@1. Также сильный рост на SWE-rebench September (цифры в блог посте) > Мы сделали много эвалов. прогнали OpenHands с лимитом 100 и 500 шагов. Запускаем на SWE-bench Verified и сентябрьском SWE-rebench. > Мы отдельно проверяем тесты, которые пишет модель. Считаем, как часто тесты корректны. Проверяем, как часто финальный патч модели проходит ее собственные тесты. В итоге получаем пул данных в том числе для обучения верифаеров. Полностью Permissive License Датасет и модели: https://huggingface.co/collections/nebius/openhands-trajectories Подробный блогпост: https://nebius.com/blog/posts/openhands-trajectories-with-qwen3-coder-480b Пост в x: https://x.com/ibragim_bad/status/2003423706861936856 P.S. Прошу поддержать пост в x, если у вас есть аккаунт!
13 · 1.8K ·
A
В рамках одного из проектов, где мы строим scaffolding-agnostic инфраструктуру, накопилось достаточно большое кол-во агентских траекторий, которые мы посчитали будет полезно выложить. И сразу же возник вопрос: а насколько можно прокачать модель в SWE, сделав простой rejection fine-tuning на траекториях Qwen3-480B-Coder. Оказалось, что очень даже неплохо – тянет на сильный бейзлайн в других экспериментах. Собрав множество деталей и багов запуска с OpenHands, сделали еще небольшой чеклист, как репортить замеры, чтобы было воспроизводимо – репортов вида openhands maxiter=100 недостаточно 😕️️️️️️ А главные цифры можно увидеть у Ибрагима 👆
9 · 2.5K ·
A
AI[ex]Time
За последнее время пришлось углубиться в спекулятивный декодинг и прочитать с десяток статей. Некоторыми из них, которые показались мне интересными и при этом не базовыми, захотелось поделиться: GRIFFIN: Effective Token Alignment for Faster Speculative Decoding. Во время обучения драфт моделей, у нас происходит training-inference misalignment, потому что во время трейна все токены получены из таргетной модели, в то время как во время инференса токены получаются из драфт модели авторегресионно. Статья предлагает, на мой взгляд, немного костыльный способ борьбы с этим, но сама проблема – интересная, и про нее кажется не так много пишут. Block Verification Accelerates Speculative Decoding. Просто очень классный взгляд на процесс верификации, когда от rejection sampling на уровне каждого токена, мы переходим на уровень целого предсказанного блока. DistillSpec: Improving Speculative Decoding via Knowledge Distillation. Изучает различные виды divergences для дистилляции таргетной модели в драфтерную, все-таки KL loss – не единственный вариант учить такие модели. FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling. Тк драфт модели сейчас делаются довольно маленькими, language head занимает существенную часть времени во время инференса. Авторы предлагают делать словарь намного меньше, убирая нечастотные токены и для драфтера использовать такие обрубленные словари. Кстати, EAGLE3, которые выходят в опенсорс, часто используют уже эту оптимизацию. Например, популярная коллекция от RedHat. Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion. Очень интересное направление, чтобы для драфтинга использовать диффузионные модели, которые на первый взгляд очень хорошо ложатся в данную задачу, но несут много дополнительных вопросов. По этой статье можно найти еще серию интересных связанных, и уже есть продолжение работы – SpecDiff2. RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic
53 · 3.5K ·
A
AI[ex]Time
Фотография
нажмите — покажем
А теперь угадайте, сколько подач на ICML 2026 > 34k 💀
19 · 2.7K ·
AI[ex]Time
Я уже не знаю, как отвечать в последнее время на вопросы, что ботать на первых курсах, чтобы заниматься ML/LLM и тд через несколько лет, или как искать работу потом. Но этот общий совет мне кажется makes sense.
4 · 1.7K ·
Как стать топ-1% в век ИИ Если вам от 14 до 24 и вы хотите быть супер успешным в пост-ИИ экономике, где большинство рутинных и офисных профессий заменены агентами, то у меня есть два простых, но очень важных совета: 1. Попросите родителей или сэкономьте на сладостях $100 в месяц, купите подписку Max у Антропика (бонус поинты: купите за $200) и делайте что угодно в Claude code чтобы потратить >80% недельного бюджета токенов КАЖДУЮ НЕДЕЛЮ. Не важно что. Спросите Клода «а что такого классного я могу сделать?», создайте пранк, фильм, игру, книгу, приложение которое за вас решает домашку, общается за вас в Тиндере. Это не про программирование, а про умение на лету создавать и управлять армией сверхумных агентов. 2. Безжалостно ищите самых энергичных и умных людей в той сфере, которая вам интересна. Поступите в крутой вуз (знания не так важны, но важна тусовка), вступите в элитный дискорд, запишитесь на конфу или митап. Ибо чем умнее будет ИИ и чем больше он сможет делать «обычной работы», тем ценнее будут самые необычные, талантливые, exceptional люди и отношени между ними. Я жутко завидую и радуюсь детям, своим и вообще, потому что возможностей творить и раскрываться у них больше, чем когда-либо на планете.
45 · 1.6K ·
A
Фотография
нажмите — покажем
Чуть в сторону от технических тем – сразу клоуны полетели 😕 Тогда пока я пишу длинный пост про RL, можно посмотреть на предстоящий релиз rebench, в этом месяце будет много интересного
7 · 1.9K ·
В современном агентском reinforcement learning with verifiable rewards (RLVR) есть ярко выраженная проблема credit assignment: допустим SWE агент пытается решить долгую и сложную задачу, тратит на это миллионы токенов и сотни шагов. В конце ему приходит сигнал от verifier-а, решена задача или нет. Проблема в том, что на протяжении предыдущих шагов могли быть как и очень хорошие действия, так и бесполезные и даже вредные. Классический GRPO считает Advantage для всей траектории целиком, и в итоге все токены у нас равнозначны, их вероятности во время обучения мы двигаем в одну сторону (Advantage здесь – это величина, показывающая, насколько мы хуже/лучше средней траектории, соответственно мы хотим закреплять поведение, если A > 0, и штрафовать, если A < 0). Проблема усугубляется, когда наград становится несколько, что на практике возникает часто. И действительно, легко придумать целое множество дополнительных сигналов, которое хотелось бы использовать: сделать reproduce бага; запустить тесты для проверки; линтер, чтобы соблюсти код стайл; избежать повторяющихся тул колов + кучу каких-то рубрик (Вот интересная работа DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research, где рубрик много, и они меняются по ходу обучения). Пока что классические методы все равно дают невероятные результаты, которые мы с вами видим в SWE на протяжении последнего полугода, но все равно в будущем очень пригодятся методы увеличения количества сигнала из каждой траектории, ведь задачи будут становится все дольше и дольше, и для них получение ролаута будет занимать не минуты, а, скажем, часы. Мне это направление очень нравится и думаю, что в ближайшее время мы увидим не одну работу, направленную в эту сторону. Прежде чем сказать про нашу работу, расскажу еще про один стандартный подход, который позволяет оценивать Advantage для промежуточных шагов. Мы можем остановиться на промежуточном шаге и сделать из него K ролаутов до конца, таким образом получить оценку, а как в среднем
25 · 2.3K ·
Пост выше больше не про нашу статью, а про небольшой обзор credit assignment в RLVR. Написание его заняло побольше времени, чем обычно, поэтому хочется узнать, стоит ли про какие-то общие направления рассказывать в подобном формате в будущем (например, скоро будет, что рассказать про RL environments), в связи с этим опрос ниже.
2 · 2.2K ·
AI[ex]Time
Мы тут в Nebius AI R&D выкатили новый тул для всех, кто работает с кодовыми агентами – ConTree 🌳 https://contree.dev/ Пока в альфа релизе, будем рады фидбеку и вопросам! Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все. Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру. С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM. Пара главных фичей: + Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят. + Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree всё проглотит и мгновенно восстановится. + Готовый MCP сервер. Добавляешь пару строк в конфиг claude, и у него появляется неубиваемый облачный терминал. Пишите в комменты или в личку, если хотите попробовать и свои вопросы! Мы поможем всё настроить и сделать тестовые запуски.
42 · 2K ·
A
Если хотите попробовать завести для каких-то интересных своих кейсов, то можно мне тоже написать
2.2K ·
A
AI[ex]Time
Фотография
нажмите — покажем
Возвращаясь к теме спекулятивного декодинга. Сегодня выпустили нашу работу LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding. Стандартом обучения драфт моделей стала минимизация KL дивергенции между самим драфтером и таргетной моделью, но почему? С одной стороны, такой выбор интуитивный: во-первых, мы приближаем одно распределение к другому; во-вторых, если KL = 0, то распределения совпадают и acceptance rate (одна из главных метрик при спекуляции) будет равен 1. Но на самом деле не все так просто. Мы предложили другой objective для оптимизации, который напрямую максимизирует acceptance rate. Постараюсь в ближайшее время сделать обзор статьи, но пока поделюсь главными результатами: • Drop-in replacement в тренировке, нужно поменять буквально несколько строчек в ваших пайплайнах. • +8-10% в mean acceptance length на разных архитектурах драфтеров (MEDUSA, EAGLE3, MTP, MLP) и разных моделях (от llama8B до deepseek 685B) • Веса всех драфтеров выложены в HF. Можете забирать MTP для deepseek-v3, eagle3 для gpt-oss120b и тд и сразу гонять в условном vllm. Также, если кому надо для экспериментов, можно брать большие датасеты с генерациями всех этих моделей, на которых мы учили драфтеры.
90 · 11.6K ·
A
AI[ex]Time
Фотография
нажмите — покажем
Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс! 📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов! Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире. Что внутри: > 32 000+ задач — на базе реальных issue + готовый Docker-образ. > 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты! > 120 000+ дополнительных задач, собранных на базе реальных PR. > Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах. Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей. 📄 Статья и датасет 👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами). ✉️ Пост в X Если есть любые мысли, идеи, предложения - приходите! 🔁 Буду благодарен за репост и пересылку!
15 · 2.1K ·
A
AI[ex]Time
Возвращаюсь с ICLR и хочу поделиться одним наблюдением, которое мне показалось интересным. Из множества разговоров с авторами и просто ребятами, делающими ресерч, вижу такой паттерн: очень большое кол-во работ и текущих исследований направлено в сторону lossy inference optimization. Под lossy имею в виду методы, которые не гарантируют сохранения качества исходной модели – то есть такого же распределения токенов. В целом вообще никаких гарантий нет: глобально мы хотим ускорить/сэкономить на памяти и не просадить качество. На другой стороне есть lossless подходы. Примеры для понимания: • Lossless: speculative decoding – мы на уровне алгоритма гарантируем, что токены получены из такого же распределения, что и большая target модель. • Lossy: routing в более слабые модели, когда нам кажется, что они справятся +- так же. Так вот, направление lossy – это большая кроличья нора: speculative decoding с ослабленными условиями верификации, компрессия KV cache, merging экспертов в MoE, всякие early exits во время forward pass, разного рода квантизации – в общем, там есть, куда разгуляться. При этом многие, занимающиеся подобными направлениями, одновременно много времени уделяют гранулярным эвалам: раз все эти методы не гарантируют сохранения качества, нужно супер детально понимать, где и когда качество падает сильно. И это тоже на самом деле нетривиальная задача. По ощущениям, эта связка становится очень большим направлением современного инференса – когда за скорость и цену приходится бороться с минимальными деградациями.
19 · 2K ·
A
На неделе у нас был очень классный reading club по статье Coupling without Communication and Drafter-Invariant Speculative Decoding, из которой хочется поделиться одной интересной концепцией. Но для начала стоит сказать про Gumbel-Max trick – способ семплировать из категориального распределения. Стандартный путь такой – считаем softmax над всем словарём и семплируем сам токен. Обе процедуры могут быть достаточно дорогими. Gumbel-Max делает следующее: к логитам прибавляем шум из распределения Gumbel(0, 1) и просто берём argmax. Математически это эквивалентно семплированию из softmax распределения, но при этом: - softmax можно не считать вообще - шум не зависит от логитов, его можно подготовить заранее, пока модель делает forward pass - из коробки получается top-k семплирование (Stochastic Beams and Where to Find Them) Теперь про идею Gumbel Coupling и ее применение для спекулятивного декодинга. Идея в том, чтобы использовать один и тот же gumbel шум при семплировании из драфтового и таргетного распределений. В таком случае можно записать корректный алгоритм с оценкой на acceptance rate, который будет просто сравнивать два токена между собой: токен от draft и target моделей. И вот тут получаются две интересные истории: 1. Не нужно материализовывать драфтовые логиты. В классической схеме верификации rejection sampling работает с обоими распределениями p и q одновременно, то есть драфтовые вероятности надо тащить через всю фазу верификации. С Gumbel coupling решение можно принимать, имея на руках только argmax от драфтера. 2. Воспроизводимость генерации. Вот это прям супер прикольно! В стандартной схеме итоговый сэмпл зависит от обоих распределений: меняется драфтер – меняется и то, что итоговая модель насемплит, даже при фиксированном seed. Получается, что чисто техническая оптимизация инференса влияет на то, что выходит из модели. С Gumbel coupling это свойство восстанавливается: при фиксированном seed выход не зависит от того, какой драфтер используется (и исполь
31 · 1.8K ·
A
SWE-rebench давно не обновлялся. Все потому, что каждый месяц прогонять новые модели, да ещё усложнять задачи, контролировать качество, детектить читинг со стороны моделей становится всё сложнее и сложнее. Но наконец сделали первичный релиз сразу за 2.5 месяца, со 110 задачами. В среднем они стали качественнее и при этом сложнее, теперь мы видим разницу между фронтирными моделями и разными reasoning_efforts. В этот раз к нам пришёл Cursor с просьбой поэвалить Composer 2.5. С учетом цены в 23 цента на задачу модель выглядит очень хорошо. А первичным я назвал релиз потому, что сейчас там всего 13 моделей. В ближайшие недели добавим сильно больше – DeepSeek V4, Qwen-ы, Gemini Flash 3.5 и тд. Пишите, что хотелось бы увидеть еще. Upd: В список моделей на добавление уже добавился Opus 4.8 😳
8 · 2.4K ·
A
AI[ex]Time
Фотография
нажмите — покажем
По горячим следам добавили Opus 4.8 xhigh, картина теперь такая
16 · 2.6K ·
A
AI[ex]Time
Только успели выкатить мини-релиз SWE-rebench с Gemini 3.5 Flash, MiniMax M3 и Junie (теперь на Opus 4.8 high, кстати, топ1 model-harness результат этого цикла: 61.6% resolved / 72.7% pass@5), как сразу прилетел Fable Решил написать небольшой обзор планов на ближайшие релизы лидерборда: – Поэвалили Opus 4.8 в разных reasoning efforts: от low до ultracode с dynamic workflows. Скоро расскажем про трейдоффы качество/цена + какие-то интересные наблюдения из траекторий – Точно будет релиз для любителей локальных моделей: квены, геммы, gpt-oss разных размеров. Если есть популярные модели, которые гоняются на мелком железе и которые было бы интересно посравнивать, пишите, подумаем над тем, чтобы поэвалить тоже – Ну и Fable, разумеется 💀 P.S. Если вдруг знаете кого-нибудь из антропик, кто мог бы помочь с кредитами, напишите плиз в DM @alex_golubev13 😳
5 · 2.4K ·
A
AI[ex]Time
На следующей неделе я буду на ICML, в том числе презентовать с командой постеры по нескольким принятым работам: LK Losses и SWE-rebench V2. Приходите к нам на стойку Nebius, на постеры или просто пишите, если хотите выпить кофе и познакомиться В этот раз мы решили провести after-party 9-ого числа https://luma.com/y5x82rk1, с едой, напитками, тихой музыкой и интересными разговорами. Мы приедем большой компанией и можно будет пообщаться с ребятами из ресерча/инжиниринга, обсудить все от агентских пайплайнов, стабильности MoE в RL до кернелов и низкоуровневых оптимизаций LLM инференса. Если вы глубоко погружены в LLM, inference optimization, pre/post-train, agentic evals, environments, agentic harnesses и прочие релевантные темы, то будет здорово вас увидеть. Мест у нас немного, поэтому конечно сможем позвать далеко не всех
16 · 2.2K ·
A
AI[ex]Time
Фотография
нажмите — покажем
Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров по сравнению с DAPO и насколько он по дефолту работает лучше в async режиме. На async в 64 шага дефолтный DAPO деградирует безумно сильно, да и на 16 уже заметно Для Qwen3 30B MoE картина та же, только коллапс в async происходит еще раньше из-за проблем с разным роутингом экспертов
20 · 1.7K ·
A
AI[ex]Time
Еще немного интересных наблюдений из RL для MoE. В нем есть одна проблема, которая делает обучение гораздо более склонным к нестабильностям. В любом современном RL есть train-inference mismatch, обычно вызванный двумя вещами: 1) из-за асинхронности инференс отстает от трейнера и 2) из-за разной имплементации кернелов/разного железа/неассоциативности сложения (у одной версии dense чекпоинта pi_train(tok) / pi_inference(tok) отличается обычно в четвертом знаке). Однако, в MoE появляется еще один очень неприятный источник такого расхождения: routed experts. Проблема в том, что во время инференса могут активироваться одни эксперты, а во время forward_pass на стороне трейнера – другие, и незначительное изменение в скорах роутера (но достаточное для того, чтобы topK изменился) могут значительно изменить итоговый результат. Основные решения такие: - Просто фризим роутер и уменьшаем асинк ⇒ роутер реже пересекает границу, при которой меняется topK - R2/R3, они же Routing Replays: сохраняем экспертов, активируемых версией модели для инференса и форсируем forward pass через них в трейнере. В статье https://arxiv.org/abs/2512.01374 можно почитать про разницу R2 vs R3 и всякие доп детали. Но проблема в том, что экспертов-то мы форсируем, но скоры роутера меняются, и это может быть проблемой (можно порассуждать на тему, что будет, если инференс версия дала i-ому эксперту высокий скор, а трейнер – низкий) И на самом деле у всех результаты смешанные: у кого-то работает одно, у других – другое. Вчера прочитал https://kiddyboots216.github.io/mismatch/#conclusion-router-replay и увидел еще один способ: Total Router Recall – сохраняем не только экспертов, но и их скоры, а в трейнере фризим роутер. Интересно, что можно предложить способ, при котором мы будем роутер учить, используя скоры и экспертов с инференса, правда работать это будет плохо. В общем, для всех интересующихся RL-ем рекомендую полистать блогпост, там много чего интересно помимо реплеев
33 · 1K ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем