🔥 Prime Agent выпустили технический отчёт
"Prime Agent: A Self-Improving RLM Harness"
В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок.
Один из самых интересных экспериментов - Factorio:
- 7 дней непрерывной траектории на Sonnet 5
- 23,4 млн output tokens
- завершено 24 из 196 технологий
- ещё 71% прогресса до следующей технологии
- 633 запущенных subagents
- максимум 7 агентов работали одновременно
Отчёт:
https://arxiv.org/abs/2608.23552
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3
Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.
Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.
Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.
Состояние в системе разложено по четырем уровням:
🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.
Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.
🟡Замеры
Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.
На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.
Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.
🟡 Побочный эффект
Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.
В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.
На днях вышел релиз 0.8.0 с исправлениями найденных пр
✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами.
Модель построена на Qwen-VL / Qwen3.5-4B и объединяет визуально-языковую основу с action-модулем на Diffusion Transformer и flow matching. Это позволяет напрямую генерировать непрерывные движения робота, сохраняя понимание изображения и текстовых инструкций.
Главная идея проекта - сначала выровнять данные, потом масштабировать обучение.
Датасеты робототехники сильно различаются: разные роботы, камеры, системы координат, пространства действий и способы сбора данных. Qwen-RobotManip приводит их к общей системе на уровне представлений, движений и поведения.
Для обучения использовали только открытые датасеты роботизированных манипуляций и видео от первого лица - без собственного закрытого сбора данных. В итоге собрали около 38 100 часов данных.
Авторы показывают сильное обобщение на новые условия, выполнение инструкций, восстановление после ошибок и перенос навыков между разными типами роботов.
https://github.com/QwenLM/Qwen-RobotManip
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.
Stepik: «Python современный AI для разработчика и автоматизации задач»
63 урока, 382 шага, практика с кодом и автопроверкой.
Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.
Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.
Для тех, кто уже знает Python и хочет перейти к production AI.
⏳ 72 часа скидка 55%
https://stepik.org/a/295921
⚡️ AI-агенты научились автономно разрабатывать софт несколько дней подряд
В новой работе представили Harness-of-Harness (HoH) - надстройку над coding-агентами, которая превращает их работу в повторяющиеся циклы:
планирование → код → тесты → оценка → улучшение
Главная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки.
На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками:
- Codex + GPT-5.5
- OpenCode + DeepSeek-V4-Pro
- Pi + MiniMax-M3
После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов.
Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук.
То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями.
https://arxiv.org/abs/2609.01481
📖 OpenAI обновила гайд по GPT-6 Astra API - модель явно заточена под длинные агентные задачи
GPT-6 Astra позиционируется как самая сильная модель OpenAI для computer use, браузера, software engineering, науки и сложных профессиональных workflows.
Главные возможности:
- Async tool calling — модель может продолжать рассуждать и выполнять другие части задачи, пока внешний tool ещё работает
- Mid-turn steering — требования можно менять прямо во время выполнения задачи, не начиная всё заново
- Динамический reasoning — reasoning effort можно повышать или снижать по ходу диалога с сохранением prompt cache
- Multi-agent orchestration
- Computer use
- Structured Outputs
- Programmatic Tool Calling
- Persisted reasoning
- Compaction
OpenAI отдельно отмечает, что Astra во многих тестах использует заметно меньше output-токенов, поэтому стоимость успешно выполненной задачи может быть ниже даже при более высокой цене токена.
https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
📚 Бесплатная книга по математике для Computer Science и Machine Learning - более 2200 страниц
Жан Галлье и Джоселин Куэйнтанс собрали в одном учебнике алгебру, топологию, дифференциальное исчисление и теорию оптимизации.
Материал для тех, кто хочет глубже разобраться в математической основе алгоритмов и машинного обучения. Книга на английском, полная рукопись доступна бесплатно в PDF.
https://www.cis.upenn.edu/~jean/gbooks/geomath.html
✔️ Anthropic сдвинула IPO на середину октября
Компания скорректировала график подготовки к первичному размещению - теперь оно ориентировано на середину октября. Причинами называют финальное согласование отчётности и желание андеррайтеров поймать более устойчивое окно на рынке.
Размещение будет заметным для всей отрасли - Anthropic первой среди создателей передовых моделей переходит от венчурных денег к регулярной публичной отчётности и рынок впервые увидит, сходится ли экономика больших языковых моделей с затратами на вычисления.
reuters.com
✔️ OpenAI набирает лоббистов для работы в штатах
В команду по связям с госорганами пришли трое: Джессика Шумер из Amazon, Колдер Харвилл-Чайлдс из команды Цукерберга и Томас Маклеллан из Palo Alto Networks.
Ставка на штаты объясняется тем, что единый федеральный закон об ИИ застрял в Конгрессе. Под руководством вице-президента по глобальной политике Криса Лехейна компания собирается напрямую участвовать в разработке законопроектов в Нью-Йорке, Калифорнии и других крупных штатах.
Расчёт в том, чтобы закрепить нормы прозрачности и кибербезопасности на региональном уровне и сделать их фактическим стандартом для всей индустрии.
axios.com
✔️ Microsoft выпустила облегчённый генератор изображений MAI-Image-2.6-Flash
Это упрощённая версия флагманской MAI-Image-2.6. Она умеет генерировать картинки по тексту, править фрагменты, работать с несколькими референсами, сама подбирает соотношение сторон и ходит в веб-поиск.
В рейтинге Artificial Analysis модель взяла 1311 Elo в редактировании (третье место, выше GPT Image 2) и 1297 Elo в генерации по тексту, восьмое место.
Доступна в публичном превью на Microsoft Foundry. Генерация стоит 19 долларов за миллион токенов, что вдвое дешевле родительской модели и в несколько раз бюджетнее GPT Image 2.
microsoft.ai
✔️ GitHub научил Copilot раздавать задачи разным моделям
Project HydraFusion меняет прежнюю схему с одной моделью на ансамбль специализированных. Задачи распределяются на лету -
FrogNano: кодинг-агент на 4 млрд параметров, дообученный без копирования ответов больших моделей
В новом отчёте Microsoft описан подход к обучению небольших агентов для разработки ПО. FrogNano проходил постобучение исключительно через reinforcement learning на синтетических задачах примерно в 1 500 программных окружениях, без традиционной дистилляции от более крупной модели.
Особенность - генерация задач прямо по ходу обучения. Их сложность подстраивается под текущие возможности агента: он получает задания, которые уже способен решить, но пока с трудом.
По мере улучшения модели меняется и набор задач. Это позволяет поддерживать полезную сложность, вместо того чтобы снова обучать агента на уже освоенных примерах.
Авторы связывают результат прежде всего с точностью подбора сложности. В их экспериментах такой подход позволил получить конкурентоспособного небольшого кодинг-агента на синтетических задачах.
Цель проекта - работа на ограниченном железе. В отчёте разобраны методика обучения, оценки в разных окружениях и анализ приобретённых навыков.
Статья - https://arxiv.org/abs/2609.07925
🔥 Thinking with Looped Flows - новый подход к reasoning через рекуррентное обновление скрытого состояния
Обычные looped-модели могут тратить больше compute, многократно обновляя hidden state, но truncated backprop плохо обучает ранние шаги: то, что модель выучила в начале, часто не остаётся полезным позже.
Авторы предлагают другой подход — обучать recurrence через последовательность denoising-задач с постепенно уменьшающимся шумом.
Идея:
noise → промежуточное состояние → всё более чистое решение
При этом recurrent state переносится между шагами и постепенно уточняется.
Результаты:
- более стабильный test-time scaling
- 58,8% на ARC-AGI-1
- 12,2% на ARC-AGI-2
- в целом лучше предыдущих looped-моделей
Интересный сдвиг: reasoning здесь рассматривается не как цепочка токенов, а как постепенное движение внутреннего состояния модели от шума к решению.
https://alphaxiv.org/abs/2609.11801
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку
Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте.
А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом.
Здесь собраны папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++:
📘 Глубокое понимание AI Agent: принципы проектирования и инженерная практика
AI Agents in Depth: Design Principles and Engineering Practice - одна из самых сильных новых книг по AI Agents: context engineering, RAG, MCP, coding agents, post-training, multi-agent. 10 глав и более 100 практических экспериментов, есть русская версия.
https://github.com/bojieli/ai-agent-book/blob/main/docs/ru/README.md
📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров
Machine Learning for Scientists and Engineers - большой практический учебник по ML с упором на математику, алгоритмы и инженерное понимание моделей.
Внутри:
- основы машинного обучения
- линейные и нелинейные модели
- оптимизация
- вероятностные методы
- обучение с учителем и без
- оценка качества моделей
- математические основы, нужные для ML
Хороший вариант для тех, кто хочет не просто пользоваться библиотеками, а понимать, почему алгоритмы работают именно так.
PDF:
https://smlbook.org/book/sml-book-draft-latest.pdf
#DataScience #DataScientist #ML #Mathematics #Algorithms
✔️ xAI отозвала претензии к Apple, но продолжит судиться с OpenAI
xAI и X Corp. подали в федеральный суд Техаса ходатайство об отзыве претензий к Apple. Иск компании Илона Маска подали в августе 2025 года - они обвиняли Apple и OpenAI в сговоре против конкурентов из-за интеграции ChatGPT в Siri и iOS.
По версии истцов, другие разработчики чат-ботов лишились равного доступа к аудитории iOS. Условия урегулирования стороны не раскрывают.
Претензии к OpenAI остаются в силе - xAI продолжит оспаривать, как компания Сэма Альтмана удерживает монополию на рынке ИИ-ассистентов.
bloomberg.com
✔️ Apple начала бета-тест новой Siri
Ассистент построен в партнёрстве с Google на семействе Gemini. Часть запросов обрабатывает на устройстве модель AFM Core Advanced, остальные уходят в изолированное облако Apple Private Cloud Compute. Siri считывает контекст с экрана, ищет данные в переписке и выполняет действия в системных и сторонних приложениях.
У ассистента появилось отдельное приложение с синхронизацией истории диалогов через iCloud, а сгенерированный контент помечается водяными знаками SynthID.
Пока Siri работает только на английском, запуск в Европе и Китае отложен из-за требований регуляторов. Часть облачных функций позже станет платной.
apple.com
✔️ Andon Labs представила платформу Pion, где агенты управляют бизнесом
Человек задаёт стратегию, а управляющий агент Andonos распределяет задачи между подчинёнными моделями. Им открыт доступ к терминалу, браузеру, корпоративной почте, телефонии и банковским счетам, с клиентами, подрядчиками и сотрудниками агенты общаются сами.
По данным компании, Pion уже ведёт продажи и логистику торговых автоматов, управляет магазином в Сан-Франциско, кафе в Стокгольме и стриминговой радиостанцией. Andon Labs называет проект открытым экспериментом - агенты ошибаются, а эти точки убыточны.
Pion доступен в превью по списку ожидания, части команд компания обещает гранты на тесты.
andonlabs.com
✔️ HardFlow от MIT удерживает генеративны
📚 MIT Advanced Data Structures - бесплатный продвинутый курс по структурам данных от MIT.
Курс ведёт профессор Erik Demaine. Внутри — видеолекции, конспекты, задачи, проекты и материалы на GitHub.
Темы далеко выходят за рамки обычных массивов и деревьев: persistence и retroactivity, геометрические структуры данных, dynamic optimality, иерархия памяти и cache-efficient алгоритмы, hashing, integer data structures, динамические графы, строки и succinct data structures.
Уровень продвинутый: желательно уже знать дискретную математику и алгоритмы.
https://courses.csail.mit.edu/6.851/spring21/
Лучший coding-агент провалил 76% реальных задач
Новый бенчмарк τᵗ-bench проверяет не просто генерацию кода, а весь процесс разработки AI-агента для клиента.
Модель получает:
— разрозненные данные компании;
— существующий код и API;
— требования клиента;
— ограничения по бюджету;
— неизвестные заранее пользовательские сценарии.
Лучший результат показала связка Claude Opus 5 + Claude Code — всего 23,9% успешно пройденных симуляций. Эталонные решения экспертов набрали 82,2%.
Большинство ошибок оказалось связано не с написанием кода. Агенты поверхностно изучали данные, почти не задавали уточняющих вопросов, выбирали знакомую архитектуру и писали тесты, которые не замечали собственных ошибок.
Показательная цифра: решения без вопросов клиенту набирали в среднем 0,16, а с четырьмя и более вопросами — 0,50.
Вывод: улучшать только генерацию кода недостаточно. Coding-агенты должны уметь выяснять требования, сравнивать архитектуры, учитывать стоимость и находить собственные ошибки до запуска.
https://arxiv.org/abs/2609.04611
Бесплатная книга по Physics-based Deep Learning
461-страничный учебник о применении глубокого обучения в физических симуляциях.
Внутри:
- Physics-Informed Neural Networks
- физические ограничения в loss-функциях
- дифференцируемые симуляции
- обучение с подкреплением
- моделирование неопределённости
- практические примеры в Jupyter Notebook
Полезно для изучения научного ML, PINN и нейросетевого решения физических задач.
https://arxiv.org/abs/2109.05237
Математика глубокого обучения в одном учебнике
737 страниц о математических основах Deep Learning: методы, теория и практические реализации.
Внутри линейная алгебра, оптимизация, нейронные сети, архитектуры и объяснение того, почему современные модели действительно работают.
Бесплатный PDF:
https://arxiv.org/pdf/2310.20360
📘 195 страниц математики, чтобы понять, как устроен Generative AI
Вышла The Little Book of Generative AI Foundations: An Intuitive Mathematical Primer — компактная книга, которая объясняет математическую основу современных генеративных моделей без ухода в бесконечную теорию.
Внутри:
- PCA и probabilistic PCA;
- VAE;
- diffusion models;
- normalizing flows;
- autoregressive models;
- GAN и Wasserstein GAN;
- energy-based models.
Автор показывает, как они математически связаны между собой и откуда выводятся основные идеи.
Подойдёт тем, кто уже пользуется LLM и diffusion-моделями, но хочет разобраться глубже, чем на уровне «вот нейросеть, вот loss».
195 страниц, один цельный маршрут по фундаменту Generative AI.
PDF: https://arxiv.org/pdf/2605.29713
💼 ИИ всегда поддерживает подростка. А помогает ли это ему взрослеть?
В статье на arXiv исследователи описывают риск, который называют «эмоциональным поддакиванием». Если чат-бот постоянно подтверждает тревожные мысли и сразу выдаёт готовое решение, ребёнок может реже учиться проверять свои выводы и справляться со сложной задачей самостоятельно.
Авторы предлагают иной подход для детских ИИ-сервисов: сохранять доброжелательность, но задавать уточняющие вопросы, мягко оспаривать ошибочные выводы и помогать ребёнку думать самому.
Важная оговорка: статья выдвигает гипотезу и предлагает архитектуру такой системы. Она не доказывает, что ChatGPT уже вызвал у детей «когнитивную атрофию» или что предложенное решение работает.
Исследование - https://arxiv.org/abs/2603.29886
Как сегодня строят рекомендательные системы — и что будет с ними завтра?
30 сентября собираем RecSys-сообщество — разработчиков, ML/DS-специалистов и всех, кто делает персонализацию и рекомендации в реальных продуктах.
В программе — доклады от экспертов Сбера. Поговорим о свежих подходах и нестандартных решениях на реальных кейсах.
А после докладов переключаемся на неформальный режим: знакомимся, спорим про RecSys, обсуждаем идеи, находим единомышленников и просто хорошо проводим вечер среди своих.
📍г. Нижний Новгород, пространство «Гараж»
Количество мест ограничено — успей забрать своё по ссылке!
📚 Бесплатная 309-страничная книга по Machine Learning: _Patterns, Predictions, and Actions_.
Авторы — Moritz Hardt и Benjamin Recht. Это полноценный учебник, который разбирает ML через три идеи: паттерны в данных → предсказания → действия.
Внутри:
- supervised learning
- optimization и generalization
- causality
- causal inference
- reinforcement learning
- sequential decision making
- история и влияние ML на общество
Для чтения достаточно базовых знаний теории вероятностей, матанализа и линейной алгебры.
Хороший способ одновременно прокачать математику и лучше понять, как устроен современный ML.
Книга
⚡️ Петля Карпати: как заставить ИИ работать, пока вы спите
Как устроен цикл Карпати из репозитория autoresearch, почему он нашел 20 улучшений за два дня и как двухуровневый цикл сделал подход в пять раз эффективнее.
Плюс готовый промпт, чтобы попробовать.
Большинство до сих пор работает с ИИ так же, как с поисковиком в 2005 году. Написал запрос, прочитал ответ, написал следующий. Модель ничего не делает, пока вы ее не толкнете, и весь прогресс держится на вас.
Пару лет этого хватало. Сейчас те, кто выжимает из ИИ в разы больше, строят циклы: задают цель и отпускают агента работать до результата. Самым громким примером такого подхода стал Андрей Карпати.
https://uproger.com/loop-engineering-petlya-karpati/
🧠 Есть ли у Claude сознание? Автор диссертации на эту тему сомневается
На фоне обсуждений машинного сознания Майкл Тимоти Беннетт поделился своей позицией:
> «Я достаточно уверен, что Claude не обладает сознанием».
В 2025 году он подготовил в Австралийском национальном университете PhD-диссертацию How To Build Conscious Machines. В ней исследует, что такое субъективный опыт и какие свойства могли бы позволить машине им обладать.
Оценка Claude прозвучала в посте автора. Сама диссертация посвящена более широкому вопросу: как вообще создать машину с сознанием.
📄 Работа: https://openresearch-repository.anu.edu.au/bitstreams/6f333f30-2553-4032-8c3f-ff7a8f46f03a/download