🎞️ Pika выпустили полноценную киностудию из ИИ-агентов — Director’s Suite генерирует любые видео длинного формата с нуля до финального продукта.
• Сценарист, режиссёр и оператор в одном месте: генерит сценарий, окружение, озвучку, звуки и все сцены.
• Придумывает героев с помощью фичи /cast и рисует раскадровки с помощью /storyboard.
• Знает весь контекст: каждая новая сцена генерится с чётким пониманием того, что происходило в предыдущих.
• Можно монтировать видео в пару кликов: переставлять сцены, обрезать клипы и собирать финальный монтаж.
• С ИИ-агентами можно общаться и голосом, и текстом прямо через чат в интерфейсе.
Полный набор для ИИ-продакшена — тут.
@notboring_tech
🌟 NVIDIA выложила в открытый доступ Cosmos 3 Edge
Это компактная модель мира на 4 миллиарда параметров, ориентированная на робототехнику, компьютерное зрение и автономный транспорт.
Модель принимает на вход текст, картинки, видео и траектории движения, а на выходе выдаёт видео, изображения, текст и команды для действий.
Внутри архитектура Mixture-of-Transformers, где авторегрессионная часть отвечает за рассуждения, а диффузионная за генерацию изображения, звука и действий. Отсюда двойное назначение, модель может и разбирать сцену, и генерировать движения для робота.
NVIDIA заявляет, что среди моделей такого же размера Cosmos 3 Edge - первая в бенче VANTAGE-Bench на видеоаналитику и лучшая в обучении управляющих алгоритмов для роботов.
Вместе с базовой версией в релиз вошли Cosmos 3 Edge Policy для манипуляций роботом и облегчённые 4-х шаговые версии Cosmos 3 Super (Image2Video и Text2Image), дистиллированные из старшей версии через DMD2.
Edge - самое компактное звено семейства Cosmos 3, которое NVIDIA развивает с весны.
Ранее были представлены более крупные модели Cosmos 3 Nano на 16 млрд параметров и Cosmos 3 Super на 64 млрд, плюс отдельные версии Super для генерации изображений по тексту и видео по одному кадру.
Задачи у них те же - разобрать сцену, предсказать, что изменится, и сгенерировать действие, но рассчитаны они на более мощное оборудование. Edge же закрывает нижний край линейки и сделаны для устройств, где вычислительных ресурсов мало.
📌Лицензирование: OpenMDW License
🟡Статья
🟡Страница проекта
🟡Набор моделей
🟡Демо
🖥GitHub
@ai_machinelearning_big_data
#AI #ML #WordModel #Omnimodal #Cosmos3 #NVIDIA
Специалисты больше верят в сознание кошек, чем младенцев
И это не шутка, а зеркало нашей моральной слепоты
Новый опрос 247 ведущих специалистов по сознанию (нейробиологов, психологов и философов) дал обескураживающие результаты:
· 92% экспертов готовы признать, что у кошки есть сознание.
· и только 75% готовы признать его у только что родившегося младенца.
Мы живём в эпоху, когда наука строит квантовые компьютеры и сканирует мозг до отдельного нейрона, но всё ещё плавает в базовом вопросе: где начинается тот, кому больно?
Эта слепота имеет конкретную, не философскую, а хирургическую цену.
Дикий факт из истории. Ещё в 1980-х годах младенцев могли оперировать без анестезии — с минимальным обезболиванием или просто на мышечных релаксантах.
Врачи не были садистами. Просто медицинская культура того времени не умела видеть «субъекта» там, где нет речи, памяти и взрослого «Я». Нет языка — значит, нет и сознания, а крик — просто рефлекс.
У хирургов 1980-х и у нас сегодня одинаковая слепота — и она не случайная. Это выгодное незнание: мы не видим субъекта там, где его признание разрушает привычный порядок вещей.
Сегодня это кажется варварством.
А завтра варварством назовут то, как мы сегодня фабричным методом выращиваем и убиваем кур, свиней и осьминогов, уже почти не сомневаясь, что там есть страх, боль, привязанность и переживание.
Главный урок истории сознания крайне нелицеприятен.
Общество не просто “не знает”, кто чувствует. Оно часто не хочет знать — особенно когда признание чужого опыта страданий делает привычный порядок морально дорогим.
Вот и получается, что сознание – это не только величайшая научная загадка.
Это еще и детектор нашей готовности видеть страдание там, где видеть его нам неудобно.
#Сознание #Мораль
У них сверхчеловеческая скорость и маневренность
В соревнованиях людей с ИИ в управлении дронами, шансов у людей мало уже сейчас, а через год шансы станут нулевыми
Чтобы оценить сверхинтеллект существующих ИИ, недостаточно поговорить о теории струн с ИИ-чатботом. Чтобы физически ощутить сверхчеловеческие способности ИИ, нужно увидеть их в реальном физическом мире.
Исследователи из Цюрихского университета и Google DeepMind продемонстрировали, как обучить дроны соревноваться друг с другом и превосходить самых опытных пилотов-людей. Это исследование имеет довольно пугающие последствия для будущего войны. Оно на практике показывает, что люди не смогут соперничать в контурах управления военными действиями с ИИ-системами из-за своих физических ограничений. И дроны будут лишь началом процесса замещения людей на войне.
В этом исследовании ИИ соревновались не со средним FPV-оператором дрона (от англ. First Person View «вид от первого лица» - это дрон, управляемый оператором, который видит полет «глазами дрона» благодаря камере на борту, передающей видео в реальном времени на специальные очки, шлем или экран).
Человечество в этих соревнованиях представлял Марвин Шеппер - пятикратный чемпион Швейцарии, занимающий 4-е место в мировом рейтинге. Одну из испытательных гонок Шеппера против 3-х ИИ вы видите на приложенном видео.
Итог соревнований: ИИ-агенты превосходят пилота-чемпиона в многоагентных гонках:
• по скорости (через отношение скоростей): на 19.6% по лучшему кругу и на 6.5% по полному финишу;
• а по устойчивости к столкновениям и срывам (по % “недопройденной части гонки”) аж в 5 раз.
Вывод таков: ИИ уже превосходит чемпиона-человека в одном из ключевых компонентов будущих битв дронов - короткой высокоскоростной многоагентной навигации с избеганием столкновений; но до абсолютной победы ИИ ещё не хватает переносимости на новые трассы и устойчивости в долгом бою.
Что особенно важно для замены людей ИИ-системами на войне (и не только применительно к дронам): челове
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"
В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали
📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face
Агент загружает на Hugging Face специально собранные датасеты:
Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов
Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты
📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face
Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.
Среди них оказываются ключ корпоративной mesh-VPN жертвы и
🌟 WASTE: запускаем полную Kimi K3 на MacBook Pro с 64 ГБ памяти
SQLite AI собрала движок на 6000 строк C, который гоняет полновесную K3 без BLAS, CUDA и Python в рантайме.
Kimi K3 после предварительной конвертации из safetensors в формат, который движок умеет читать, занимает 982 ГиБ (диск бы назвал это 1,05 ТБ). В оперативную память она не влезает даже приблизительно.
WASTE держит в RAM только резидентную часть на 27,28 ГБ, а экспертов подтягивает с SSD ровно тогда, когда они понадобились. Скорость генерации выходит 0,49-0,54 токена в секунду. Веса при этом полные, без дистилляции и обрезки слоёв.
🟡Расчёт строится на устройстве MoE
На каждый токен K3 включает около 4% собственных весов - 16 экспертов в каждом из 92 слоёв. Простаивающему весу незачем сидеть в памяти, ему достаточно успеть подгрузиться вовремя.
Контейнер с моделью устроен так, что один эксперт стоит ровно одного чтения с диска - матрицы gate, up и down лежат вплотную, а сами эксперты хранятся в остаточном векторном квантовании (3 ступени кодбуков по 256 записей, 3 бита на вес), и матрица никогда не разворачивается целиком.
🟡Скорость диска
На один токен движок вычитывает 17 ГБ. Внутренний NVMe в MacBook выдаёт 12,78 ГБ/с, и модель успевает читать.
Внешний бокс по USB даёт 0,94 ГБ/с, и тот же токен считается 13 секунд. Вариант для очень терпеливых.
🟡Работа с памятью
Раздувать кэш экспертов выше 46 ГБ бесполезно и вредно - на 52 ГБ скорость падает втрое, на 58 ГБ в 8 раз.
Причина в том, что движок остаётся внутри своего бюджета, а система уже нет - macOS вытесняет кэш на диск, и попадание в память оборачивается обращением к подкачке. Поэтому по умолчанию WASTE не забирает все доступные ресурсы, а берёт на один рабочий набор экспертов меньше, чем мог бы.
Полтокена в секунду - это 30 секунд на одно предложение, но модели вчетверо меньше до сих пор запускают на серверах с терабайтом DDR5, а здесь почти 3 триллиона параметров отвечают без сети.
Если триллионы параметров не нужны, тот же движо
🌟 MiniMax открыла веса видеомодели H3
Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель.
🟢H3-Base по этому формату генерирует видео в разрешении 768p.
🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
🟡H3-Base опубликована в 2-х вариантах
H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле. Официального кода для трейна пока нет.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
📌Лицензирование: MiniMax H3 Community License
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍
Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов
Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду
Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»
Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге
За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿
Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно т
Видео Alpamayo 2.mp4 · 28.4 МБ · нажмите — покажем
Фотография нажмите — покажем
🌟 NVIDIA открыла доступ к самой крупной модели для беспилотных автомобилей
Alpamayo 2 Super - рассуждающая VLA модель на 34 миллиарда параметров, которая сшивает изображение с передних, боковых и задних камер в круговой обзор и рассчитывает траекторию движения.
Впервые NVIDIA показала её на конференции GTC в Тайбэе в начале июня, но доступ открылся только сейчас.
NVIDIA делает упор на редких ситуациях, с которыми беспилотники справляются хуже всего, - перестроения, повороты через встречный поток, перегруженные перекрёстки.
В основе лежит Cosmos 3 Super Reasoner, после базового обучения модель прогнали через RL, то есть на последствиях её собственных решений в смоделированных поездках.
Помимо маршрута модель выдаёт текстовое обоснование манёвра, и оператор-разработчик может проследить, какая деталь в кадре привела к конкретному решению.
В компании связывают это с проверкой безопасности по стандарту ISO/PAS 8800 и предлагают использовать тот же механизм для автоматической разметки видео с тестовых машин - расшифровки, которая обычно занимает месяцы ручной работы.
В тесте LingoQA, где систему просят объяснить дорожную обстановку, NVIDIA ставит Alpamayo 2 Super на первое место и утверждает, что модель обходит Qwen2.5-VL 72B на 17 пунктов, а Gemini 2.5 Pro примерно на 15.
Лицензия модели позволяет дообучать Alpamayo 2 Super на собственных данных и ставить в серийные машины.
📌Лицензирование: Open MDW 1.1 License
🟡Блогпост
🟡Модель
🖥GitHub
@ai_machinelearning_big_data
#AI #ML #VLA #AutonomousVehicles #Alpamayo #NVIDIA
Видео worldclaw-teaser.mp4 · 30.8 МБ · нажмите — покажем
🌟 Tencent анонсировала систему сборки 3D-миров по текстовому описанию
Команда Hunyuan3D из Tencent опубликовала технический отчёт о WorldClaw. По одной фразе система строит трёхмерную сцену с рельефом, поверхностями, постройками, растительностью и транспортом.
На выходе получаются полигональные модели с текстурами, совместимые с Blender: их можно править вручную.
🟡Отдельной модели у WorldClaw нет, она связывает существующие
Агентом работает Claude Opus 4.8, картинки делает GPT-Image-2, за сегментацию отвечает семейство SAM3, геометрию доводит Hunyuan3D, а сборка идёт в Blender.
Сначала агент разбирает запрос в описание: какие нужны регионы, как они соседствуют, какой рельеф, какие объекты и в каком стиле.
Затем строится глобальный ландшафт. Регионы рисуются картой-схемой, из неё вырезаются маски, поверх складывается высотное поле из шумов и геоморфных операторов (пиков, дюн, террас, эрозии). Поверхности готовят двумя путями - генерацией текстур и сборкой процедурных материалов Blender. Камни и заросли рассыпаются по местности с учётом уклонов и высот.
На третьей стадии участок рендерится в картинку, редактор изображений дорисовывает на ней нужные объекты, SAM3 вырезает каждый по отдельности, SAM3D лепит по вырезанному черновую модель, а положение в сцене считается через пару лучей от двух камер. Дальше агент пересматривает рендеры и исправляет косяки: предметы, висящие в воздухе или утопленные в грунт, неверный масштаб и поворот.
Модели, не прошедшие проверку по качеству, дорабатывает Hunyuan3D, он уточняет поверхность и рисует текстуры, сохраняя место объекта в сцене.
🟡Тесты
Свою систему Tencent сравнила с SynCity, Marble от World Labs, MajutsuCity, WorldGen и GPT-5.6 Sol.
Всем давали запрос на одну тему средневековой деревни и показывали по четыре вида с уровня земли.
Авторы делают вывод, что WorldClaw выигрывает по выразительности рельефа, разделению регионов, разнообразию содержимого, соответствию запросу и устойчивости картинки при свободном д
📎 Нейронавт | Нейросети в творчестве
Qwen-Image-2512 GGFU/Humming
Пока Алибаба зажал новые квены, ByteShape оптимизировали старый.
• шесть уровней квантизации для GGUF от 8 до 17 ГБ
• Humming - экспериментальная интеграция, но быстрее GGUF
• для vLLM-Omni: 8–17 ГБ, ускорение в 2–3 раза
сравнение с оригинальной моделью
#qi2512 #gguf #humming
Unsloth Desktop: новий інструмент для локального запуску та навчання штучного інтелекту
Команда Unsloth AI випустила Unsloth Desktop — повноцінний кросплатформний інструмент, який об'єднує запуск, донавчання та розгортання моделей просто на вашому локальному обладнанні. Це настільний додаток, який дає змогу не просто спілкуватися з моделями в офлайні, а й повноцінно їх кастомізувати без складного налаштування термінала.
Новина на x.com.
💻 Підтримувані платформи та залізо
Додаток працює на Windows, macOS та Linux, пропонуючи гнучку оптимізацію під найрізноманітніші конфігурації:
- Процесори та графічні чипи: Підтримуються звичайні CPU (для чату та створення датасетів), а також мульти-GPU конфігурації від NVIDIA, AMD, Intel та чипи серії Apple Silicon на Mac.
- Формати: Повна підтримка стандартів MLX, GGUF, а також різноманітних диффузійних моделей для генерації зображень, аудіо та відео.
🚀 Головні фічі та можливості
- Швидке донавчання (Fine-tuning) без коду: Завдяки фірмовим оптимізаціям Unsloth, процес донавчання моделей виконується до 2 разів швидше при зниженні споживання VRAM на 70%. Тепер кастомізувати сучасні відкриті моделі можна навіть на споживчому залізі.
- Інтеграція з топ-агентами: Додаток дозволяє напряму підключати популярних кодинг-агентів (таких як Claude Code, OpenAI Codex, Hermes Agent, OpenClaw та OpenCode) до локальних LLM. Ви можете використовувати їх через сумісні API від OpenAI та Anthropic, призначаючи локальні моделі як швидкі суб-агенти.
- Підтримка новітніх моделей: Додаток з коробки підтримує роботу з топовими релізами на кшталт Gemma 4, DeepSeek-V4, Qwen, а також сучасними рішеннями для генерації відео й аудіо (MiniMax-H3 тощо).
- Контроль інструментів (Tool Calling) нового рівня: Завдяки вбудованому механізму самовідновлення помилок (self-healing) точність виклику інструментів агентами зросла до 50%, а виконання коду ізольоване у безпечних середовищах.
🛠 Вбудований функціонал "З коробки"
- Приватний вебпошук та Deep Research
Нейродайджест за неделю (#126)
LLM
- Muse Code и Spark 1.2 — Meta выкатили своего агента и новую модель. За счет разрешения обучаться на данных пользователя цена снижена до $0,1/$0,2 за миллион токенов.
- Qwen 3.8-Max — Alibaba выпустила мультимодальную модель на 2.4T параметров (95B активных). Отлично справляется с визуальными agentic задачами и автономным кодингом, стоит $2/$6. Обещают выпустить веса уже на этой неделе.
- Первая модель SSI — По слухам, стартап Ильи Суцкевера планирует релиз первой модели уже в августе, не дожидаясь заявленного сверхинтеллекта.
Генеративные модели
- Lift4D — Фреймворк для 4D-реконструкции динамических объектов и их текстур из обычного видео с камеры.
- Grok Video 1.5 — xAI выкатила минорное обновление своего видеогенератора.
- FLUX 3 Video — Видеомодель от BFL вышла в API (до 20 сек со звуком и липсинком). Появился черновой режим (Draft Mode), базовая цена от $0.17 за секунду в 720p.
- SeedRealtime — ByteDance представила нативную full-duplex модель. Ассистент непрерывно смотрит видеопоток, слушает и может инициировать диалог без задержек.
- Wan 3.0 — Alibaba запустила публичную бету. Модель генерирует видео до 30 секунд в 1080p, позволяя смешивать текст, фото, видео и аудио для точного переноса внешности и стиля.
- Wan Animate 2 — Альтернатива pose-control для motion transfer по видео-референсу без скелетов. Выложили веса и ноды для ComfyUI.
- Grok Imagine Image 2.0 — xAI сильно прокачали генератор картинок: добавили Magic Wand, точное редактирование областей, удаление фона и мультиреференс до 5 изображений.
Прочее
- Gemini Robotics 2 — Google DeepMind обновили VLA-модель: теперь она управляет всем телом гуманоида (включая мелкую моторику), координирует рой роботов и имеет on-device версию для быстрой адаптации.
- Перестановки в Google — Демис Хассабис покинул пост CEO DeepMind (перешел на роль Chair и Chief Scientist Alphabet), а Джефф Дин ушел из компании после 27 лет работы делать стартап Discovery Loop.
> Читать дайджест #