ComfyUI - AI. Nano Banana. GPT image
Ответсообщение недоступноВидео
🎥 One Model. One Generation. One Complete Shot.Ge.mp4 · 3.7 МБ · нажмите — покажем
🎥 One Model. One Generation. One Complete Shot.Ge.mp4 · 3.7 МБ · нажмите — покажем
Вы будете смеяцца, но у нас новый видео генератор.
И это просто конский монстр. По сравнению с ним Минимакс - это Stable Diffusion 1.5 на два килобайта.
Итак MAGI-2 Preview - открытая unified audio-video модель на 114B параметров, построенная как очень мелкозернистый MoE. Единовременно активируется около 6B параметров, то есть примерно 5% всей ёмкости модели. Sand AI называет это Ultra-Fine-Grained MoE / MagiMoE.
Модель одновременно работает с текстом, видео и аудио в одном Transformer backbone.
Главная архитектурная фишка интереснее самого числа 114B. Backbone - **40 Transformer layers**, из них средние **36 слоёв MoE**, четыре крайних dense. Hidden width 3072 разбивается на **12 независимых head по 256 dimensions**. У каждого head собственный набор из **256 экспертов**, а на токен выбираются Top-6. То есть на одном MoE-слое потенциально существует 12 × 256 = **3072 маленьких expert-блоков**, но конкретный токен использует всего 72 из них. Это позволяет хранить огромное количество специализированных параметров, не прогоняя 114B целиком на каждом diffusion step.
Сейчас заявлены T2V и I2V, причём звук генерируется совместно с изображением, а не приклеивается отдельной моделью после генерации. Выход пока жёстко ограничен 10 секундами. Референсов и редактирования нет.
Генерация двухступенчатая:
- base/preview: 512 × 896
- refiner: 1088 × 1920
- затем при необходимости output ресайзится до настоящих 1080 × 1920.
А теперь праздник: системные требования
Официальный MINIMUM(!):
8 × NVIDIA Hopper GPU.
Типа 8×H100/H200. Общий размер весов - около 307 GB:
- main preview transformer - 228 GB
- Qwen3.5-27B text encoder - 56 GB
- refiner - 14 GB
- Stable Audio Open audio VAE - 5 GB
- Wan 2.2 video VAE - 3 GB
- Turbo VAE decoder - 2 GB.
То есть полный зоопарк - особенно напрягает Stable Audio и древний ВАН.
По счастию Монстр уже есть на Artificial Analysis.
И среди open-weight video models with audio сейчас картина такая:
1. MiniMax H3 - 1192
2. MAGI-2 Preview - 1108
3. LTX-2.3 Fast - 958
Наверное можно расходиться, но впереди еще MAGI-2 distilled, которой нет.
Ну и надо подсобрать тесты, пока мало примеров.
А теперь самое главное - дешевая цена (в облаке):
MAGI-2 Preview теоретически обходится Sand.ai примерно в $0.074 за 10 секунд 1080p, но официальную пользовательскую цену API за такой ролик Sand.ai публично не раскрывает. Более того, по идее это цена за distilled модель, которой пока нет.
Cсылки:
https://platform.sand.ai/
https://platform.sand.ai/docs/api-v2
https://platform.sand.ai/app/buy-credits
https://sand.ai/blog/magi-2-preview
https://github.com/SandAI-org/MAGI-2-preview
https://huggingface.co/sand-ai/MAGI-2-preview
https://artificialanalysis.ai/video/leaderboard/image-to-video
@cgevent
3.5K ·