Веб-версияОткрыть в Telegram

Пост⚡️ DeepSeek открыла веса V4.1-Flash

11 сентября 2026
P
Python RU
Фотография
нажмите — покажем
⚡️ DeepSeek открыла веса V4.1-Flash DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа. Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше. На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин. В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek. Каждому слою внимания заранее назначен один из трёх режимов: 🟢в полном слой считает свои ключи и значения сам; 🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть; 🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор. Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения. 🟡Causal Encoder-Decoder Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении. 40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера. Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа. Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно. 🟡Бенчмарки На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol. На Terminal-Bench 2.1 - 90,6% (выше всех). На AutomationBench - 54,8% против 50,3 у Opus 5. А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся. Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100. Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек. Сообщество на Hugging Face уже сделало квантованные версии практически под всё. 📌Лицензирование: MIT License 🟡Блогпост 🟡Веса 🟡Техотчет @ai_machinelearning_big_data #AI #ML #MMLM #MoE #Deepseek
8 · 917 ·

Рядом в ленте

PPython RU⚡️ DeepSeek выпустила V4.1 Flash Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображениPPython RUКоманды ждут тебя на треке программирование роботов на МТС True Tech Champ 2026 — всероссийском чемпионате по программированию с двумя треками и призовым фондом
это сообщение
PPython RU🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде. Этот курс про PPython RUKubernetes NodeLocal DNSCache: ускоряем DNS-запросы 🚀 Без NodeLocal DNSCache DNS-запрос от Pod проходит через: Service IP → kube-proxy → DNAT → conntrack → Core

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем