Гайз, я вам тут вряд ли что-то полезное подскажу.
Кодекс довольно оптимистичен в потенциале дообучения этой модели.
Просто типы из pipecat реально шарят в voice AI и всех его составляющих, активно коммуницируют и коллабятся с топ лабами, а с нвидиа еще до момента выхода моделей немоторон.
И тут они выкатывают профильную ллмку под телефонных ботов на базе немотрон, утверждая, что заколупалилсь ждать моделей от лаб и сделали вот эту модель и будут еще даже монетизировать через pipecat cloud. Кстати, Nemotron уже давно на бенчмарках Pipecat показывает очень хорошие результаты для такой маленькой модели, большой Nemotron, понятно, еще лучше, но они очень хороши в тулколлинге. И я их не рассматривал для своих ботов только из-за того, что они только английский язык поддерживают.
Yauheni YukhneuskiГайз, я вам тут вряд ли что-то полезное подскажу.
Кодекс довольно оптимистичен в потенциале дообучения этой модели.
Просто типы из pipecat реально шарят в voice AI и всех его составляющих, активно коммуницируют и коллабятся с топ лабами, а с нвидиа еще до момента выхода моделей немоторон.
И тут он
Ссылка
нажмите — покажем
нажмите — покажем
Да. Готового общепризнанного Nemotron-3-Nano-30B-A3B-Russian я не нашёл, но есть официальный рецепт дообучения именно этой модели и несколько хорошо документированных русскоязычных проектов, чью методику можно перенести.
Важная особенность Nemotron 3 Nano: в предобучении уже было около 185 млрд русских токенов, поэтому модель знает русский на базовом уровне. Но русский не участвовал в основном post-training/instruction-tuning — там использовались английский, немецкий, испанский, французский, итальянский и японский. Отсюда типичная картина: русский текст модель понимает, но стиль, следование инструкциям, reasoning и tool calling на русском могут быть заметно хуже. Это прямо следует из [официальной карточки модели](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16).
### Примеры именно для Nemotron 3 Nano
NVIDIA опубликовала:
- [Полный SFT-рецепт Nemotron 3 Nano](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/nemotron/nemotron_nano_v3_hellaswag.yaml).
- [LoRA/PEFT-рецепт этой же модели](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/nemotron/nemotron_nano_v3_hellaswag_peft.yaml). В нём уже учтена особенность гибридной Mamba/MoE-архитектуры: *.out_proj исключён из LoRA.
- [End-to-end пример LoRA для Text2SQL](https://docs.nvidia.com/nemotron/latest/use-case-examples/sql-lora-finetuning-and-deployment/README.html) с подготовкой chat-датасета, обучением и последующим запуском через vLLM/NIM.
- [Документацию NeMo AutoModel по SFT, LoRA и QLoRA](https://docs.nvidia.com/nemo/automodel/latest/recipes-e2e-examples/sft-peft).
То есть для русского можно взять официальный PEFT YAML и заменить HellaSwag на русскоязычный chat-датасет. Это наиболее безопасная стартовая точка.
### Наиболее полезные русскоязычные аналоги
| Проект | Метод | Что можно перенести |
|---|---|---|
| [Saiga](https://github.com/IlyaGusev/saiga) | SFT/LoRA различных Llama-подобных моделей | Подготовка русских многоходовых диалогов, маск
Yauheni YukhneuskiГайз, я вам тут вряд ли что-то полезное подскажу.
Кодекс довольно оптимистичен в потенциале дообучения этой модели.
Просто типы из pipecat реально шарят в voice AI и всех его составляющих, активно коммуницируют и коллабятся с топ лабами, а с нвидиа еще до момента выхода моделей немоторон.
И тут он
Ссылка
нажмите — покажем
нажмите — покажем
2. Сделать LoRA-SFT поверх текущей BF16 instruct-модели. Начать с официальных параметров rank=8, alpha=32, но протестировать также rank 16–32. Обязательно сохранить в смеси часть английских/tool-calling примеров, иначе можно ухудшить reasoning и работу инструментов.
3. Если модель уже говорит естественно, но плохо выполняет русские инструкции — LoRA-SFT, скорее всего, будет достаточно.
4. Если остаются фундаментальные проблемы с грамматикой, длинными русскими контекстами или знаниями — использовать базовый checkpoint ...Base-BF16, выполнить continued pretraining на очищенном русском корпусе, затем SFT и preference tuning. Это значительно дороже и сложнее обычной LoRA.
Мой вывод: для этого проекта я бы начинал не с полного continued pretraining, а с официального Nemotron LoRA-рецепта + 100–300 тыс. тщательно отобранных русских диалогов, сохраняя смешанный русский/английский набор. У модели уже достаточно русской основы; основной пробел находится именно в post-training.
Victor@yukhneuski, спасибо, расскажи плз потом, как получилось?
если начну и до чего-то дойду, то расскажу
id 2073009243+ Надо понимать насколько претрейн знает русский, чтобы был смысл учить
Понять бы честные ли метрики, сколько юзеров, на чем мерили
MilanaПонять бы честные ли метрики, сколько юзеров, на чем мерили
Эт правда, а то у них ридми очень маркетинговый
Ссылка
нажмите — покажем
нажмите — покажем
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
30.8K · Фотография
нажмите — покажем
нажмите — покажем
До краха ИИ-пузыря осталось 272 дня: появилися сайт, который ведет обратный отсчет с помощью Gemini.
Проект анализирует все новости рынка нейронок и считает дату до конца этого бума. Текущий прогноз — 4 сентября 2026 года.
Авторы говорят, что проект сатирический. Но после роста цен на оперативку и SSD хочется верить в такой прогноз.
190.8K · id 1624638733До краха ИИ-пузыря осталось 272 дня: появилися сайт, который ведет обратный отсчет с помощью Gemini.
Проект анализирует все новости рынка нейронок и считает дату до конца этого бума. Текущий прогноз — 4 сентября 2026 года.
Авторы говорят, что проект сатирический. Но после роста цен на оперативку и
oai вроде как сильно убыточны, при этом в плане кода клод и китайцы (zai) дают такого же уровня качество модели, но не несут такие расходы.
реклама вроде тож не принесла окуп. а гугл у всех был по дефолту на телефонах и пк и прост добавил где людям надо аи фичи. кароч одни плюсы заимел, вероятно без сильных расходов. ну а по коду лучший клод и с этим вряд ли кто-то поспорит. при этом, oai слишком много на себя берут и без отказа от высокого уровня цензуры норм качество моделей сложно получить (как показывают тесты расцензуривания всяких гемм дающие веский прирост по метрикам).
а еще, рост размера модели качественно ума не добавляет особо и от безысходности тут помогает агентный рой как фича чуть бустануть метрики. но agi она не делает.
кароч, нет уник продукта, а расходы геометрически растут.
поэтому, ожидания закрытия оных как будто выглядит вполне правдоподобным. более реально покупка их nvidea или ms или маском, нежели какой-то новый уникальный продукт, который вытянет кампанию из таких огромных долгов.
с другой стороны, по SpaceX много кто ставил очко на закрытие. играл и проиграл. а маск триллионер. но на то он и мак)