Ответсообщение недоступно
Ссылка
нажмите — покажем
нажмите — покажем
Да. Готового общепризнанного Nemotron-3-Nano-30B-A3B-Russian я не нашёл, но есть официальный рецепт дообучения именно этой модели и несколько хорошо документированных русскоязычных проектов, чью методику можно перенести.
Важная особенность Nemotron 3 Nano: в предобучении уже было около 185 млрд русских токенов, поэтому модель знает русский на базовом уровне. Но русский не участвовал в основном post-training/instruction-tuning — там использовались английский, немецкий, испанский, французский, итальянский и японский. Отсюда типичная картина: русский текст модель понимает, но стиль, следование инструкциям, reasoning и tool calling на русском могут быть заметно хуже. Это прямо следует из [официальной карточки модели](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16).
### Примеры именно для Nemotron 3 Nano
NVIDIA опубликовала:
- [Полный SFT-рецепт Nemotron 3 Nano](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/nemotron/nemotron_nano_v3_hellaswag.yaml).
- [LoRA/PEFT-рецепт этой же модели](https://github.com/NVIDIA-NeMo/Automodel/blob/main/examples/llm_finetune/nemotron/nemotron_nano_v3_hellaswag_peft.yaml). В нём уже учтена особенность гибридной Mamba/MoE-архитектуры: *.out_proj исключён из LoRA.
- [End-to-end пример LoRA для Text2SQL](https://docs.nvidia.com/nemotron/latest/use-case-examples/sql-lora-finetuning-and-deployment/README.html) с подготовкой chat-датасета, обучением и последующим запуском через vLLM/NIM.
- [Документацию NeMo AutoModel по SFT, LoRA и QLoRA](https://docs.nvidia.com/nemo/automodel/latest/recipes-e2e-examples/sft-peft).
То есть для русского можно взять официальный PEFT YAML и заменить HellaSwag на русскоязычный chat-датасет. Это наиболее безопасная стартовая точка.
### Наиболее полезные русскоязычные аналоги
| Проект | Метод | Что можно перенести |
|---|---|---|
| [Saiga](https://github.com/IlyaGusev/saiga) | SFT/LoRA различных Llama-подобных моделей | Подготовка русских многоходовых диалогов, маскирование пользовательских токенов, воспроизводимые train-конфиги |
| [Vikhr](https://arxiv.org/abs/2405.13929) | Адаптация токенизатора → continued pretraining → full-weight instruction tuning | Более глубокая языковая адаптация, когда одного SFT недостаточно |
| [Vikhr-Nemo 12B](https://huggingface.co/Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24) | Русский SFT на 150 тыс. инструкций → preference tuning/SMPO | Хороший практически описанный пример адаптации уже сильной instruct-модели под русский |
Для Nemotron расширять токенизатор, вероятно, не потребуется: он уже обучался на значительном русском корпусе. Это отличает его от ранних Llama-моделей, для которых неэффективная русская токенизация была отдельной проблемой. Сначала стоит измерить число токенов на русских текстах и качество baseline.
### Какие данные подходят
Из доступных наборов я бы рассматривал:
- [T-Wix](https://huggingface.co/datasets/t-tech/T-Wix): около 469 тыс. general SFT-примеров и 31 тыс. reasoning-примеров, с дедупликацией и фильтрацией качества.
- [RuTurboAlpaca](https://huggingface.co/datasets/IlyaGusev/ru_turbo_alpaca): около 30 тыс. примеров. Полезен как часть смеси, но карточка сообщает, что только около 68% проверенных пар одновременно имели корректные инструкцию и ответ — нужна дополнительная фильтрация.
- Датасеты и пайплайн из Saiga.
- Собственные качественные диалоги целевого домена.
Для голосового leasing-агента я бы не ограничивался общим русским SFT. Значительная часть обучающей смеси должна содержать:
- короткие разговорные ответы без Markdown;
- естественные падежи чисел, дат, адресов и денежных сумм;
- многоходовые диалоги с перебиваниями и исправлениями;
- русский tool calling;
- транскрипционные ошибки, характерные для STT;
- корректные отказы от выдумывания фактов;
- завершение звонка и передачу оператору.
### Практически рекомендуемый путь
1. Сначала прогнать исходную Nemotron на русской части [MERA](https://github.com/ai-forever/mera) и на собственных сценариях. Без baseline нельзя понять, улучшило ли обучение русский или просто изменило стиль.