Видео
4865fc104b44467a7093ce767f07cdbd_452337_1774701864.mp4 · 24.1 МБ · нажмите — покажем
4865fc104b44467a7093ce767f07cdbd_452337_1774701864.mp4 · 24.1 МБ · нажмите — покажем
📢 Mistral выпустили Voxtral TTS - open-weight голосовую модель, которая метит в уровень ElevenLabs, но без платных ограничений
Главное:
- всего ~3B параметров - работает даже на ноутбуке
- скорость ~6x быстрее реального времени
- ~90 мс до первого звука
- ~3GB RAM после квантования
- 9 языков + клонирование голоса по 5 секундам аудио (даже между языками)
Как работает:
- 3.4B - понимает текст и планирует речь
- 390M - отвечает за ритм, произношение, интонацию
- 300M - превращает всё в финальный аудио сигнал
Такое разделение ускоряет модель и делает её легче, чем один большой монолит
По тестам:
- 62.8% предпочли её ElevenLabs Flash (дефолтные голоса)
- 69.9% - на кастомных голосах
https://mistral.ai/news/voxtral-tts
🐍 Python полезные ресурсы ( ) ()
@Python_Community_ru
1K ·