در ادامه آموزش مدلهای مختلف برای زبان فارسی، نوبت رسید به آموزش مدل فارسی تبدیل گفتار به متن یا STT.
مدل جدید تشخیص گفتار فارسی، رایگان و متنباز که آموزش دادم.
مدل تبدیل گفتار به متن Nemotron 3.5 انویدیا
@NVIDIAAI
زبانهای زیادی را پشتیبانی میکند، اما فارسی جزو آنها نبود. آن را روی ۱٬۱۸۱ ساعت گفتار فارسی آموزش دادم و حالا بهصورت رایگان و متنباز منتشرش کردهام.
تا جایی که میدانم، این دقیقترین مدل متنباز تشخیص گفتار فارسی است: خطای کلمه روی FLEURS ۸٫۸٪، در برابر ۱۰٫۶٪ برای «شنوا»، قویترین مدل متنباز فارسی پیش از این.
ویدیوی زیر را با صدا گوش بدید که توش کامل توضیح دادم.👇
- تبدیل زندهی گفتار به متن: همانطور که حرف میزنید متن نوشته میشود، با تأخیری حدود ۰٫۳ تا ۱ ثانیه
- تبدیل فایلهای صوتی
- در مقایسه با مدل فارسی قبلی انویدیا، خطا روی FLEURS از ۲۴٫۲٪ به ۸٫۸٪ رسید
- روی گفتار محاورهای (یوتیوب، فیلم و سریال) خطا تقریباً نصف شد: ۲۶٪ در برابر ۵۴٪
- روی لپتاپ هم اجرا میشود: حدود ۱۰ برابر سریعتر از زمان واقعی روی مک M1
- با NeMo و Hugging Face Transformers کار میکند
یک اپ ساده هم گذاشتهام که میتوانید با میکروفون خودتان امتحانش کنید.
ریپو را ستاره بدید اگه دوست داشتید.
مدل:
https://huggingface.co/mehdi-hf/nemotron-asr-streaming-farsi
آموزش و اجرا:
https://github.com/mallahyari/nemotron-asr-streaming-farsi