Веб-версияОткрыть в Telegram
РРаспознавание и синтез речи

Распознавание и синтез речи

@speechtech_ru · канал · Технологии · в индексе с 2026-06-18
97подписчиков
374средний охват поста
13постов за 30 дней
160постов в индексе
Р
Распознавание и синтез речи
Фотография
нажмите — покажем
Ищем тех, кто делает speech руками 11 декабря пройдет SpeechConf’26 — онлайн-конференция о речевых технологиях. И сейчас мы собираем программу. Если вы работаете с ASR или TTS, собираете речевые датасеты, оптимизируете инференс, запускаете голосовые продукты или просто однажды потратили неделю на эксперимент, который красиво выглядел только в README, — приходите со своим кейсом. Нам интересны не обзорные доклады про «куда движется AI», а конкретный опыт: — что сделали и зачем; — что получилось в цифрах; — что неожиданно сломалось; — какие решения пришлось переделать; — какой вывод может сэкономить другим несколько недель работы. Не обязательно быть опытным спикером и приходить с готовой презентацией. Для заявки достаточно идеи и пары предложений о том, что хотите рассказать. С выбранными спикерами поможем собрать структуру доклада и проведем репетицию. Подробнее → speechconf.ru Оставить заявку → Анастасии
20 · 720 ·
Распознавание и синтез речи
Всегда интересно, когда делают программу на Воске. Не пожалейте плюс в карму Как я научил пип‑бой принимать голосовые команды https://habr.com/ru/articles/1077744/
2 · 552 ·
говорят есть такие микрофоны, интересные
1 · 472 ·
Фотография
нажмите — покажем
Есть аналогичные 4mic круговые от HAOKAI и SiPeed. Вторые явная копия на seedstudio. Цены ниже на 25 и 30% соответственно. Не говоря о том что даже те излишне функциональны. Вот такого решения в 4 раза дешевле будет достаточно.
4 · 460 ·
【淘宝】https://e.tb.cn/h.8Mh2n5TNEwjqn2m?tk=opVETUr2Ujk CZ356 「USB 数字4阵列AI 降噪算法 远场拾音模组PCBA大模型语音拾取器」 点击链接直接打开 或者 淘宝搜索直接打开 【淘宝】7天无理由退货 https://e.tb.cn/h.8N23mOb95dGuIiC?tk=ND0ITUr3tjt HU926 「Sipeed 6+1Mic Array麦克风阵列 声源定位 波束成形 USB 免驱声卡」 点击链接直接打开 或者 淘宝搜索直接打开 【淘宝】假一赔四 https://e.tb.cn/h.8nddd13thqkSi0N?tk=0My1TUr3uHE HU293 「HAOKAI 声源定位麦适用于虚拟人智能交互服务机器人智能音箱设备」 点击链接直接打开 或者 淘宝搜索直接打开
3 · 465 ·
Р
Ссылка
нажмите — покажем
https://www.linkedin.com/feed/update/urn:li:activity:7500799549712580608/ В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же уровне Что ещё смотрим: - задержку и стабильность под нагрузкой - возможность развернуть в контуре банка (on-prem) - поддержку стриминга - естественность голоса в TTS Если у вас есть такое решение - пишите в Telegram: @akoshkimbay Большая просьба: сразу присылайте демо. Ссылку на сайт, где можно попробовать самому, аудиозаписи, любой доступный тест-режим. Хочу сначала послушать результат, а обсуждать всё остальное уже после этого. Рассматриваем и зрелые продукты, и команды, которые сильны именно в этой задаче
11 · 611 ·
Р
Распознавание и синтез речи
Ссылка
нажмите — покажем
Ещё одно интересное приложение с использованием Воска, не решающее, конечно, проблемы https://github.com/qwertyzipe/SwearBeeper
3 · 616 ·
Распознавание и синтез речи
Фотография
нажмите — покажем
🎤Анонс докладов на AsterConf 2026 Голосовой AI в реальном мире: задержки, перебивания и другие грабли Описание Практический разбор разработки голосового AI-оператора с архитектурой: MTT/Exolve → Asterisk → AudioSocket → STT → LLM → TTS На примере работающего проекта расскажу, как мы создавали роботов для холодного обзвона на базе локального AI и масштабировали систему до 30+ одновременных разговоров. Поговорим о том, как боролись с задержкой голоса, шумами и перебиваниями, снижали нагрузку на серверы, выбирали LLM и настраивали промты. Отдельно разберём решения, которые хорошо выглядели на бумаге, но не выдержали реальной эксплуатации, и подходы, которые сначала казались «костылями», но в итоге помогли довести проект до продакшена. Также расскажу, как полученный опыт мы использовали при создании IP-звонилки для Windows с AI-суфлёром для менеджеров продаж. Тезисы - Архитектура голосового AI-оператора: от телефонии до STT, LLM и TTS. - Как уменьшить задержки, бороться с перебиваниями и шумами. - Как выбирать LLM и настраивать промты без потери скорости. - Как снизить нагрузку на серверы при 30+ одновременных разговорах. - Какие решения сработали в продакшене, а какие пришлось отбросить. - Почему временные «костыли» иногда оказываются лучшим практическим решением. Купить билет пока можно по цене прошлого года
12 · 450 ·
xVibePocketTTS v0.1.0 Обещал отдать модельку на публичное растерзание - держите Как оно обучалось и что получилось: https://t.me/xVibeNot/96 Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU. В репо собрал все для запуска: - Локальная веб-морда, cli и api - Потоковая генерация - RUAccent для автоматических ударений - Три готовых голоса и WAV для примера клонирования Ручные ударения тоже работают: з+амок и зам+ок. CPU и GPU отдельно проверил, даже запускается) Кто не хочет ничего ставить - есть демка с загрузкой своего голоса. Пробуйте, кидайте примеры. Особенно где получилось криво - интересно посмотреть, на чем ломается. Github: https://github.com/GenVoice/xVibePocketTTS HF: https://huggingface.co/genvoice/xVibePocketTTS HF демка: https://huggingface.co/spaces/Brakanier/xVibePocketTTS
6 · 171 ·
Р
Фотография
нажмите — покажем
Метрики такие
9 · 666 ·
Р
Распознавание и синтез речи
Фотография
нажмите — покажем
Suplime results on Russian telephony data, good results actually second after Diarizen Large A bit slow though
5 · 192 ·
Р
Распознавание и синтез речи
Фотография
нажмите — покажем
Потестировал Nemotron3, лучшая модель, хорошие улучшения + 8 голосов разделяет
31 · 919 ·
Р
Распознавание и синтез речи
Фотография
нажмите — покажем
Протестировал пару новых моделей для идентификации голоса на аудиокнигах https://huggingface.co/lab260/redimnet2-plus и https://huggingface.co/AntResearch/AntSpeaker В целом хорошие модели, но, как видно, всё зависит от данных, у моделей на voxblilnk2 примерно одинаковые результаты UPD: добавил число параметров для каждой модели
13 · 519 ·
Распознавание и синтез речи
tl;dr: Senior ML Engineers (TTS or ASR), Python / C++, $80k-150k/year + equity, remote Вас тоже бесит, что в русском кино все вечно бормочут, хоть субтитры включай? Скоро их получится нормально переозвучить 🎞 На самом деле, Palabra разрабатывает AI для синхронного перевода созвонов, стримов и вебинаров, который сохраняет оригинальный голос. Но кто нам запретит? 🐗 Деньги есть, речь идет о семизначных цифрах. А именно — $8.4M с пресида; среди инвесторов: фонд сооснователя Реддита, бывший руководитель продукта в DeepMind и ранний бэкер ElevenLabs.  🔉 Что делает TTS Engineer: ‣ Обучает собственную TTS-модель на кластерах H100; ‣ Разрабатывает zero-shot клонирование голоса между языками; ‣ Снижает задержку стриминга для realtime-перевода (недавно модель была №1 по минимальной задержке, сейчас №2 по скорости синтеза). 🎤 Что делает ASR Engineer: ‣ Строит speech-to-text модели; ‣ Улучшает конвейер перевода speech-to-speech. От обоих ждут: 🧙+ лет опыта ML-инженером (конкретно для TTS важно 3+ в speech tech); 💅 Hands-on опыт с LLM; 🎓 Степень в CS или смежной области. Обещают $80k-150k/year + equity, никуда не перевозят, зато в команде один из авторов ReDimNet. В любое время дня и ночи: @skaterina_64 🦉
19 · 420 ·
Фотография
нажмите — покажем
Стартуем наше ежегодное исследование дата-специалистов! Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри: 🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач. 🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей. 📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления. 💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались. И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов ⏱ Опрос займет 12–15 минут 📬 Отчет опубликуем в ноябре 👉 https://survey.devcrowd.ru/data-2026 🔁 Пересылайте коллегам из data-направления - добавим больше данных!
62 ·
Фотография
нажмите — покажем
Многие коллеги дообучают PocketTTS, xVibe пока получше, но Storm уже почти похож по характеристикам.
7 · 334 ·
Фотография
нажмите — покажем
Привет, комьюнити! До Conversations ровно 2 месяца! И у нас к вам два дела. Одним как раз можно заняться на выходных! 😱 Дело № 1. Опен-колл для спикеров продлен В последний день перед дедлайном нас накрыла лавина заявок, и мы решили — гулять так гулять.🕙 Ждем заявок от опаздывающих до 11 октября (это воскресенье). Если вы не успели, шанс все еще есть. Программный комитет разбирает ваши питчи не покладая рук. Несколько слотов в программе еще ждут своих героев! ❗️ Дело № 2. Разыгрываем билет! Те из вас, кто бывал или регулярно бывает на Conversations, знают, как трепетно мы относимся к качеству контента и подбору спикеров и докладов ✅✅❎ Мы держим руку на пульсе генеративного AI, но... знаем, что и вы тоже! Конференций, митапов, вебинаров по AI проходит миллион. Расскажите, как вы решаете, на какое событие действительно стоит потратить время? Мы составили удобный опросник (клик сюда). Поделитесь мнением — какие задачи и вопросы про GenAI волнуют вас прямо сейчас? Кого / о чем вам хотелось бы послушать? 🌟 Между теми, кто ответит на все четыре вопроса (по возможности подробно), 12 октября мы разыграем 1️⃣ офлайн-билет и 2️⃣ онлайн-билета на зимнюю Conversations! 🌟 Погнали!
1 · 61 ·
Коллега по предыдущей работе Саша опубликовал свой замечательный инструмент анализа качества распознавания и датасет аудио в телефонном канале, а также сравнение нескольких открытых моделей на этом датасете! Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.
3 · 52 ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем