Ищем тех, кто делает speech руками
11 декабря пройдет SpeechConf’26 — онлайн-конференция о речевых технологиях. И сейчас мы собираем программу.
Если вы работаете с ASR или TTS, собираете речевые датасеты, оптимизируете инференс, запускаете голосовые продукты или просто однажды потратили неделю на эксперимент, который красиво выглядел только в README, — приходите со своим кейсом.
Нам интересны не обзорные доклады про «куда движется AI», а конкретный опыт:
— что сделали и зачем;
— что получилось в цифрах;
— что неожиданно сломалось;
— какие решения пришлось переделать;
— какой вывод может сэкономить другим несколько недель работы.
Не обязательно быть опытным спикером и приходить с готовой презентацией. Для заявки достаточно идеи и пары предложений о том, что хотите рассказать. С выбранными спикерами поможем собрать структуру доклада и проведем репетицию.
Подробнее → speechconf.ru
Оставить заявку → Анастасии
Всегда интересно, когда делают программу на Воске. Не пожалейте плюс в карму
Как я научил пип‑бой принимать голосовые команды
https://habr.com/ru/articles/1077744/
Есть аналогичные 4mic круговые от HAOKAI и SiPeed. Вторые явная копия на seedstudio. Цены ниже на 25 и 30% соответственно. Не говоря о том что даже те излишне функциональны.
Вот такого решения в 4 раза дешевле будет достаточно.
https://www.linkedin.com/feed/update/urn:li:activity:7500799549712580608/
В ForteBank мы активно развиваем AI-направление и сейчас ищем ASR и TTS решения
Главный акцент - казахский язык. Нужно качество на живой разговорной речи: смешанный казахско-русский, банковская лексика, имена, числа и суммы. Русский, Английский - на том же уровне
Что ещё смотрим:
- задержку и стабильность под нагрузкой
- возможность развернуть в контуре банка (on-prem)
- поддержку стриминга
- естественность голоса в TTS
Если у вас есть такое решение - пишите в Telegram: @akoshkimbay
Большая просьба: сразу присылайте демо. Ссылку на сайт, где можно попробовать самому, аудиозаписи, любой доступный тест-режим. Хочу сначала послушать результат, а обсуждать всё остальное уже после этого.
Рассматриваем и зрелые продукты, и команды, которые сильны именно в этой задаче
🎤Анонс докладов на AsterConf 2026
Голосовой AI в реальном мире: задержки, перебивания и другие грабли
Описание
Практический разбор разработки голосового AI-оператора с архитектурой:
MTT/Exolve → Asterisk → AudioSocket → STT → LLM → TTS
На примере работающего проекта расскажу, как мы создавали роботов для холодного обзвона на базе локального AI и масштабировали систему до 30+ одновременных разговоров.
Поговорим о том, как боролись с задержкой голоса, шумами и перебиваниями, снижали нагрузку на серверы, выбирали LLM и настраивали промты. Отдельно разберём решения, которые хорошо выглядели на бумаге, но не выдержали реальной эксплуатации, и подходы, которые сначала казались «костылями», но в итоге помогли довести проект до продакшена.
Также расскажу, как полученный опыт мы использовали при создании IP-звонилки для Windows с AI-суфлёром для менеджеров продаж.
Тезисы
- Архитектура голосового AI-оператора: от телефонии до STT, LLM и TTS.
- Как уменьшить задержки, бороться с перебиваниями и шумами.
- Как выбирать LLM и настраивать промты без потери скорости.
- Как снизить нагрузку на серверы при 30+ одновременных разговорах.
- Какие решения сработали в продакшене, а какие пришлось отбросить.
- Почему временные «костыли» иногда оказываются лучшим практическим решением.
Купить билет пока можно по цене прошлого года
xVibePocketTTS v0.1.0
Обещал отдать модельку на публичное растерзание - держите
Как оно обучалось и что получилось:
https://t.me/xVibeNot/96
Если пропустили: full finetune Pocket TTS от Kyutai на русский. Около 90M параметров, клонирование голоса по короткому референсу и синтез быстрее реалтайма даже на CPU.
В репо собрал все для запуска:
- Локальная веб-морда, cli и api
- Потоковая генерация
- RUAccent для автоматических ударений
- Три готовых голоса и WAV для примера клонирования
Ручные ударения тоже работают: з+амок и зам+ок.
CPU и GPU отдельно проверил, даже запускается)
Кто не хочет ничего ставить - есть демка с загрузкой своего голоса.
Пробуйте, кидайте примеры.
Особенно где получилось криво - интересно посмотреть, на чем ломается.
Github:
https://github.com/GenVoice/xVibePocketTTS
HF:
https://huggingface.co/genvoice/xVibePocketTTS
HF демка:
https://huggingface.co/spaces/Brakanier/xVibePocketTTS
tl;dr: Senior ML Engineers (TTS or ASR), Python / C++, $80k-150k/year + equity, remote
Вас тоже бесит, что в русском кино все вечно бормочут, хоть субтитры включай? Скоро их получится нормально переозвучить 🎞
На самом деле, Palabra разрабатывает AI для синхронного перевода созвонов, стримов и вебинаров, который сохраняет оригинальный голос. Но кто нам запретит?
🐗 Деньги есть, речь идет о семизначных цифрах. А именно — $8.4M с пресида; среди инвесторов: фонд сооснователя Реддита, бывший руководитель продукта в DeepMind и ранний бэкер ElevenLabs.
🔉 Что делает TTS Engineer:
‣ Обучает собственную TTS-модель на кластерах H100;
‣ Разрабатывает zero-shot клонирование голоса между языками;
‣ Снижает задержку стриминга для realtime-перевода (недавно модель была №1 по минимальной задержке, сейчас №2 по скорости синтеза).
🎤 Что делает ASR Engineer:
‣ Строит speech-to-text модели;
‣ Улучшает конвейер перевода speech-to-speech.
От обоих ждут:
🧙+ лет опыта ML-инженером (конкретно для TTS важно 3+ в speech tech);
💅 Hands-on опыт с LLM;
🎓 Степень в CS или смежной области.
Обещают $80k-150k/year + equity, никуда не перевозят, зато в команде один из авторов ReDimNet.
В любое время дня и ночи: @skaterina_64 🦉
Стартуем наше ежегодное исследование дата-специалистов!
Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:
🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.
🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.
📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.
💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.
И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов
⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре
👉 https://survey.devcrowd.ru/data-2026
🔁 Пересылайте коллегам из data-направления - добавим больше данных!
Привет, комьюнити! До Conversations ровно 2 месяца! И у нас к вам два дела. Одним как раз можно заняться на выходных!
😱 Дело № 1. Опен-колл для спикеров продлен
В последний день перед дедлайном нас накрыла лавина заявок, и мы решили — гулять так гулять.🕙 Ждем заявок от опаздывающих до 11 октября (это воскресенье). Если вы не успели, шанс все еще есть. Программный комитет разбирает ваши питчи не покладая рук. Несколько слотов в программе еще ждут своих героев!
❗️ Дело № 2. Разыгрываем билет!
Те из вас, кто бывал или регулярно бывает на Conversations, знают, как трепетно мы относимся к качеству контента и подбору спикеров и докладов ✅✅❎ Мы держим руку на пульсе генеративного AI, но... знаем, что и вы тоже!
Конференций, митапов, вебинаров по AI проходит миллион. Расскажите, как вы решаете, на какое событие действительно стоит потратить время?
Мы составили удобный опросник (клик сюда). Поделитесь мнением — какие задачи и вопросы про GenAI волнуют вас прямо сейчас? Кого / о чем вам хотелось бы послушать?
🌟 Между теми, кто ответит на все четыре вопроса (по возможности подробно), 12 октября мы разыграем 1️⃣ офлайн-билет и 2️⃣ онлайн-билета на зимнюю Conversations! 🌟
Погнали!
Коллега по предыдущей работе Саша опубликовал свой замечательный инструмент анализа качества распознавания и датасет аудио в телефонном канале, а также сравнение нескольких открытых моделей на этом датасете!
Инструмент крутой, нам очень помогал анализировать что конкретно происходит и показывать нашим потребителям. И хабростатья, кмк, хорошая получилась.