Веб-версияОткрыть в Telegram

Пост🌟 Step-Audio: платформа интеллектуального речевого взаимодействия.

18 февраля 2025
G
Github
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
🌟 Step-Audio: платформа интеллектуального речевого взаимодействия. Step-Audio – платформа с открытым исходным кодом, объединяющая понимание и генерацию речи для поддержки мультиязычных диалогов (китайский, английский и японский). Step-Audio способна передавать эмоциональные оттенки, региональные диалекты, различные стили речи и вокала. Основой Step-Audio является 130B мультимодальная модель, которая объединяет в себе функции распознавания и генерации речи, семантического понимания, ведения диалога, клонирования голоса и синтеза речи. Важным компонентом является собственный токенизатор, позволяющий создавать высококачественный звук без традиционного сбора данных вручную. ▶️ Состав релиза: Step-Audio-Tokenizer - токенизатор речи. Для лингвистической токенизации используется кодер Paraformer, который квантуется в дискретные представления с частотой 16,7 Гц. Для семантической токенизации - токенизатор CosyVoice, специально разработанный для эффективного кодирования характеристик, необходимых для создания естественных и выразительных речевых результатов, работающий на частоте 25 Гц. Step-Audio-Chat - мультимодальная LLM с 130 млрд. параметров, которая отвечает за понимание и генерацию человеческой речи. Step-Audio-TTS-3B - TTS-модель, обученная на крупном синтетическом наборе данных с использованием парадигмы LLM-Chat. Модель поддерживает несколько языков, множество эмоциональных выражений и различные элементы управления стилем голоса. Step-Audio-TTS-3B является первой открытой TTS-моделью, способной генерировать певческий вокал. StepEval-Audio-360 - датасет, собранный при участии профессиональных аннотаторов и содержит весь спектр возможностей: пение, творчество, ролевые игры, логические рассуждения, понимание голоса, следование голосовым инструкциям, игры, управление речевыми эмоциями и языковые способности на китайском, английском и японском языках. ⚠️ Для локального использования понадобится (41.6Гц): Step-Audio-Tokenizer - 1.5 GB VRAM, Step-Audio-Chat - 256 GB VRAM, Step-Audio-TTS-3B - 8GB VRAM. ⚠️ Наиболее качественный инференс, по словам разработчиков, достигается на 4xA800/H800 GPU с 80GB или больше. ▶️Локальная установка и инференс на примере TTS: # Clone the repository git clone https://github.com/stepfun-ai/Step-Audio.git # Create a Conda venv conda create -n stepaudio python=3.10 conda activate stepaudio # Install dependencies cd Step-Audio pip install -r requirements.txt git lfs install git clone https://huggingface.co/stepfun-ai/Step-Audio-TTS-3B # TTS inference python tts_inference.py --model-path --output-path --synthesis-type use_tts_or_clone 📌Лицензирование: Apache 2.0 License. 🟡Коллекция на HF 🟡Техотчет 🖥GitHub @ai_machinelearning_big_data #AI #ML #ASR #TTS #StepAudio
18 · 2.1K ·

Рядом в ленте

GGithub🌟 Oumi: опенсорс-фреймворк полного цикла для LLM. Oumi - открытая платформа для разработки, файнтюна, оценки и экспериментов с языковыми и мультимодальными модеGGithub⭐️ Podcastfy — это open-source инструмент, который преобразует текстовый контент в аудио подкасты с использованием синтеза речи. Он позволяет легко создавать ау
это сообщение
GGithub✔️ GitHub Copilot для Xcode запущен для публичного тестирования. GitHub Copilot для Xcode Chat стал доступен для публичного превью. Для начала работы достаточноGGithub🔥 Это — подробное руководство по использованию GitHub Actions для автоматизации процессов разработки, таких как сборка, тестирование и деплой приложений! 🔗 Ссыл
GGithubGithub@github_code · канал · Технологии
2 540подписчиков369постов в индексе
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем