output
Словарь ↗Синтез речи (TTS)
Синтез речи (text-to-speech, TTS) — это преобразование письменного текста в слышимую, естественно звучащую речь с использованием обученной нейросетевой модели голоса. Современный TTS (ElevenLabs, TTS API от OpenAI, Google Cloud TTS, Amazon Polly, PlayHT) далеко ушёл от роботизированного конкатенативного синтеза 2000-х годов; сегодняшние системы используют нейронные вокодеры и архитектуры на основе диффузии или трансформеров, моделирующие просодию, интонацию, дыхание и эмоциональную окраску, производя аудио, которое часто неотличимо от человеческой записи, с естественными паузами, смысловым акцентом и микровариациями высоты тона, делающими долгое прослушивание менее утомительным по сравнению со старыми роботизированными голосами. Почему это важно для создателей SaaS: TTS открывает доступность (программы для чтения с экрана, аудиоверсии статей), продукты аудиоконтента (аудиокниги и подкасты с ИИ-озвучкой, например ElevenReader), автоматизацию IVR/колл-центров и голосовой интерфейс для приложений. Это стандартный строительный блок в ботах поддержки клиентов, приложениях для изучения языков и пайплайнах генерации видео (дорожка озвучки). Интеграция почти всегда основана на API: отправляете текст плюс ID голоса и получаете обратно аудиопоток (MP3/WAV) или, для случаев с низкой задержкой вроде голосовых агентов, поток аудиочанков в реальном времени через WebSocket. Конкретный разобранный пример — добавление функции «прослушать эту статью» в блог: (1) при публикации бэкенд отправляет текстовое тело статьи (с удалённым markdown и заголовками, преобразованными в маркеры естественных пауз) в TTS API: `POST /v1/text-to-speech/{voice_id}` с телом `{"text": "...", "model_id": "eleven_multilingual_v2", "voice_settings": {"stability": 0.5, "similarity_boost": 0.75}}`; (2) API возвращает поток MP3, обычно генерируемый примерно в реальном времени плюс несколько секунд для коротких статей; (3) приложение сохраняет файл в объектном хранилище за CDN и встраивает плеер `<audio>` с элементами управления скоростью воспроизведения над статьёй; (4) для длинных статей, превышающих лимит символов на запрос API, бэкенд разбивает текст на чанки на уровне абзацев, генерирует аудио для каждого параллельно и сшивает получившиеся MP3-сегменты на стороне сервера перед кешированием финального файла, так что он генерируется только один раз на статью, а не при каждом просмотре страницы. Ключевые параметры: выбор голоса (стоковые голоса против кастомных клонированных), стабильность (компромисс между постоянством и выразительностью — более высокая стабильность звучит более монотонно, но надёжнее), скорость речи и формат вывода/частота дискретизации (44.1кГц MP3 для веб-воспроизведения против форматов с более низким битрейтом для мобильных устройств с ограниченной пропускной способностью). Задержка чрезвычайно важна для разговорных сценариев использования — пакетный TTS для статьи блога может допускать несколько секунд времени генерации, но провайдеры теперь предлагают потоковый TTS с задержкой до первого байта аудио менее 300 мс специально для голосовых агентов реального времени, где пользователь иначе воспринял бы неловкую паузу перед тем, как ИИ «начинает говорить».
Похожие термины