output
Словарь ↗Речь-в-речь (Speech-to-Speech)
Речь-в-речь генерирует звучащую речь напрямую из произнесённого ввода — вы говорите, система отвечает голосом — без того, чтобы кто-то видел промежуточный текст. Она обслуживает два крупных сценария: голосовые агенты реального времени, которые слушают и отвечают в разговорной манере, и перевод речи, принимающий английское аудио и возвращающий испанское, порой сохраняя интонацию говорящего. Раньше это была цепочка из speech-to-text, LLM и затем text-to-speech; новые сквозные модели (например, SeamlessM4T от Meta или голосовые API реального времени) сокращают задержку, минуя текстовый круг. Для SaaS-разработчиков речь-в-речь — это способ добавить в продукт естественный голосовой интерфейс: линии поддержки, языковые репетиторы, инструменты доступности. Практическая заметка: задержка — решающая метрика; всё, что превышает примерно секунду, разрушает иллюзию разговора, поэтому закладывайте потоковую передачу, обработку перебиваний («barge-in») и сетевой джиттер. Конвейеры проще отлаживать, а сквозные модели ощущаются человечнее.
Похожие термины