Технічне10 березня 2026 р.3 хв читання

Конвеєр реального часу: як аудіо стає відповіддю агента

Від мікрофона до динаміка менш ніж за 500 мс. Спрощений огляд конвеєра голосового агента — що відбувається на кожному етапі та де ховається затримка.

Коли абонент розмовляє з голосовим агентом, його слова проходять через конвеєр перетворень, перш ніж вони почують відповідь. Розуміння цього конвеєра має важливе значення для діагностики затримки, вибору правильних моделей і знання того, де оптимізувати.

П'ять етапів

  1. Захоплення та транспортування аудіо — голос абонента захоплюється мікрофоном, кодується та передається на сервер агента. Через PSTN (телефон) це додає 50–150 мс. Через WebRTC (браузер), 20–50 мс.
  2. Розпізнавання мови (ASR) — аудіопотік транскрибується в текст. Потоковий ASR починає транскрибування, коли абонент говорить, створюючи часткові результати. Остаточна транскрипція відбувається в кінці висловлювання. Бюджет: 100–300 мс.
  3. Обґрунтування мовної моделі (LLM) — транскрибований текст і контекст розмови надсилаються до LLM для створення відповіді. Потоковий висновок негайно починає створювати токени. Бюджет: 200–600 мс для першого токена.
  4. Синтез мовлення (TTS) — вихідний текст LLM перетворюється на аудіо. Потоковий TTS починає генерувати аудіо з перших токенів, не чекаючи повної відповіді. Бюджет: 100–200 мс для першого аудіофрагмента.
  5. Доставка аудіо — синтезований аудіо передається назад на пристрій абонента. Та сама затримка транспортування, що й на кроці 1.

Потокове передавання – це ключова оптимізація

Без потокової передачі кожен етап очікує повного завершення попереднього. Загальна затримка: 1,5–3 секунди. Нестерпний. За допомогою потокової передачі кожен етап обробляється поступово: ASR надсилає часткові транскрипції до LLM, LLM передає маркери до TTS, TTS передає аудіо абоненту. Ефективна затримка падає до 400–700 мс — достатньо швидко, щоб розмова виглядала природно. Ось чому існують платформи, спеціально створені для аудіо в реальному часі: оркестровка потокового передавання – це складна частина.

Готові створювати?

Подивіться, як мультимодальні ШІ-агенти Mazed працюють для вашого випадку використання.

Конвеєр реального часу: як аудіо стає відповіддю агента | Mazed Blog | Mazed