O pipeline em tempo real: como o áudio se torna uma resposta do agente
Do microfone ao alto-falante em menos de 500 ms. Um passo a passo simplificado do pipeline do agente de voz — o que acontece em cada estágio e onde a latência se esconde.
Quando um chamador fala com um agente de voz, suas palavras passam por um processo de transformações antes de ouvir uma resposta. Compreender esse pipeline é essencial para diagnosticar a latência, escolher os modelos certos e saber onde otimizar.
As cinco etapas
- Captura e transporte de áudio — a voz do chamador é capturada pelo microfone, codificada e transmitida ao servidor do agente. Por PSTN (telefone), isso adiciona 50–150 ms. Por WebRTC (navegador), 20–50 ms.
- Reconhecimento de fala (ASR) — o fluxo de áudio é transcrito para texto. O streaming ASR começa a ser transcrito conforme o chamador fala, produzindo resultados parciais. A transcrição final acontece no final do enunciado. Orçamento: 100–300ms.
- Raciocínio do modelo de linguagem (LLM) — o texto transcrito mais o contexto da conversa são enviados ao LLM para geração de resposta. A inferência de streaming começa a produzir tokens imediatamente. Orçamento: 200–600ms para o primeiro token.
- Síntese de fala (TTS) — a saída de texto do LLM é convertida em áudio. O streaming TTS começa a gerar áudio a partir dos primeiros tokens sem esperar pela resposta completa. Orçamento: 100–200 ms para o primeiro trecho de áudio.
- Entrega de áudio — o áudio sintetizado é transmitido de volta para o dispositivo do chamador. Mesma latência de transporte da etapa 1.
Streaming é a otimização chave
Sem streaming, cada etapa espera que a anterior termine completamente. Latência total: 1,5–3 segundos. Intolerável. Com o streaming, cada estágio processa de forma incremental: o ASR envia transcrições parciais para o LLM, o LLM transmite tokens para o TTS, o TTS transmite áudio para o chamador. A latência efetiva cai para 400–700 ms – rápido o suficiente para que a conversa pareça natural. É por isso que existem plataformas criadas especificamente para áudio em tempo real: a orquestração do streaming é a parte mais difícil.
Pronto para construir?
Veja como os agentes de IA multimodais da Mazed funcionam para o seu caso de uso.