Le pipeline en temps réel : comment l'audio devient une réponse d'agent
Du microphone au haut-parleur en moins de 500 ms. Une présentation simplifiée du pipeline des agents vocaux : ce qui se passe à chaque étape et où se cache la latence.
Lorsqu'un appelant parle à un agent vocal, ses paroles traversent un pipeline de transformations avant d'entendre une réponse. Comprendre ce pipeline est essentiel pour diagnostiquer la latence, choisir les bons modèles et savoir où optimiser.
Les cinq étapes
- Capture et transport audio : la voix de l'appelant est capturée par son microphone, codée et transmise au serveur d'agent. Sur PSTN (téléphone), cela ajoute 50 à 150 ms. Sur WebRTC (navigateur), 20 à 50 ms.
- Reconnaissance vocale (ASR) — le flux audio est transcrit en texte. Le streaming ASR commence la transcription pendant que l'appelant parle, produisant des résultats partiels. La transcription finale a lieu à la fin de l'énoncé. Budget : 100 à 300 ms.
- Raisonnement sur le modèle linguistique (LLM) : le texte transcrit ainsi que le contexte de conversation sont envoyés au LLM pour la génération de réponses. L'inférence en streaming commence immédiatement à produire des jetons. Budget : 200 à 600 ms pour le premier jeton.
- Synthèse vocale (TTS) — la sortie texte du LLM est convertie en audio. Le streaming TTS commence à générer de l'audio à partir des premiers jetons sans attendre la réponse complète. Budget : 100 à 200 ms pour le premier morceau audio.
- Diffusion audio : l'audio synthétisé est renvoyé vers l'appareil de l'appelant. Même latence de transport qu’à l’étape 1.
Le streaming est la clé de l’optimisation
Sans streaming, chaque étape attend que la précédente se termine complètement. Latence totale : 1,5 à 3 secondes. Intolérable. Avec le streaming, chaque étape est traitée de manière incrémentale : ASR envoie des transcriptions partielles au LLM, le LLM diffuse les jetons au TTS, et le TTS diffuse l'audio à l'appelant. La latence effective tombe entre 400 et 700 ms, suffisamment rapide pour que la conversation semble naturelle. C’est pourquoi il existe des plateformes spécialement conçues pour l’audio en temps réel : l’orchestration du streaming est la partie la plus difficile.
Prêt à construire ?
Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.