Latence de l'agent vocal AI : quelles en sont les causes et comment la réduire
Une latence supérieure à 800 ms rend les conversations robotiques. Voici ce qui contribue au retard des agents vocaux et des stratégies pratiques pour réduire les temps de réponse en dessous de 500 ms.
Dans une conversation humaine, l'écart entre une personne qui termine et l'autre qui répond est généralement de 200 à 400 ms. Lorsqu'un agent IA prend 800 ms ou plus, la conversation semble lente. Les appelants commencent à parler par l'intermédiaire de l'agent, créant une cascade d'interruptions et de chevauchements gênants. La latence n’est pas un avantage : c’est la différence entre une conversation naturelle et une conversation manifestement robotique.
D'où vient la latence
- Reconnaissance vocale (ASR) : 100 à 300 ms pour transcrire le discours de l'appelant
- Inférence LLM : 200 à 800 ms pour que le modèle génère une réponse (très variable selon la taille du modèle et la longueur de l'invite)
- Synthèse vocale (TTS) : 100 à 200 ms pour synthétiser le premier morceau audio
- Aller-retours réseau : 50 à 150 ms par saut entre les services
- Exécution des actions : 100 à 500 ms+ pour les appels d'API vers des systèmes externes (recherches CRM, vérifications de calendrier)
Stratégies de réduction
- Réponses en continu : démarrez TTS dès que les premiers jetons arrivent du LLM, plutôt que d'attendre la réponse complète. Il s’agit du plus gros gain de latence.
- Sélection de modèles : utilisez des modèles plus rapides pour les interactions simples et réservez des modèles plus grands pour les raisonnements complexes. Différents types d'appels peuvent utiliser différents modèles.
- Optimisation des invites : des invites système plus courtes réduisent le temps d'inférence. Supprimez les instructions inutiles.
- Déploiement Edge : placez les serveurs ASR et TTS géographiquement proches de vos appelants.
- Prélecture : si l'agent peut prédire les prochaines étapes probables, pré-récupérez les données avant que l'appelant ait fini de parler.
- Regroupement de connexions : maintenez des connexions persistantes aux fournisseurs LLM et TTS plutôt que d'en établir de nouvelles par demande.
Mesurer correctement la latence
Mesurez de bout en bout : depuis le moment où l'appelant arrête de parler jusqu'au moment où il entend le premier mot de la réponse. C'est le nombre qui détermine la qualité perçue. Mesurer la latence d'un composant individuel est utile pour le débogage mais trompeur pour évaluer l'expérience. Fixez un objectif inférieur à 500 ms pour la réponse au premier mot sur les interactions standard.
Prêt à construire ?
Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.