Technique17 mars 20263 min de lecture

Pourquoi les agents multimodaux ont besoin d'une architecture différente de celle uniquement vocale

Vous ne pouvez pas ajouter de vidéo à un pipeline vocal et l’appeler multimodal. Les véritables agents multimodaux nécessitent un traitement parallèle, un raisonnement unifié et un environnement d'exécution conçu pour le changement de modalité.

Un agent vocal a un pipeline linéaire : entrée audio → ASR → LLM → TTS → sortie audio. Un agent multimodal exécute des flux parallèles : entrée audio + images vidéo → ASR + modèle de vision → raisonnement LLM unifié → TTS + sortie visuelle optionnelle. La différence n’est pas additive, elle est architecturale. Le système doit décider, à chaque instant, quelle modalité donner la priorité, comment fusionner les entrées des différents sens et comment répartir les calculs entre les flux.

Fusion de modalités, pas changement de modalité

Un système multimodal naïf passe d'un mode à l'autre : soit il écoute, soit il regarde. Un système multimodal approprié fusionne les entrées : l'agent entend le client dire « celui-ci est cassé » tout en le voyant simultanément pointer un élément spécifique à l'écran. Le mot « ce » ne se résout qu'avec un contexte visuel. Cette résolution multimodale nécessite un modèle de raisonnement qui prend en compte les deux entrées simultanément et non séquentiellement.

Transitions modales fluides

L'agent démarre comme un appel vocal. Le client a besoin d'aide pour naviguer dans son compte, l'agent propose donc le partage d'écran. Maintenant c'est voix + partage d'écran. Le client montre un document devant la caméra : c'est désormais voix + vision. Ces transitions doivent être transparentes du point de vue de l'utilisateur et du point de vue de l'agent. L'état, le contexte et le personnage de la conversation sont transmis aux changements de modalité sans redémarrage. Cela nécessite un environnement d'exécution de session unifié, et non des services voix et vidéo séparés assemblés ensemble.

Prêt à construire ?

Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.

Pourquoi les agents multimodaux ont besoin d'une architecture différente de celle uniquement vocale | Mazed Blog | Mazed