Producto12 de marzo de 20263 min de lectura

Acciones en mitad de la conversación: cómo los agentes ejecutan herramientas sin interrumpir el flujo

El momento en que un agente hace una pausa para "buscar algo" es decisivo para la calidad de la conversación. Así es como funciona la ejecución de acciones sin interrumpir el flujo.

Un agente de voz que sólo puede hablar es una novedad. Un agente de voz que puede reservar citas, buscar cuentas, procesar pagos y actualizar registros en mitad de una conversación es una herramienta. El desafío: cada acción introduce latencia. Si el agente guarda silencio durante tres segundos mientras llama a una API, la persona que llama cree que la conexión se interrumpió.

El problema de la latencia con las acciones.

Una búsqueda típica de CRM tarda entre 200 y 500 ms. Una verificación de disponibilidad del calendario: 300–800 ms. Una llamada API de pago: 500-1500 ms. Durante este tiempo, la transmisión de audio permanece en silencio. Sin manipulación, la persona que llama escucha aire muerto y comienza a decir '¿Hola? ¿Está ahí?' – descarrilando la conversación.

Cómo lo maneja Agent Canvas

Los nodos de acción en Agent Canvas admiten el comportamiento de relleno mientras se ejecuta la acción. El agente dice "Déjame comprobarlo por ti" y mantiene un espacio de conversación natural con breves actualizaciones de estado mientras la llamada API se completa en segundo plano. La transmisión de audio nunca se queda en silencio. Cuando se completa la acción, el agente integra el resultado en la siguiente respuesta sin problemas. La persona que llama experimenta una pausa natural, no un tiempo de espera técnico.

Acciones paralelas vs secuenciales

Cuando el agente necesita múltiples puntos de datos (nombre del cliente de CRM + disponibilidad del calendario + saldo de la cuenta), ejecutarlos secuencialmente agrava la latencia. Agent Canvas admite la ejecución de acciones paralelas: active las tres llamadas API simultáneamente, combine los resultados y responda una vez. Esto reduce una cadena secuencial de 1,5 segundos a una ejecución paralela de 500 ms, una diferencia que la persona que llama puede sentir.

¿Listo para construir?

Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.

Acciones en mitad de la conversación: cómo los agentes ejecutan herramientas sin interrumpir el flujo | Mazed Blog | Mazed