Perspectivas2 de marzo de 20263 min de lectura

Deje de crear agentes de voz desde cero

Unir las API de ASR, LLM y TTS parece sencillo. En la práctica, son meses de ingeniería de casos extremos los que una plataforma maneja desde el primer día.

El argumento para crear su propio agente de voz es convincente: llame a una API de ASR, canalice el texto a un LLM, envíe la respuesta a TTS y transmita el audio. Tres llamadas API. Un proyecto de fin de semana. Luego lo intentas con una persona que te llama y descubres cómo es el 90% restante del trabajo.

El iceberg de la voz en tiempo real

  • Manejo de interrupciones: la persona que llama habla por encima del agente. ¿Dejas de generar? ¿Sigue adelante? La respuesta depende de si se trata de una interrupción real o de un canal secundario ("ajá"). Esto por sí solo es un problema de investigación.
  • Detección de turno: ¿cuándo terminó realmente de hablar la persona que llama? VAD capta el silencio pero omite las pausas a mitad del pensamiento. El endpointing ayuda pero añade latencia. Hacer esto mal significa que los agentes hablan por encima de las personas que llaman o esperan demasiado.
  • Cancelación de eco: el dispositivo de la persona que llama reproduce la voz del agente, que el micrófono capta y devuelve al ASR. Sin un manejo adecuado del eco, el agente se escucha a sí mismo y crea un circuito de retroalimentación.
  • Casos extremos de telefonía: tonos DTMF, transferencias de llamadas, música en espera, detección de correo de voz, llamadas en conferencia, variaciones del protocolo SIP entre operadores.
  • Optimización de la latencia: transmisión de respuestas, agrupación de conexiones, preparación de modelos, implementación regional. Cada uno reduce entre 50 y 100 ms y los necesita todos.

Qué construir versus qué comprar

Desarrolle su lógica de conversación, base de conocimientos e integraciones: estos son sus diferenciadores. Comprar la infraestructura de audio en tiempo real, la detección de turnos, el manejo de interrupciones y la gestión de telefonía son problemas básicos que se han resuelto. Una plataforma con un lienzo visual para el diseño de conversaciones le da a su equipo velocidad en las partes que importan mientras maneja la complejidad de la infraestructura que no hace que su agente sea excepcionalmente valioso.

¿Listo para construir?

Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.

Deje de crear agentes de voz desde cero | Mazed Blog | Mazed