观点2026年3月2日3 分钟阅读

停止从头开始构建语音代理

将 ASR、LLM 和 TTS API 拼接在一起听起来很简单。实际上,平台从第一天起就需要进行数月的边缘案例工程。

构建自己的语音代理的宣传非常引人注目:调用 ASR API、将文本通过管道传输到 LLM、将响应发送到 TTS、将音频流式传输回来。三个 API 调用。一个周末项目。然后你和一个真正的来电者一起尝试,发现剩下的 90% 的工作是什么样子的。

实时语音的冰山一角

  • 中断处理——呼叫者与座席交谈。你停止发电吗?继续前进?答案取决于它是真正的中断还是反向通道(“嗯嗯”)。这本身就是一个研究问题。
  • 转弯检测——呼叫者什么时候真正结束讲话? VAD 抓住了沉默,但错过了思考中的停顿。端点有帮助,但会增加延迟。犯这个错误意味着客服人员会与来电者交谈或等待太久。
  • 回声消除——呼叫者的设备播放客服人员的声音,麦克风拾取该声音并将其反馈给 ASR。如果没有适当的回声处理,代理会听到自己的声音并创建反馈循环。
  • 电话边缘案例 — DTMF 音调、呼叫转移、等待音乐、语音邮件检测、电话会议、跨运营商的 SIP 协议变化。
  • 延迟优化——流响应、连接池、模型预热、区域部署。每次节省 50-100 毫秒,而您需要全部。

建造什么与购买什么

构建您的对话逻辑、知识库和集成——这些是您的与众不同之处。购买实时音频基础设施、转弯检测、中断处理和电话管理——这些都是已经解决的商品问题。具有用于对话设计的可视化画布的平台可以让您的团队在重要部分上加快速度,同时处理基础设施的复杂性,而这不会使您的座席具有独特的价值。

准备好构建了吗?

了解 Mazed 的多模态 AI 代理如何为您的用例工作。

停止从头开始构建语音代理 | Mazed Blog | Mazed