指南2026年1月22日5 分钟阅读

多模式人工智能代理:为什么仅靠语音还不够

语音代理处理对话。多模式代理处理体验 - 将语音、视频和屏幕共享相结合,以实现仅语音无法比拟的交互。

声音很有力量。但人类并不仅仅通过声音进行交流——我们一起展示、指出、展示和观察事物。每当呼叫者说“我正在看屏幕,发现有错误”时,纯语音客服人员就处于盲目操作状态。多模式代理通过实时结合语音与视频、屏幕共享和视觉理解来缩小这一差距。

多式联运的实际含义是什么

多模式人工智能代理同时处理和生成多种类型的信息:音频(听和说)、视觉(查看屏幕、文档、相机)和文本(阅读和显示信息)。它不只是在通道之间切换——它还融合了它们。客服人员在看到客户屏幕的同时听到客户描述问题,将两种输入结合起来以提供更准确、更快速的解决方案。

需要远见的用例

  • 技术支持 - 代理可以看到用户的屏幕并识别问题,而无需用户口头描述菜单位置、错误代码或 UI 状态
  • 保险索赔——客户在索赔电话中通过摄像头显示车辆损坏、财产损坏或文件记录
  • 身份验证 — 基于视频的 KYC,代理根据呼叫者的脸部验证政府 ID
  • 产品入门 - 引导式设置,代理可以看到产品界面并引导用户逐步完成配置
  • 医疗摄入——患者在就诊前筛查期间出示药瓶、保险卡或明显症状
  • 房地产 — 人工智能引导的虚拟地产之旅,带有互动问答

多模式代理的架构

多模式代理运行并行处理流:音频的 ASR、视频帧的视觉模型以及跨两个输入进行推理的 LLM。编排层决定在每个时刻强调哪种模式——当用户说话时,音频优先;当用户说话时,音频优先;当用户说话时,音频优先;当用户说话时,音频优先;当他们展示某些东西时,视觉会起到引导作用。这需要一个从头开始设计的多模态平台,而不是随后附加视频的语音代理。

何时采用多模式与纯语音模式

并非每个用例都需要远见。预约安排、付款提醒和基本的常见问题解答电话仅通过语音即可正常工作。当交互受益于展示而不是讲述时,请采用多模式:故障排除、文档繁重的流程、引导式工作流程以及任何需要“您能描述一下您所看到的内容吗?”的场景。与实际看到它相比,这是一种较差的选择。

准备好构建了吗?

了解 Mazed 的多模态 AI 代理如何为您的用例工作。

多模式人工智能代理:为什么仅靠语音还不够 | Mazed Blog | Mazed