Skalierung von WebRTC für Tausende gleichzeitiger Sprachagenten
WebRTC bietet die geringste Latenz für Sprachagenten, die Skalierung erfordert jedoch eine sorgfältige Architektur. Hier erfahren Sie, wie Sie Medienserver, Signalisierung und Status verwalten.
WebRTC ist der Goldstandard für browserbasierte Sprachagenten und bietet eine Transportlatenz von unter 50 ms. Während eine einzelne WebRTC-Verbindung einfach ist, erfordert die Skalierung auf Tausende gleichzeitiger Sitzungen eine dedizierte Infrastruktur. Sie können es nicht einfach auf einem einzelnen Node.js-Server ausführen.
SFU vs. MCU-Architektur
Für KI-Agenten werden Selective Forwarding Units (SFUs) typischerweise gegenüber Multipoint Control Units (MCUs) bevorzugt. Die SFU leitet das Audio des Benutzers direkt an den ASR-Dienst weiter und leitet das TTS-Audio zurück an den Benutzer, wodurch der Verarbeitungsaufwand auf dem Medienserver selbst minimiert wird.
Bereit loszulegen?
Erleben Sie, wie Mazeds multimodale KI-Agenten für Ihren Use Case arbeiten.