Abbiegeerkennung bei Sprachagenten: Der Kompromiss, über den niemand spricht
Eine schnellere Abbiegeerkennung bedeutet, dass der Agent schneller reagiert, aber häufiger unterbricht. Eine langsamere Erkennung bedeutet weniger Unterbrechungen, aber unangenehme Pausen. Es gibt kein kostenloses Mittagessen.
Die Abbiegeerkennung – die Feststellung, wann der Anrufer mit dem Sprechen fertig ist – ist das am meisten unterschätzte Problem der Sprach-KI. Wenn Sie in einer Richtung etwas falsch machen, überredet der Agent den Anrufer. Machen Sie beim anderen etwas falsch, wartet der Agent zu lange, was zu unangenehmer Stille führt. Jede Plattform geht einen Kompromiss ein und die meisten erzählen Ihnen nichts davon.
Das Spektrum
Schnelles Endpointing (200–400 ms Stille löst Reaktion aus): Der Agent fühlt sich schnell und reaktionsschnell. Aber es unterbricht Anrufer, die mitten im Nachdenken innehalten, vor dem Ende eines Satzes Luft holen oder mitten im Sprechen die Sprache wechseln. Langsames Endpointing (800–1200 ms): Der Agent unterbricht fast nie, aber das Gespräch fühlt sich träge an, als würde man mit jemandem über eine schlechte Satellitenverbindung sprechen. Die richtige Einstellung hängt von Ihrem Anwendungsfall, Ihren Anrufern und Ihrer Toleranz für jeden Fehlermodus ab.
Mehr als einfache Timer
Beim einfachen VAD (Voice Activity Detection) wird jede Stille gleich behandelt. Intelligentere Ansätze nutzen semantische Signale: Ist der Satz grammatikalisch vollständig? Ist die Intonation gesunken (Aussage) oder gestiegen (Frage noch in Bearbeitung)? Ist der Inhalt ein vollständiger Gedanke? Die modellbasierte Abbiegeerkennung nutzt diese Signale, um den Abschluss einer Abbiegung genauer vorherzusagen als die Dauer der Stille allein. Der Kompromiss: mehr Berechnung pro Frame, mehr Latenz bei der Erkennung selbst. Aber die Verbesserung der Gesprächsqualität ist in der Regel die paar Millisekunden wert.
Konfigurierbar, keine Einheitslösung
Die idealen Einstellungen für die Abbiegeerkennung für ein schnelles Verkaufsqualifizierungsgespräch unterscheiden sich von einem geduldigen, einfühlsamen Gespräch im Gesundheitswesen. Auf Ihrer Plattform sollten Sie dies pro Agent oder pro Flow konfigurieren können – und keinen globalen Standard festlegen. In Agent Canvas kann das Turn-Erkennungsverhalten auf Knotenebene festgelegt werden, sodass verschiedene Gesprächssegmente unterschiedliche Empfindlichkeiten haben können.
Bereit loszulegen?
Erleben Sie, wie Mazeds multimodale KI-Agenten für Ihren Use Case arbeiten.