AI Voice Agent Gecikmesi: Sebep Olan Nedir ve Nasıl Azaltılabilir?
800 ms'nin üzerindeki gecikme, konuşmaların robot gibi geçmesini sağlar. Sesli temsilci gecikmesine ve yanıt sürelerini 500 ms'nin altına itmeye yönelik pratik stratejilere katkıda bulunanları burada bulabilirsiniz.
İnsan konuşmasında, bir kişinin konuşmasını bitirmesi ile diğerinin yanıt vermesi arasındaki fark genellikle 200-400 ms'dir. Bir yapay zeka aracısı 800 ms veya daha fazla sürdüğünde konuşma yavaşlıyor. Arayanlar temsilci üzerinden konuşmaya başlar, bu da ardı ardına gelen kesintiler ve garip örtüşmeler yaratır. Gecikme hoş bir şey değil; doğal bir konuşma ile açıkça robotik bir konuşma arasındaki farktır.
Gecikmenin nereden geldiği
- Konuşma tanıma (ASR): Arayanın konuşmasını yazıya geçirmek için 100–300 ms
- LLM çıkarımı: Modelin yanıt oluşturması için 200–800 ms (model boyutuna ve bilgi istemi uzunluğuna göre oldukça değişkendir)
- Metinden konuşmaya (TTS): İlk ses parçasını sentezlemek için 100–200 ms
- Ağ gidiş dönüşleri: Hizmetler arasında atlama başına 50–150 ms
- Eylem yürütme: Harici sistemlere yapılan API çağrıları için 100–500 ms+ (CRM aramaları, takvim kontrolleri)
Azaltma stratejileri
- Akışlı yanıtlar — Tam yanıtı beklemek yerine, LLM'den ilk jetonlar gelir gelmez TTS'yi başlatın. Bu, en büyük gecikme kazancıdır.
- Model seçimi: Basit etkileşimler için daha hızlı modeller kullanın ve karmaşık akıl yürütme için daha büyük modelleri ayırın. Farklı çağrı türleri farklı modelleri kullanabilir.
- İstem optimizasyonu — daha kısa sistem istemleri çıkarım süresini azaltır. Gereksiz talimatları kaldırın.
- Uç dağıtım — ASR ve TTS sunucularını coğrafi olarak sizi arayanların yakınına yerleştirin.
- Ön getirme: Temsilci olası sonraki adımları tahmin edebiliyorsa, arayan kişi konuşmayı bitirmeden önce verileri önceden alın.
- Bağlantı havuzu oluşturma — istek başına yenilerini oluşturmak yerine LLM ve TTS sağlayıcılarıyla kalıcı bağlantıları sürdürün.
Gecikmeyi doğru ölçmek
Uçtan uca ölçün: Arayanın konuşmayı bıraktığı andan yanıtın ilk kelimesini duyduğu ana kadar. Algılanan kaliteyi belirleyen sayı budur. Tek tek bileşen gecikmesinin ölçülmesi hata ayıklama açısından faydalıdır ancak deneyimi değerlendirme konusunda yanıltıcıdır. Standart etkileşimlerde ilk kelime yanıtı için 500 ms'nin altında bir hedef belirleyin.
Başlamaya hazır mısın?
Mazed'in multimodal yapay zekasının sizin için nasıl çalıştığını görün.