Multimodal Aracıların Neden Yalnızca Sesten Farklı Bir Mimariye İhtiyacı Var?
Bir ses hattına video ekleyip buna çok modlu diyemezsiniz. Gerçek çok modlu aracılar, paralel işleme, birleşik akıl yürütme ve mod değiştirme için tasarlanmış bir çalışma zamanı gerektirir.
Sesli aracının doğrusal bir hattı vardır: ses girişi → ASR → LLM → TTS → ses çıkışı. Çok modlu bir aracı paralel akışları çalıştırır: ses girişi + video çerçeveleri → ASR + görüntü modeli → birleşik LLM muhakemesi → TTS + isteğe bağlı görsel çıkış. Fark ilave değil, mimaridir. Sistem her an hangi modaliteye öncelik vereceğine, farklı duyulardan gelen girdileri nasıl birleştireceğine ve bilgi işlemin akışlar arasında nasıl tahsis edileceğine karar vermelidir.
Modalite değiştirme değil, modalite füzyonu
Saf bir multimodal sistem modlar arasında geçiş yapar: ya dinler ya da bakar. Uygun bir çok modlu sistem, girdileri birleştirir: Temsilci, müşterinin 'bu bozuk' dediğini duyarken aynı anda onların ekrandaki belirli bir öğeyi işaret ettiğini görür. 'Bu' kelimesi yalnızca görsel bağlamla çözülür. Bu çapraz mod çözümü, her iki girdiyi sırayla değil aynı anda alan bir akıl yürütme modeli gerektirir.
Sorunsuz modalite geçişleri
Temsilci sesli arama olarak başlar. Müşterinin hesabında gezinme konusunda yardıma ihtiyacı var, bu nedenle temsilci ekran paylaşımı sunuyor. Artık ses + ekran paylaşımı var. Müşteri kamerada bir belge gösteriyor; artık ses + görüntü var. Bu geçişler, kullanıcının ve aracının bakış açısına göre kesintisiz olmalıdır. Konuşma durumu, bağlamı ve kişiliği, yeniden başlatmaya gerek kalmadan modalite değişikliklerini taşır. Bu, ayrı ses ve video hizmetlerinin bir araya getirilmesini değil, birleşik bir oturum çalışma süresini gerektirir.
Başlamaya hazır mısın?
Mazed'in multimodal yapay zekasının sizin için nasıl çalıştığını görün.