output
Sözlük ↗Ses Etkinliği Tespiti (Voice Activity Detection)
Ses etkinliği tespiti (VAD), bir ses akışının hangi bölümlerinin insan konuşması içerdiğini, hangilerinin sessizlik, arka plan gürültüsü veya konuşma olmayan ses içerdiğini belirleyen bir sınıflandırma modelidir; tipik olarak bağımsız bir son kullanıcıya yönelik çıktı olmaktan çok hafif, düşük gecikmeli bir ön işleme adımı olarak çalışır — görevi, aşağı akış iş akışına konuşmanın tam olarak ne zaman başladığını ve durduğunu söylemektir. Modern VAD (Silero VAD, WebRTC VAD ve çoğu STT/sesli asistan SDK'sına yerleştirilmiş uç nokta belirleme mantığı), kısa ses çerçeveleri (genellikle 10-30ms pencereler) üzerinde çalışan küçük, hızlı bir sinir sınıflandırıcı kullanarak gerçek zamanlı olarak ikili veya olasılıksal bir konuşma/konuşma yok sinyali üretir; bu, fark edilir pil tüketimi veya eklenen gecikme olmadan bir mobil cihazda veya gömülü sistemde sürekli çalışacak kadar ucuzdur; bu önemlidir çünkü VAD tipik olarak bir düğmeye basılarak tetiklenen ara sıra, talep üzerine bir API çağrısından ziyade her zaman açık, sürekli dinleyen bir arka plan süreci olarak çalışır. SaaS geliştiricileri için neden önemli: VAD, neredeyse her sesli ürünün algılanan kalitesini belirleyen görünmez, göz alıcı olmayan bir altyapıdır — bir sesli yapay zeka aracısının, kullanıcının konuşmayı bitirdiğini ve sıranın kendisine geldiğini bilmesi için doğru VAD'a ihtiyacı vardır ("uç nokta belirleme"), bunsuz aracı ya kullanıcının sözünü ortasında keser (VAD çok erken tetiklenir) ya da gelmeyecek daha fazla ses beklerken garip, maliyetli bir sessizlik bırakır (VAD çok geç tetiklenir); transkripsiyon ve toplantı kayıt araçları, sessizliği kırpmak ve STT API maliyetlerinden tasarruf etmek için VAD kullanır (birçok sağlayıcı işlenen ses saniyesi başına ücretlendirir, bu yüzden sessiz boşlukları STT API'sine göndermeden önce ayıklamak doğrudan maliyeti azaltır); ve çağrı merkezi/IVR sistemleri, bir arayanın konuşmayı bitirdiğini tespit etmek için VAD kullanarak senaryolu bir akışı ilerletir. Somut bir örnek — bir sesli yapay zeka aracısının sıra alma mantığı: (1) kullanıcı canlı bir sesli aracı çağrısında konuşurken, bir VAD modeli gelen ses akışında çerçeve çerçeve sürekli çalışır; (2) VAD, tespit edilen konuşmayı takiben 700ms sürekli sessizlik tespit ettiğinde, iş akışı bunu kullanıcının sırasının sonu olarak değerlendirir ve arabelleğe alınmış sesi transkripsiyon için STT modeline iletir; (3) ortaya çıkan metin, TTS ile geri seslendirilecek bir yanıt için LLM'e gönderilir; (4) sessizlik eşiğini ayarlamak gerçek bir ürün kararıdır — çok kısa olursa aracı, düşünce ortasında duraksayan kullanıcıları keser, çok uzun olursa konuşma ağır hissettirir, bu yüzden birçok üretim sistemi bunu kullanıcının gözlemlenen konuşma temposuna göre uyarlanabilir hale getirir.
İlgili terimler