Dudak Senkronizasyonu (Lip Sync)

Yapay zeka dudak senkronizasyonu, belirli bir ses parçasıyla eşleşen gerçekçi ağız ve yüz hareketi üretimidir — konuşan kafa avatarının veya dublajlı bir videonun, statik veya uyumsuz ağız hareketi göstermek yerine, duyulan kelimeleri gerçekten söylüyormuş gibi görsel olarak görünmesini sağlayan teknoloji. Modeller, sesbirimler (konuşma sesleri) ile görsel birimler (karşılık gelen ağız şekilleri) arasındaki eşlemeyi öğrenmek için eşleştirilmiş ses-video verisi üzerinde eğitilir, ardından sesin fonetik içeriğine ve zamanlamasına bağlı olarak kare kare yüz hareketini — çene, dudak ve genellikle çevre kas hareketini — tahmin eder; bu daha sonra ya sentetik bir avatara ya da orijinal konuşmacının gerçek görüntüsüne, kaynak videonun çekildiği veya üretildiği hangi kare hızındaysa o hızda, kare kare geri kompoze edilir. SaaS geliştiricileri için neden önemli: dudak senkronizasyonu, çok dilli video dublajının doğal görünmesini sağlayan bileşendir (klasik "kötü dublajlı film" uyumsuzluğu yerine) ve her yapay zeka avatar sunucusu iş hattında gerekli bir katmandır — doğru dudak senkronizasyonu olmadan, bir senaryo okuyan avatar belirgin şekilde sentetik görünür ve güveni zayıflatır. Ayrıca gerçek görüntüyü "düzeltmek" için de kullanılır — yeniden çekim yapmaya gerek kalmadan, yalnızca ses senaryosu revizyonundan sonra bir oyuncunun ağız hareketlerini yeniden senkronize etme. Somut bir örnek — bir kurs platformunun "Fransızcaya otomatik dublaj" özelliği: (1) orijinal İngilizce kurs videosu ve dökümü yüklenir ve eğitmen, kendi sesinin yeniden kullanılabilmesi için tek seferlik bir ses klonlama rıza akışını tamamlar; (2) döküm Fransızcaya çevrilir ve eğitmenin klonlanmış sesini kullanan bir ses klonlama TTS'ine gönderilir, dillerin zamanlamada birebir eşleşmemesi nedeniyle orijinal İngilizce konuşmadan doğal olarak farklı ritim ve toplam süreye sahip yeni Fransızca ses üretilir; (3) yeni Fransızca ses parçası ve orijinal video bir dudak senkronizasyon API'sine gönderilir: `video_url` ve `audio_url` ile `POST /v1/lipsync`; (4) model, eğitmenin dudaklarının Fransızca sesin gerçek zamanlamasıyla görsel olarak eşleşmesi için ağız bölgesini kare kare yeniden üretir, gerektiğinde videonun temposunu uzatır veya sıkıştırır ve yeni sesin gömülü olduğu yeniden render edilmiş bir MP4 döndürür; (5) sonuç, eğitmen tek kelime Fransızca bilmese bile, sanki doğal olarak akıcı Fransızca konuşuyormuş gibi oynatılır. İşlem GPU yoğundur ve tipik olarak işlenen video dakikası başına faturalandırılır; bu, metin veya yalnızca ses işlemlerinden anlamlı ölçüde daha pahalıdır, bu yüzden çoğu platform, aynı kursu izleyen her öğrenci için yeniden üretmek yerine render edilmiş dublajları önbelleğe alır ve tüm öğrenciler arasında yeniden kullanır.

İlgili terimler

Daha fazla Çıktı ve Medya terimi