output
Sözlük ↗Görsel Altyazılama (Captioning)
Altyazılama, görsel içeriğin — bir durağan görsel veya bir video — doğal dil metin açıklamasının yapay zeka tarafından üretilmesidir; en yaygın olarak erişilebilirlik (ekran okuyucu alt metni), içerik dizinleme/arama ve otomatik meta veri üretimi için kullanılır. Bunun, konuşulan diyaloğun zamanlı ekran metni olan ve transkripsiyonla örtüşen altyazılamadan farklı olduğunu unutmayın; yapay zeka/makine öğrenimi anlamında "görsel altyazılama", bir görsel modelin bir görselde ne tasvir edildiğini tanımlamasını ifade eder ("parkta bir frizbi yakalayan altın renkli bir Golden Retriever"). Modern altyazılama, büyük eşleştirilmiş görsel-metin veri setleri üzerinde eğitilmiş görsel-dil modelleri — çok modlu LLM'ler (GPT-4o, Claude, Gemini) veya özel modeller (BLIP-2, LLaVA) — tarafından ele alınır; bunlar görseli ortaklaşa kodlar ve akıcı bir açıklama üretir, farklı ayrıntı seviyeleri veya belirli odak noktaları için yönlendirilebilir ("bunu görme engelli bir kullanıcı için, estetikten çok işleve odaklanarak açıkla" ile "125 karakterin altında SEO odaklı bir alt niteliği yaz" arasında), bu da geliştiricilere her altyazılama kullanım durumu için ayrı özel modellere ihtiyaç duymak yerine tek, esnek bir API sunar. SaaS geliştiricileri için neden önemli: otomatik altyazılama, önemli miktarda kullanıcı tarafından üretilen görsel içeriğe sahip herhangi bir platform için ölçekte gereklidir — e-ticaret (binlerce ürün fotoğrafı için hem WCAG gibi erişilebilirlik uyumluluğu hem de görsel arama SEO'su için alt metni otomatik üretme), stok fotoğraf/DAM platformları (aranabilirlik için materyalleri otomatik etiketleme ve tanımlama) ve görme engelli kullanıcılara hizmet veren sosyal/içerik platformları. Büyük bir medya kütüphanesi için manuel olarak alt metin yazmak sıkıcı olduğundan ve sıklıkla atlandığından, düşük maliyetli, yüksek uyumluluk değerli bir özelliktir. Somut bir örnek — ölçekte otomatik alt metin üreten bir e-ticaret platformu: (1) ürün görseli yüklendiğinde, arka plan işi görseli görsel-dil modeline şu komutla gönderir: "Bu ürün fotoğrafı için 125 karakterin altında, erişilebilirlik ve SEO için uygun, özlü, tanımlayıcı bir alt metin niteliği yaz. 'Görsel' ile başlama. Malzeme, renk ve önemli görsel ayrıntılardan bahset."; (2) model şunu döndürür: "Beyaz arka plan üzerinde ahşap yakalı mat siyah seramik damla kahve süzgeci"; (3) alt metin, ürünün `image_alt` alanına kaydedilir ve `<img alt="...">" etiketinde render edilir, görme engelli alışverişçiler için ekran okuyucu erişilebilirliğini ve Google Görsel Arama trafiği uygunluğunu anında iyileştirir; (4) gece çalışan bir toplu iş, daha önce boş olan eski ürün kataloğu için alt metni geriye dönük doldurur, API maliyetini kontrol etmek için çalıştırma başına sabit bir toplu boyut işler ve modelin güveninin düşük olduğu herhangi bir görseli (ör. temiz bir ürün çekimi yerine belirsiz bir yaşam tarzı fotoğrafı) manuel yazması için bir insana işaretler.
İlgili terimler