Çekişmeli Üretici Ağ (GAN)

Çekişmeli Üretici Ağ (GAN — Generative Adversarial Network), 2014'te tanıtılan ve birbiriyle rekabet halinde eğitilen iki sinir ağından oluşan bir üretken AI mimarisidir: rastgele gürültüden gerçekçi sentetik veri (genellikle görsel) oluşturmaya çalışan bir üretici (generator) ve üreticinin sahte çıktılarını gerçek eğitim örneklerinden ayırt etmeye çalışan bir ayırt edici (discriminator). İki ağ, bir tür çekişmeli oyun içinde eş zamanlı eğitilir — üretici, ayırt ediciyi kandırmakta giderek iyileşir, ayırt edici sahteleri yakalamakta giderek iyileşir ve bu karşılıklı baskı üreticiyi giderek daha gerçekçi çıktılar üretmeye iter. Bu, SaaS geliştiricileri için çoğunlukla tarihsel ve karşılaştırmalı bir bağlam olarak önemlidir: GAN'lar 2010'ların sonlarına kadar baskın görsel üretim tekniğiydi (StyleGAN, "bu kişi mevcut değil" gibi siteleri güçlendiren, dikkat çekici derecede gerçekçi sentetik yüzler üretti) ancak modern metinden görsele üretim ürünlerinin çoğunda büyük ölçüde difüzyon modelleri tarafından geride bırakıldılar; çünkü difüzyon modelleri daha kararlı eğitilir (GAN'lar, üreticinin ayırt ediciyi güvenilir şekilde kandıran ama çeşitli ve gerçekçi olmayan dar bir çıktı aralığı üretmeyi öğrendiği "mod çöküşü"ne meyillidir) ve metin promptu koşullandırmasını daha zarif şekilde işler. Bununla birlikte, GAN'lar, difüzyonun yinelemeli, çok adımlı üretiminin çok yavaş kaldığı belirli görevlerde — gerçek zamanlı yüz değiştirme/deepfake uygulamaları, bazı görsel süper çözünürlük ve büyütme araçları ve bazı ses sentezi hatları — hâlâ aktif olarak kullanılmaktadır, çünkü bir üretici üzerinden tek bir ileri geçiş, onlarca difüzyon gürültü temizleme adımından çok daha hızlıdır. Somut bir örnek: bulanık 480p bir kullanıcı görselini bir saniyenin altında keskin 4K'ya büyüten bir AI fotoğraf iyileştirme SaaS özelliği, muhtemelen bir difüzyon modelinden ziyade GAN tabanlı bir süper çözünürlük modeli (ESRGAN gibi) üzerine inşa edilmiştir, tam olarak çünkü GAN'lar çıktılarını yinelemeli çok adımlı bir arıtma döngüsü yerine tek hızlı bir geçişte üretir — gerçek zamanlı bir ürün özelliği için anlamlı bir gecikme avantajı. Bir "AI görsel" satıcısını veya açık kaynak modelini değerlendiren geliştiriciler, bunun difüzyon mu yoksa GAN tabanlı mı olduğunu bilmelidir, çünkü bu üretim hızını, çıktı çeşitliliğini ve fine-tuning yaklaşımını etkiler. Bir "AI görsel" satıcısını değerlendiren SaaS geliştiricileri için, altta yatan teknolojinin difüzyon mu, GAN tabanlı mı yoksa hibrit mi olduğunu doğrudan sormaya değer, çünkü bu gerçek ürün ödünleşimlerini etkiler: difüzyon modelleri genellikle açık uçlu metinden görsele üretim için daha çeşitli, daha yüksek sadakatli, promptu daha iyi takip eden sonuçlar üretirken, GAN tabanlı yaklaşımlar özellikle yüz değiştirme, gerçek zamanlı filtreler veya süper çözünürlük büyütme gibi dar, iyi tanımlanmış, gecikmeye duyarlı görevlerde rekabetçi kalmaya devam eder; burada tek bir ileri geçişin hızı, açık uçlu yaratıcı esneklikten daha fazla önem taşır.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi