Rehber · fundamentals
Yapay Zeka Görsel Üreticileri Arasındaki Farklar: Diffusion ve Diğerleri, Sade Bir Dille
Yapay zeka görsel üreticilerinin nasıl çalıştığına, diffusion yaklaşımının neden baskın hale geldiğine ve araçlar arasında pratikte hangi farkları beklemeniz gerektiğine dair teknik olmayan bir açıklama.
Bir görsel üretici aslında ne yapıyor
Yapay zeka tabanlı bir görsel üretici, bir metin açıklamasını bir resme dönüştürür. Perde arkasında, metinle eşleştirilmiş çok büyük bir görsel koleksiyonundan, kelimeler ile görsel örüntüler arasındaki istatistiksel ilişkileri öğrenmiştir. Ona bir prompt verdiğinizde, bu öğrenilmiş ilişkileri kullanarak açıklamaya uyan yeni bir görsel kurar. Var olan resimleri getirip birleştirmez; öğrendiklerinin rehberliğinde sıfırdan piksel üretir.
Diffusion neden standart haline geldi
Bugün baskın olan teknik diffusion olarak adlandırılır. Fikir, adının düşündürdüğünden daha kolay kavranır. Eğitim sırasında sistem gerçek görselleri alır ve onlar birer parazit görüntüsüne dönüşene kadar kademeli olarak rastgele gürültü ekler; her adımda bu bozulmanın nasıl geri alınacağını öğrenir. Yeni bir görsel üretmek içinse saf gürültüden başlar ve her adımda bundan biraz eksilterek sonucu promptunuza uyan bir şeye doğru iter. Çok sayıda küçük gürültü giderme adımından sonra, rastgelelik olarak başlayan şeyden tutarlı bir görsel ortaya çıkar. Bu adım adım iyileştirme, yüksek kaliteli ve çeşitli görselleri güvenilir biçimde üretmeyi başardığı için diffusion, çoğu araçta daha eski yaklaşımların yerini aldı.
Kısaca öncesinde ne vardı
Görsel yapay zekanın önceki kuşakları genellikle farklı bir tasarım kullanıyordu: iki ağ birbiriyle yarışıyor — biri görsel üretiyor, diğeri gerçeği sahteden ayırmaya çalışıyor — ve birbirlerini gelişmeye zorluyordu. Bu yaklaşım etkileyici sonuçlar veriyordu ama eğitilmesi meşhur biçimde zordu ve kararsız olabiliyordu. Diffusion'ın daha kademeli ve öngörülebilir süreci, ölçeklendirmesi ve kontrol etmesi daha kolay çıktı; bugün ondan bu kadar sık söz edilmesinin başlıca nedeni de bu. Kullanıcı açısından altta yatan yöntem sonuçlar kadar önemli değildir, ama bugünkü araçların birkaç yıl öncekilere göre neden daha yetenekli ve tutarlı hissettirdiğini açıklar.
Benzer fikirler üzerine kurulu araçlar neden yine de farklılaşıyor
Araçlar aynı genel tekniği paylaşsa bile farklı davranırlar ve bunun nedenleri pratiktir. Bir modelin eğitildiği görseller ve metinler, neyde iyi olduğunu belirler — bazı araçlar fotogerçekçilikte, bazıları illüstrasyonda ya da belirli stillerde öne çıkar. Bir aracın promptunuzu ne kadar yakından takip ettiği, görsel içindeki yazıyı nasıl ele aldığı, varsayılan estetiği ve kompozisyon üzerinde size verdiği kontrol miktarı da değişir. Bu farklar temel yöntemden değil, eğitim tercihlerinden ve ince ayardan kaynaklanır; dolayısıyla uygunluğu değerlendirmenin tek yolu aynı promptları adaylar üzerinde denemektir.
Sonucu şekillendiren kontroller
Promptun kendisinin ötesinde, birçok araç anlamaya değer kontroller sunar: görsel boyutlarını belirleme, sonucu bir referans görselle yönlendirme, mevcut bir görselin bir kısmını inpaint ile doldurma veya düzenleme ve kaç iyileştirme adımı çalışacağını ayarlayarak hızı kaliteyle takas etme. Bu kontrolleri öğrenmek, sonuçlarınızı genellikle araç değiştirmekten daha çok iyileştirir; çünkü vasat bir çıktıyla güçlü bir çıktı arasındaki farkın büyük kısmı, hangi üreticiyi kullandığınızdan çok onu nasıl yönlendirdiğinizden gelir.
Pratikte ne beklemeli
Modern üreticiler, bir açıklamadan çekici ve çeşitli görseller üretmekte güçlüdür, ancak bazı konularda hâlâ zorlanırlar: kesin yazı, nesnelerin tam sayısı, görseller arasında tutarlı karakterler ve eller gibi ince detaylar güvenilir olmayabilir. Bu sınırları bilmek, teknolojinin öne çıktığı işleri seçmenize ve çıkmadığı yerlerde hayal kırıklığından kaçınmanıza yardımcı olur. Araçları karşılaştırırken cilalı vitrin görsellerinin ötesine bakın ve onları gerçekten ihtiyacınız olan türden bir resim üzerinde test edin — asıl farklar orada ortaya çıkar.