core-ai
Sözlük ↗Difüzyon Modeli (Diffusion Model)
Difüzyon modeli, modern AI görsel üretiminin (Midjourney, Stable Diffusion, DALL-E) ve giderek artan şekilde ses ve video üretiminin arkasındaki baskın yaklaşım olan bir üretken AI mimarisidir; veriye kademeli olarak rastgele gürültü ekleme sürecini tersine çevirmeyi öğrenerek çalışır. Eğitim sırasında modele, tamamen statik hale gelene kadar giderek daha fazla gürültü eklenmiş görseller gösterilir ve model bu gürültüyü adım adım tahmin edip kaldırmayı öğrenir. Üretim sırasında bu süreç tersine işletilir: tamamen rastgele gürültüden başlayarak, model bunu birçok adımda yinelemeli olarak temizler (bir metin promptu tarafından, sınıflandırıcısız yönlendirme adı verilen bir teknikle yönlendirilir), rastgele statiği kademeli olarak prompta uyan tutarlı bir görsele dönüştürür. Bu, metni token token üreten transformer tabanlı LLM'lerden mimari olarak farklıdır — difüzyon modelleri, tek bir ayrık birim yerine birçok arıtma geçişi boyunca tüm bir görseli kademeli ve bütünsel olarak üretir; ancak modern çok modlu sistemler giderek transformer bileşenlerini (metin promptunu anlamak için) difüzyon bileşenleriyle (gerçek görsel sentezi için) birleştirmektedir. Bu, difüzyon modellerinin AI görsel headshot üreticileri, pazarlama materyali oluşturucuları, ürün mockup araçları ve logo üreticileri gibi ürün özelliklerinin motoru olduğu AI görsel/yaratıcı araçlar alanındaki SaaS geliştiricileri için önemlidir. Somut bir örnek: bir tasarım SaaS aracının "kahraman görsel oluştur" özelliği, `"tahta bir masa üzerinde seramik kahve kupasının minimalist ürün fotoğrafı, yumuşak sabah ışığı, sığ alan derinliği"` gibi bir promptu bir difüzyon modeli API'sine (örneğin Stable Diffusion XL veya DALL-E 3) gönderir; model, hedef çıktı boyutunda rastgele bir gürültü görseliyle başlar, ardından yaklaşık 20-50 gürültü temizleme adımı boyunca — her adım görseli ekli bir metin kodlayıcı tarafından anlaşılan prompt tanımına biraz daha yaklaştırır — giderek keskinleşen, tutarlı bir fotoğraf ortaya çıkana kadar devam eder. Difüzyon modellerini entegre eden geliştiriciler, guidance scale (çıktının promptu ne kadar sıkı takip ettiği ya da modelin ne kadar yaratıcı özgürlük aldığı) ve adım sayısı (daha fazla adım genellikle daha yüksek kalite ama daha yavaş, daha pahalı üretim anlamına gelir) gibi parametreleri ayarlar ve giderek artan şekilde LoRA gibi fine-tuning tekniklerini difüzyon modellerini belirli bir görsel stil veya marka estetiğine göre eğitmek için kullanır. Difüzyon modelleri, üretim başına çoğu metin üretimi LLM çağrısından hesaplama açısından da daha ağırdır çünkü bir görsel üretmek, metnin token başına tek geçişli üretiminden farklı olarak birçok ardışık gürültü temizleme adımı gerektirir (her biri bir sinir ağı üzerinden bir ileri geçiştir) — bu yüzden görsel üretim API'leri genellikle karşılaştırılabilir uzunlukta bir metin yanıtından belirgin şekilde daha yüksek gecikme (milisaniye değil saniye) ve üretim başına maliyete sahiptir ve gerekli adım sayısını azaltan teknikler (popüler difüzyon modellerinin damıtılmış "turbo" veya "lightning" varyantları gibi) gerçek zamanlı veya yüksek hacimli görsel üretim ürün özellikleri için ticari açıdan önemli hale gelmiştir.
İlgili terimler