Bilgi Damıtma (Knowledge Distillation)

Bilgi damıtma, daha küçük bir "öğrenci" modelin, daha büyük ve daha yetenekli bir "öğretmen" modelin çıktılarını (veya çıktı dağılımlarını) yeniden üretecek şekilde eğitildiği bir eğitim tekniğidir — öğretmenin faydalı davranışının büyük kısmını, çok daha küçük, hızlı ve ucuz bir pakete sıkıştırır. Öğrenciyi yalnızca ham etiketli verilerle eğitmek yerine (geleneksel yaklaşım), öğrenci, öğretmenin olası cevaplar üzerindeki zengin olasılık dağılımlarından öğrenir; bu dağılımlar tek bir "doğru cevap" etiketinden çok daha fazla sinyal taşır — öğretmenin makul seçenekler arasındaki güven dağılımı ("bu %70 ihtimalle kedi, %25 köpek, %5 başka bir şey") öğrenciye, düz bir "cevap kedidir" etiketinin öğretemeyeceği ince ayrımları öğretir. Bu, SaaS geliştiricileri için doğrudan önemlidir çünkü damıtılmış modeller, sınır (frontier) bir modelin tam kapasitesinin gereksiz olduğu, yüksek hacimli, gecikmeye ve maliyete duyarlı üretim özellikleri için çoğu zaman doğru seçimdir. Bu şekilde açıkça inşa edilmiş model aileleri arasında GPT-4o-mini (GPT-4o'dan damıtılmıştır), Claude Haiku (Claude ailesinde hız ve maliyet için optimize edilmiş daha küçük ve hızlı bir kardeş model) ve DistilBERT (BERT'in erken ve etkili bir damıtılmış versiyonu) yer alır. Somut bir örnek: Bir SaaS şirketi, günde milyonlarca kullanıcı yorumunu "güvenli", "spam" veya "incelemeye gönder" olarak sınıflandıran bir içerik moderasyonu özelliği çalıştırıyor. Her yorumu Claude Opus gibi bir sınır modelden geçirmek doğru olur ama bu hacimde aşırı pahalı ve yavaş olur. Bunun yerine, sınır modeli büyük bir eğitim setini etiketlemek için kullanırlar (örneğin öğretmen tarafından etiketlenmiş 50.000 yorum) ve ardından bu davranışı, çağrı başına çok daha düşük maliyetle milisaniyeler içinde çalışan, amaca özel çok daha küçük bir sınıflandırıcıya damıtırlar — bu dar görevde benzer doğruluğa ulaşırlar çünkü görevin kendisi öğretmenin tam genel amaçlı akıl yürütme yeteneğini gerektirmez. Geliştiriciler için daha geniş ders şu: damıtma (ve zaten damıtılmış bir "mini"/"flash"/"haiku" model katmanını seçmek), her çağrı için en büyük ve en pahalı modeli varsayılan olarak kullanmak yerine model yeteneğini görev karmaşıklığıyla eşleştirmenin yoludur — erken aşama AI ürün mimarisinde en yaygın ve maliyetli hatalardan biri budur. Damıtma kalitesi, eğitim örneklerinin gerçek üretim trafiğini ne kadar temsil ettiğine büyük ölçüde bağlıdır — dar bir örnek kesitinde damıtılmış bir öğrenci model, benzer girdilerde iyi performans gösterir ama öğretmenin hiç göstermediği uç durumlarda öngörülemeyen şekilde başarısız olabilir; bu yüzden üretim damıtma hatları genellikle özenle seçilmiş, aşırı temiz bir örnek kümesi yerine gerçek (veya gerçekçi şekilde sentetik) trafik dağılımlarından eğitim verisi örnekler. "Bu özellik için sınır modeli mi yoksa damıtılmış/mini bir model mi kullanmalıyım" sorusunu değerlendiren geliştiriciler, büyük modelin belirli, dar bir görev için her zaman anlamlı ölçüde daha iyi olduğunu varsaymak yerine, her ikisini de temsili üretim örnekleri üzerinde doğrudan kıyaslamalı ve dolar başına doğruluğu karşılaştırmalıdır.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi