core-ai
Sözlük ↗Küçük Dil Modeli (SLM)
Küçük Dil Modeli (Small Language Model, SLM), öncü LLM'lerden çok daha küçük bir parametre ölçeğinde kasıtlı olarak inşa edilip eğitilen bir dil modelidir — genellikle birkaç yüz milyondan birkaç milyar parametreye kadar değişir, öncü modellerdeki onlarca veya yüzlerce milyara (ya da daha fazlasına) karşılık — ve veri merkezi GPU'ları gerektirmek yerine tüketici dizüstü bilgisayarları, telefonlar ve hatta gömülü cihazlar dahil sınırlı donanımda verimli çalışacak şekilde optimize edilmiştir. SLM'ler, genel yetenek ve bilgi genişliğinden bir miktar fedakarlık ederek hız, maliyet, gizlilik ve dağıtılabilirlikte çarpıcı kazançlar elde eder: iyi eğitilmiş bir SLM, cihaz üzerinde neredeyse anlık gecikmeyle çıkarım yapabilir, jeton başına sıfır API maliyetiyle ve hiçbir verinin cihazdan çıkmadan, karmaşık, açık uçlu akıl yürütme görevlerinde öncü bir modelden daha az yetenekli olma bedeli karşılığında. Bu, bu dengelerin küçük modeli tercih ettiği belirli, değerli kullanım durumlarında SaaS ve uygulama geliştiricileri için önemlidir: çevrimdışı çalışması veya sıkı gizlilik garantileri gerektiren cihaz üzeri özellikler (bir not alma uygulamasının yerel arama/özetleme özelliği, bir klavyenin sonraki kelime tahmini, cihaz üzerinde bir sesli asistan), ince ayarlı küçük bir modelin çok daha büyük genel bir modelin doğruluğuna eşdeğer olabildiği dar, iyi tanımlanmış görevler (sınıflandırma, basit çıkarım, belirli formatta üretim) ve basit istekleri bir SLM'e yönlendirip yalnızca karmaşık olanları öncü bir modele yükselterek genel API harcamasını önemli ölçüde azaltan maliyete duyarlı, yüksek hacimli uygulamalar. Somut bir örnek: mobil bir not alma uygulaması, anında, çevrimdışı ve hiçbir kullanıcının özel notlarını bir bulut API'sine göndermeden çalışan "bu notu özetle" ve "eylem maddelerini çıkar" özellikleri sunmak istiyor. Küçük (yaklaşık 1-3 milyar parametreli), niceliksel olarak sıkıştırılmış (quantized) açık ağırlıklı bir modeli doğrudan uygulamaya gömerler ve çıkarımı tamamen kullanıcının cihazında çalıştırırlar — özellik, sıfır ağ gidiş-dönüşüyle ve telefondan hiç veri çıkmadan bir saniyenin altında yanıt verir; özetlerin bir bulut öncü modelinin üreteceğinden biraz daha az cilalı olmasını kabul ederler, çünkü bu belirli görev ve gizlilik gereksinimi için bu denge açıkça küçük, cihaz üzerindeki modeli destekler. Apple'ın cihaz üzeri modelleri, Microsoft'un Phi ailesi ve Google'ın Gemma ailesi, bu verimli, her yerde dağıtılabilir kullanım durumu için açıkça tasarlanmış öne çıkan SLM örnekleridir. SLM'ler ayrıca giderek saf bağımsız kullanımdan ziyade iki katmanlı bir mimaride "hızlı ilk geçiş" olarak kullanılmaktadır: hafif bir SLM, basit, yüksek güvenilirlikli durumları doğrudan işler (veya bir ön sınıflandırma/triyaj gerçekleştirir), yalnızca gerçekten belirsiz veya karmaşık durumları daha büyük bir öncü modele yükseltir — bu, tüm bir özellik için model katmanları arasında hepsi-ya-da-hiçbiri seçimi yapmak yerine, küçük bir modelin maliyet ve gecikme avantajının çoğunu yakalarken gerçekten ihtiyaç duyulan daha zor istek alt kümesinde öncü düzey kaliteyi koruyan bir kalıptır.
İlgili terimler