Tokenizer (Belirteçleyici)

Tokenizer, ham metni bir LLM'in sinir ağının gerçekten üzerinde işlem yaptığı sayısal token dizisine dönüştüren ve modelin çıktı token'larını tekrar okunabilir metne çeviren bileşendir. Tek tek karakterleri işlemek (çok ayrıntılı, verimsiz) veya tüm kelimeleri işlemek (çok fazla olası kelime, yazım hataları/nadir kelimeler/diğer dilleri kötü işleme) yerine, çoğu modern tokenizer, byte-pair encoding (BPE) veya benzeri alt kelime algoritmaları adı verilen orta yol bir yaklaşım kullanır: büyük bir eğitim korpusunda en sık birlikte görülen karakter/alt kelime çiftlerini yinelemeli olarak birleştirerek sabit bir sözlük (genellikle 50.000-100.000+ girdi) öğrenir; böylece yaygın tüm kelimeler tek bir token haline gelirken, nadir veya tanıdık olmayan kelimeler daha küçük tanınabilir parçalara bölünür. Bu, SaaS geliştiricileri için birkaç somut, pratik açıdan önemlidir. İlk olarak, tokenizasyon doğrudan API maliyetini ve bağlam penceresi kullanımını belirler — çünkü fiyatlandırma ve limitler karakter veya kelime tabanlı değil, token tabanlıdır ve farklı tokenizer'lar farklı içerikleri farklı şekilde işler: kod, İngilizce olmayan metin (özellikle Arapça, Çince veya Kiril gibi Latin olmayan alfabeler) ve alışılmadık biçimlendirme (aşırı boşluk, alışılmadık Unicode), genellikle düz İngilizce metinden çok daha verimsiz tokenize olur, yani aynı kavramsal içerik bazı dillerde veya içerik türlerinde anlamlı ölçüde daha pahalıya mal olabilir. Somut bir örnek: İngilizce "tokenization" kelimesi 2-3 token'a bölünebilirken ("token" + "ization"), "the" gibi yaygın bir İngilizce kelime tek bir token'dır — ancak ağır eklemeli ekler içeren bir Türkçe cümle veya alışılmadık değişken adları içeren bir Python kod bloğu, eşdeğer uzunluktaki düz İngilizce metnin 1,3-2 katı token sayısında tokenize olabilir; bu da İngilizce olmayan veya kod ağırlıklı SaaS ürünleri için API maliyetlerini doğrudan artırır. İkinci olarak, her model ailesi kendi verisi üzerinde eğitilmiş kendi tokenizer'ını kullanır (GPT modelleri, Claude modelleri ve Llama modelleri farklı sözlüklere sahip farklı tokenizer'lar kullanır); bu yüzden "aynı" metin için token sayıları sağlayıcılar arasında hafifçe farklılık gösterir ve bir modelin tokenizer'ı için eğitilmiş fine-tune edilmiş bir adaptör genellikle farklı bir model ailesinde yeniden kullanılamaz. Maliyet veya bağlam bütçesi tahmin eden geliştiriciler, evrensel bir token-kelime oranı varsaymak yerine belirli sağlayıcının tokenizer/sayım aracını kullanmalıdır. Daha ince bir tokenizer sorunu, çok dilli ve kod ağırlıklı SaaS ürünlerini doğrudan etkiler: tokenizer sözlükleri eğitim korpusu sıklığından oluşturulduğu için, o eğitim verisinde yeterince temsil edilmeyen diller ve içerik türleri daha az verimli tokenize olur — yani örneğin Türkçe, Arapça veya alana özgü bir programlama dilindeki aynı kavramsal cümle, eşdeğer İngilizce metinden anlamlı ölçüde daha fazla token'a (dolayısıyla daha fazla paraya ve bağlam penceresi bütçesine) mal olabilir. İngilizce olmayan pazarlar için bir AI özelliğini yerelleştiren geliştiriciler, düz kelime başına maliyet tahmini varsaymak yerine, her hedef dildeki temsili içerik için gerçek token sayılarını kıyaslamalıdır; çünkü diller arasındaki maliyet farkı, fiyatlandırma ve kâr marjı hesaplamalarını etkileyecek kadar önemli olabilir.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi