Reranking (Yeniden Sıralama)

Reranking, bir arama veya retrieval hattında ikinci aşama bir iyileştirme adımıdır; burada anahtar kelime araması, vektör benzerlik araması veya her ikisi yoluyla hızlı ve ucuz bir şekilde alınan geniş, ilk aday sonuç kümesi, sorguyu her adayla doğrudan karşılaştırarak daha doğru bir alakalılık sıralaması üreten daha sofistike (ve hesaplama açısından daha pahalı) bir model tarafından yeniden puanlanır; bu, son en iyi sonuçlar kullanılmadan önce yapılır. Bu iki aşamalı yaklaşımın (geniş al, sonra kesin şekilde yeniden sırala) yalnızca pahalı kesin modeli doğrudan tüm külliyat üzerinde çalıştırmak yerine var olma nedeni: reranking için kullanılan kesin puanlama modelleri (tipik olarak cross-encoder'lar; sorguyu ve her belgeyi tek bir geçişte birlikte işleyerek doğrudan karşılaştırırlar) gerçek alakalılığı değerlendirmede hızlı vektör benzerlik aramasından çok daha doğrudur ama her sorguda binlerce veya milyonlarca belgeden oluşan bir külliyat üzerinde çalıştırmak için de çok yavaş ve pahalıdır — bu yüzden pratik desen, milyonlarca belgeden alanı örneğin ilk 50-100 adaya daraltmak için hızlı, yaklaşık retrieval kullanmak, ardından yavaş, daha doğru reranker'ı yalnızca bu çok daha küçük kümeye uygulamaktır. Bu, SaaS ürünlerinde RAG kalitesi için doğrudan önemlidir çünkü tek başına ilk vektör alma sıklıkla "yeterince iyi ama tam olarak doğru değil" bir sonuç kümesi döndürür — konusal olarak ilgili ama tek en iyi eşleşme olmayan veya optimal olmayan bir sırada sıralanmış belgeler — ve bu kusurlu sıralamayı doğrudan bir LLM'in bağlam penceresine beslemek, marjinal derecede alakalı içerik için token bütçesini israf eder ve nihai üretilen cevabın kalitesini sulandırabilir. Somut bir örnek: "haklı sebeple fesih" hakkında bir sorgu için 500.000 sözleşme maddesinden oluşan bir veritabanını arayan bir hukuk teknolojisi RAG sistemi, önce milisaniyeler içinde en semantik olarak benzer 50 maddeyi almak için hızlı vektör aramasını kullanır; ardından bu 50 adayın her birini tam sorguya karşı ayrı ayrı puanlayan bir cross-encoder reranking modeli (Cohere'in rerank API'si veya BGE-reranker gibi açık kaynak bir model gibi) çalıştırır ve hat, gerçekte LLM'e göndermek için yalnızca en yüksek puanlı 5 sonucu tutar — bu, reranker'ın daha hızlı ilk retrieval'in kaçırdığı ince alakalılık ayrımlarını yakalaması nedeniyle, ham vektör arama sırasını doğrudan kullanmaya göre cevap doğruluğunu anlamlı ölçüde iyileştirir. Reranker'lar tipik olarak basit bir API çağrısı olarak sunulur (bir sorgu ve bir aday metin listesi gönderin, puanlarla birlikte alakalılığa göre sıralanmış bir liste geri alın), bu da onları mevcut bir RAG hattına eklenecek basit bir özellik haline getirir. Reranker'lar ayrıca saf alakalılık iyileştirmesinin ötesinde daha az belirgin ikinci bir amaca da hizmet eder: her adayı sorguya karşı bağımsız olarak yalnızca bir benzerlik mesafesiyle değil, özel bir alakalılık puanıyla puanladıkları için, bu puan bir güven sinyali olarak kullanılabilir — en üstteki yeniden sıralanmış sonuç bile tanımlanmış bir eşiğin altında puan alırsa, sistem "külliyatta buna gerçekten iyi cevap veren bir şey yok" sonucuna varabilir ve LLM'i marjinal derecede alakalı bağlamdan bir cevap üretmeye zorlamak yerine zarif bir geri dönüşü ("buna güvenilir bir cevap bulamadım") tetikleyebilir; bu, RAG hatlarında halüsinasyon riskini doğrudan azaltır.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi