core-ai
Sözlük ↗Geri Getirme Destekli Üretim (RAG)
Geri Getirme Destekli Üretim (Retrieval-Augmented Generation, RAG), bir arama/geri getirme adımını bir LLM'in üretim adımıyla birleştiren bir mimari kalıptır; böylece model, yalnızca eğitim sırasında ezberlediklerine değil, sizin özel ve güncel verinize dayanarak yanıt verir. Bu, LLM'lerin iki temel zayıflığını çözer: halüsinasyon (makul görünen ama yanlış gerçekler uydurmak) ve bayatlık (eğitim verisinin bir kesim tarihi vardır). RAG, SaaS geliştiricileri için son derece önemlidir çünkü genel amaçlı bir LLM'i, ince ayarın (fine-tuning) maliyeti ve karmaşıklığı olmadan, ürününüz, dokümantasyonunuz veya müşteri verileriniz konusunda bir alan uzmanı gibi davranmaya zorlamanın en ucuz ve en hızlı yoludur. Akış üç adımdan oluşur. Önce geri getirme (retrieve): kullanıcının sorusu bir embedding vektörüne dönüştürülür, ardından doküman parçalarınızın embedding'lerini tutan bir vektör veritabanında (pgvector veya Pinecone gibi) bir benzerlik araması yapılır ve en alakalı ilk k parça döndürülür. İkinci adım artırma (augment): bu parçalar, kullanıcının sorusuyla birlikte LLM'in bağlam penceresine (context window), genellikle sistem istemi veya bir ön bilgi olarak eklenir. Üçüncü adım üretim (generate): LLM, sağlanan bağlamla sınırlı bir yanıt üretir. Somut bir örnek: bir kullanıcı bir SaaS yardım botuna "API anahtarımı nasıl sıfırlarım?" diye sorar. Sistem bu soruyu embedding'e dönüştürür, yardım merkezi makalelerinizin vektör deposunda arama yapar, en alakalı 3 parçayı getirir (örneğin "API Anahtarları" ve "Güvenlik Ayarları" dokümanları) ve LLM'e şu şekilde bir istem gönderir: `"Sadece aşağıdaki bağlamı kullanarak kullanıcının sorusunu yanıtla. Bağlam: [API Anahtarları dokümanından alıntı]... Soru: API anahtarımı nasıl sıfırlarım?"` Model, tahmin yürütmek yerine dokümanlarınızdan alınan tam sıfırlama adımlarıyla yanıt verir. RAG hatları (pipeline) genellikle yeniden sıralama (reranking — geri getirilen parçalar üzerinde ikinci, daha hassas bir alaka düzeyi geçişi) ve alıntı takibi de içerir, böylece yanıtlar kaynak dokümanlara geri bağlanabilir. RAG sihirli bir değnek değildir — geri getirme kalitesi, üretim kalitesinin üst sınırını belirler, bu yüzden parçalama (chunking) stratejisi, embedding modeli seçimi ve metadata filtreleme, LLM'in kendisi kadar önemlidir. RAG sistemleri, geliştiricilerin tasarım yaparken göz önünde bulundurması gereken öngörülebilir şekillerde başarısız olur: geri getirme adımı alakasız parçalar döndürürse, üretim adımı yanlış bağlamdan güvenle yanıt verir (çöp girer, güvenli çöp çıkar); bir doküman mantıklı şekilde parçalanmamışsa (bir tabloyu veya numaralı bir prosedürü ortasından bölmek), doğru doküman bulunsa bile geri getirilen bağlam eksik veya yanıltıcı olabilir. Üretim ortamındaki RAG hatları genellikle ilk geri getirmeden sonra bir yeniden sıralama geçişi ekler, her yanıtta gerçekte hangi kaynak parçaların kullanıldığını takip eder (alıntı ve hata ayıklama için) ve geri getirilen alaka skorları bir eşiğin altına düştüğünde modelin tahmin yürütmesine izin vermek yerine açık bir "bunu yanıtlamak için yeterli bilgim yok" geri dönüşü tanımlar.
İlgili terimler