prompt-eng

Talimat Ayarlama (Instruction Tuning)

Talimat ayarlama, model geliştiricileri tarafından uygulanan (tipik olarak doğrudan SaaS geliştiricileri tarafından değil) bir fine-tuning sürecidir; burada -internet metninin devasa miktarları üzerinde yalnızca bir sonraki tokeni tahmin etmek için önceden eğitilmiş- bir temel dil modeli, kürasyonlu bir talimat-yanıt çifti veri kümesi üzerinde (bir görevi tanımlayan bir prompt, onu doğru şekilde takip eden yüksek kaliteli bir yanıtla eşleştirilmiş) daha ileri eğitilir; böylece model, metni yalnızca stilistik olarak makul bir yönde devam ettirmek yerine doğal dil talimatlarını güvenilir şekilde yorumlamayı ve takip etmeyi öğrenir. Bu adım, promptu istatistiksel olarak olası görünen herhangi bir yönde devam ettirme eğiliminde olan (bazen talimatı tamamen göz ardı edip metni sanki bir belgeymiş gibi uzatan) ham bir temel model ile, "bu benim gerçekleştirmem gereken bir görev" olduğunu özellikle tanımak ve yardımcı, doğrudan şekilde yanıt vermek üzere özel olarak eğitilmiş bir "talimat" veya "sohbet" modeli arasındaki kritik farktır. Tüketiciye yönelik her sohbet modeli (Claude, ChatGPT, Gemini) talimat ayarlamasından geçmiştir (tipik olarak RLHF veya Anayasal Yapay Zeka gibi daha ileri hizalama teknikleriyle birlikte) -bu modellerin "Bu makaleyi özetle"ye neden metni daha uzun bir makale yazıyormuş gibi devam ettirmek yerine gerçek bir özetle güvenilir şekilde yanıt verdiğinin nedenidir. SaaS geliştiricileri için talimat ayarlama, çoğunlukla prompt mühendisliğinin neden bu şekilde işlediğini açıklayan arka plan bilgisi olarak ilgilidir: modeller talimatları tanımak ve takip etmek üzere eğitildiği için, bir promptta iyi ifade edilmiş, açık talimatlar belirsiz önerilerden çok daha güvenilirdir ve bu eğitim sürecini anlamak gözlemlenen model davranışını açıklamaya yardımcı olur -örneğin, modellerin "Bu faturadan toplamı çıkar" gibi açık direktif olarak ifade edilmiş promptlara neden "Bu faturadaki toplamın ne olabileceğini merak ediyorum" gibi dolaylı veya üstü kapalı ifadelere göre belirgin şekilde daha iyi yanıt verdiği. Bu, prompt mühendisliğinin kendisinden (çıkarım anında, sabit bir modelle gerçekleşir) ve bir SaaS şirketinin zaten talimat ayarlanmış bir modelin üzerine, onu dar bir görev için daha da uzmanlaştırmak amacıyla yapabileceği daha ileri özel fine-tuning'den farklıdır. Somut örnek: talimat ayarlanmamış bir temel modele "Şunu Fransızcaya çevir: Hello, how are you?" promptu verildiğinde, gerçekte Fransızca çeviriyi üretmek yerine daha fazla örnek çeviri çifti ile devam edebilir ("Şunu İspanyolcaya çevir: ...") çünkü "bu bir çeviri alıştırmaları listesi gibi görünüyor" kalıbını eşleştiriyordur, gerçekleştirilecek bir görevi tanımıyordur. Aynı prompt Claude gibi talimat ayarlanmış bir modele gönderildiğinde güvenilir şekilde doğrudan "Bonjour, comment allez-vous?" döndürür, çünkü talimat ayarlama modele özellikle emir kipi görev çerçevelemesini tanımayı ve kalıbı devam ettirmek yerine görevi tamamlayarak yanıt vermeyi öğretmiştir.

İlgili terimler

Daha fazla Komut Mühendisliği terimi