prompt-eng

Prompt Testi (İstem Testi)

Prompt testi, bir sohbet arayüzünde yapılan birkaç manuel, geçici denemeye dayanarak bir promptun etkinliğine karar vermek yerine, doğruluğu, tutarlılığı ve kaliteyi nesnel olarak ölçmek için bir promptu (veya birden çok prompt sürümünü karşılaştırarak) sabit, temsili bir değerlendirme veri kümesine — gerçekçi girdilerin beklenen çıktılarla, doğru cevaplarla veya bir puanlama rubriğiyle eşleştirildiği derlenmiş bir küme — karşı sistematik olarak çalıştırma pratiğidir. Bu, geleneksel yazılım geliştirmedeki birim ve regresyon testinin, LLM promptlarının deterministik olmayan, doğal dil alanına uygulanmış doğrudan karşılığıdır ve titiz, üretim seviyesindeki prompt mühendisliğini gündelik prompt oynamasından ayıran pratiktir. Tipik bir prompt testi kurulumu şunları içerir: gerçek veya gerçekçi örneklerden oluşturulmuş bir değerlendirme veri kümesi (ideal olarak yalnızca kolay ortalama durum örneklerini değil, uç durumları ve bilinen zor girdileri de içerir; çünkü 10 kolay örnekte harika görünen bir prompt, gerçekten belirsiz veya olağandışı olan girdilerin %10'unda kötü şekilde başarısız olabilir); göreve uygun bir puanlama yöntemi (sınıflandırma veya çıkarım gibi tek doğru cevabı olan görevler için tam eşleşme veya bulanık eşleşme puanlaması; özetleme veya metin yazarlığı gibi açık uçlu üretken görevler için LLM-hakem puanlaması, burada eşleştirilecek tek bir "doğru" dize yoktur); prompt sürümlerini karşılaştırırken rastgeleliği karıştırıcı bir değişken olarak azaltmak için testi sıcaklık (temperature) 0'da çalıştırmak (veya birkaç çalıştırmanın ortalamasını almak); ve "küçük bir ifade değişikliği" bile olsa herhangi bir prompt değişikliğinin, dağıtımdan önce değerlendirme setine karşı yeniden çalıştırılmasını gerektirdiğini kabul etmek — çünkü promptların küçük değişikliklere duyarlılığı iyi belgelenmiştir ve açıkça bir iyileştirme gibi görünen bir değişiklik, gündelik manuel testte kapsanmayan girdilerde performansı geriletebilir. Prompt testi, prompt versiyonlamayı ve prompt kütüphanelerini zamanla gerçekten güvenilir kılan şeydir — ilişkili değerlendirme geçmişi olmayan versiyonlanmış bir prompt, üzerine bir sürüm numarası eklenmiş test edilmemiş bir tahminden ibarettir. SaaS geliştiricileri için, her üretim yapay zeka özelliği için mütevazı bir değerlendirme seti (30-100 temsili örnek) oluşturmak ve bunu her prompt değişikliğinde çalıştırmak, promptun izole anekdotlara dayanarak "iyileştirildikçe" sessizce bozulmayan yapay zeka özellikleri gönderme konusunda en yüksek getirili uygulamalardan biridir. Somut örnek: bir özgeçmiş tarama yapay zeka özelliğinin ekibi, gerçek geçmiş özgeçmişlerden, gerçek referans değer olarak insan değerlendirici tarafından atanmış "uygunluk puanları" ile 75 örneklik bir değerlendirme seti oluşturur. Herhangi bir prompt değişikliği yayınlanmadan önce, tüm 75 örneğe karşı çalıştırılır ve insan değerlendirici puanlarıyla uyum açısından puanlanır (+/-1 puan toleransıyla). Yeni bir puanlama boyutu ekleyen önerilen bir prompt değişikliği, mühendisin manuel olarak kontrol ettiği 5 örnekte açık bir iyileştirme gibi görünür, ancak tam 75 örneklik test, bunun aslında geleneksel olmayan kariyer yollarından (kariyer değiştirenler, doğrusal olmayan iş geçmişleri) gelen özgeçmişlerde uyumu gerilettiğini ortaya çıkarır — küçük manuel örneklemde görünmez olan ancak sistematik değerlendirme seti tarafından hemen yakalanan bir hata modu, gerçek bir doğruluk gerilemesinin üretime ulaşmasını önler.

İlgili terimler

Daha fazla Komut Mühendisliği terimi