Evals
Evaluations (değerlendirmeler)
- Okunuşu
- ivals
Kısaca
Evals, yapay zekâ testleridir: beklenen sonucu ya da puanlama kuralı olan girdilerle her değişiklikten sonra bir modelin ya da prompt'un başarısını ölçer.
Evals nedir?
Bir eval, bir yapay zekâ sistemini sabit bir örnek kümesi üzerinde çalıştırır ve sonuçları puanlar. Her örnek, bir soru ya da destek talebi gibi bir girdiyi iyi bir cevabın nasıl olması gerektiğiyle eşleştirir: kesin bir beklenen değer, içermesi gereken bir olgu listesi ya da cevabı değerlendirmek için bir ölçüt. Puan, sistemin ne sıklıkla doğruyu bulduğunu gösterir.
Dil modellerinin cevapları değişkendir ve çoğu zaman serbest metindir; bu yüzden eval'ler birkaç tür denetimi bir araya getirir. Kod; geçerli bir JSON, doğru bir sayı ya da gerekli bir anahtar kelime gibi yapıyı denetleyebilir. İkinci bir model, bir cevabı bir ölçüte göre puanlayabilir; buna LLM-as-a-judge denir. İnsanlar da hem otomatik denetimlerin kaçırdığını yakalamak hem de otomatik yargıçların kendileriyle aynı fikirde olduğundan emin olmak için bir örneklemi inceler.
Eval'ler, sıradan yazılımda birim testlerinin oynadığı rolü oynar. Ekipler yeni bir modele geçmeden, bir prompt'u düzenlemeden ya da belgelerin nasıl getirildiğini değiştirmeden önce bunları koşar ve gerilemeleri yakalamak için puanları karşılaştırır. Canlı trafikten de örnekler alınıp puanlanır, çünkü gerçek kullanıcılar hiçbir test kümesinin öngörmediği şeyler sorar.
Önemli noktalar
- Bir eval, bir yapay zekâ sistemini bilinen iyi cevapları ya da kuralları olan sabit bir örnek kümesiyle puanlar.
- Denetimler kesin eşleşmelerden ve kod denetimlerinden LLM-as-a-judge ve insan incelemesine kadar uzanır.
- Gerilemeleri yakalamak için her model, prompt ya da getirme değişikliğinden sonra koşulur.
- Yargıç modelin kendisi de insan puanlarıyla karşılaştırılarak denetlenmelidir.
Örnek
const cases = [
{ input: "What is 12 + 30?", expected: "42" },
{ input: "Capital of Türkiye?", expected: "Ankara" },
];
let passed = 0;
for (const { input, expected } of cases) {
const answer = await model.generate(input);
if (answer.includes(expected)) passed++;
else console.log("FAIL", input, "->", answer);
}
console.log(`${passed}/${cases.length} passed`);Sık sorulan sorular
LLM-as-a-judge nedir?
Bir modelin cevaplarını puanlamak için, genellikle "doğru, eksiksiz ve kibar mı?" gibi yazılı bir ölçüte göre, başka bir dil modeli kullanmaktır. İnsan incelemesinden çok daha iyi ölçeklenir; ama yargıç taraflı ya da yanlış olabilir, bu yüzden puanları bir örneklem üzerinde insan puanlarıyla karşılaştırılmalıdır.
Eval'lerin benchmark'lardan farkı nedir?
Benchmark'lar, modelleri birbiriyle karşılaştırmak için kullanılan herkese açık, genel test kümeleridir. Eval'ler ise genellikle ürününüzün gerçek görevlerinden oluşturulmuş kendi örneklerinizdir ve bir değişikliğin uygulamanızı iyileştirip iyileştirmediğini söyler.
İlgili sayfalar
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- HalüsinasyonYapay Zekâ ve Makine Öğrenmesi, s. 25Halüsinasyon, bir LLM gibi yapay zekâ modelinin kendinden emin bir şekilde kulağa makul gelen ama yanlış, uydurma ya da kaynaksız bilgi üretmesidir.
- Prompt MühendisliğiYapay Zekâ ve Makine Öğrenmesi, s. 36Prompt mühendisliği, yapay zekâ modelinin doğru, tutarlı ve kullanışlı çıktı üretmesi için verilen yönergeleri tasarlama, test etme ve iyileştirme pratiğidir.
- Birim TestiTest ve Kalite, s. 4Birim testi, bir fonksiyonun, metodun ya da sınıfın programın geri kalanından yalıtılmış olarak doğru davrandığını doğrulayan küçük ve otomatik bir kontroldür.
- Regresyon TestiTest ve Kalite, s. 21Regresyon testi, daha önce çalışan özelliklerin bozulmadığından emin olmak için bir kod değişikliğinden sonra mevcut testleri yeniden çalıştırma pratiğidir.
- Yapay Zekâ AjanıYapay Zekâ ve Makine Öğrenmesi, s. 51Yapay zekâ ajanı, hangi araçları çağıracağına karar verip sonuçları gözlemleyerek çok adımlı görevleri planlayan ve yürüten, LLM kullanan bir sistemdir.
- RAGYapay Zekâ ve Makine Öğrenmesi, s. 38RAG, bir LLM'in soru anında getirilen ilgili belgelere dayanarak yanıt vermesini sağlayan ve yanıtları güncel, özel verilere dayandıran bir tekniktir.
- Test CaseTest ve Kalite, s. 28Test case, belirli bir davranışın kontrolüdür: başlangıç koşulları, girdi ya da adımlar ve yazılımın doğru davranıp davranmadığını gösteren beklenen sonuç.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin