LLM
Büyük Dil Modeli
Kısaca
LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
LLM nedir?
Büyük dil modeli (LLM), kitaplar, web siteleri ve kaynak kod gibi çok geniş bir metin koleksiyonuyla eğitilmiş bir sinir ağıdır. Dilin örüntülerini soruları yanıtlayacak, belgeleri özetleyecek, çeviri yapacak ve kod yazacak kadar iyi öğrenir. "Büyük" sözcüğü hem eğitim verisinin miktarına hem de milyarlara ya da daha fazlasına ulaşabilen parametre sayısına işaret eder.
Kaputun altında bir LLM token'larla çalışır; token, sözcük ya da sözcük parçası gibi küçük metin parçalarıdır. Model, prompt adı verilen girdi metnini alır, olası bir sonraki token'ı tahmin eder, bunu metne ekler ve yanıt tamamlanana kadar bu işlemi tekrarlar. Modern LLM'lerin çoğu transformer mimarisine dayanır; bu mimari, modelin bir sonraki token'ı tahmin ederken önceki her token'ın ne kadar önemli olduğunu tartmasını sağlar.
Geliştiriciler bir LLM'yi genellikle bir API üzerinden kullanır: bir prompt gönderir ve karşılığında üretilmiş metin alırlar. LLM'ler sohbet asistanlarına, kodlama asistanlarına, müşteri destek botlarına ve arama özelliklerine güç verir. Faydalı bir zihinsel model, çok kitap okumuş bir otomatik tamamlamadır: makul görünen metin üretmede çok iyidir, ancak bir bilgi kaynağına bağlanmadıkça gerçekleri kontrol etmez.
Bir LLM veritabanı ya da arama motoru değildir. Belgeleri kelimesi kelimesine güvenilir biçimde saklamaz, bilgisi bir eğitim kesim tarihinde durur ve halüsinasyon denen, kendinden emin ama yanlış yanıtlar üretebilir. Yanıtlarını gerçek ve güncel verilere dayandırmak için RAG gibi teknikler kullanılır.
Bir bakışta
Önemli noktalar
- Bir LLM, sonraki token'ı tekrar tekrar tahmin ederek metin üretir.
- Devasa metin veri kümeleriyle eğitilir ve milyarlarca parametreye sahiptir.
- Yerleşik bilgisi bir eğitim kesim tarihinde donmuştur.
- Çıktı kalitesi, verdiğiniz prompt'a ve bağlama büyük ölçüde bağlıdır.
- LLM'ler halüsinasyon görebilir; bu yüzden önemli yanıtlar doğrulanmalıdır.
Örnek
// Send a prompt to an LLM through a generic HTTP API
const response = await fetch("https://llm.example.com/v1/generate", {
method: "POST",
headers: { "Content-Type": "application/json" },
body: JSON.stringify({
prompt: "Explain recursion in one sentence.",
maxTokens: 60, // limit the length of the answer
temperature: 0.2, // lower = more predictable output
}),
});
const data = await response.json();
console.log(data.text);Sık sorulan sorular
LLM ile yapay zekâ arasındaki fark nedir?
Yapay zekâ, makinelerin akıllı görevleri yerine getirmesini amaçlayan geniş bir alandır; LLM ise metni anlamaya ve üretmeye odaklanmış belirli bir yapay zekâ modeli türüdür. Sohbet asistanları LLM'lerin üzerine kurulmuş uygulamalardır.
Bir LLM'de token nedir?
Token, bir LLM'nin okuduğu ve yazdığı metin birimidir; çoğu zaman bir sözcük ya da sözcük parçasıdır. İngilizcede bir token ortalama olarak bir sözcüğün yaklaşık dörtte üçü kadardır; kullanım sınırları ve fiyatlandırma da genellikle token cinsinden ölçülür.
Bağlam penceresi (context window) nedir?
Bağlam penceresi, bir LLM'nin hem prompt'u hem de yanıtı dahil olmak üzere aynı anda dikkate alabildiği, token cinsinden ölçülen en fazla metin miktarıdır. Pencerenin dışında kalan her şey model için görünmezdir.
İlgili sayfalar
- Makine ÖğrenmesiYapay Zekâ ve Makine Öğrenmesi, s. 30Makine öğrenmesi, bilgisayarların elle yazılmış kurallar yerine verilerdeki örüntüleri öğrenerek tahmin yaptığı bir yapay zekâ dalıdır.
- PromptYapay Zekâ ve Makine Öğrenmesi, s. 35Prompt, bir LLM gibi bir yapay zekâ modeline hangi görevi yapmasını ve nasıl bir yanıt istediğinizi söylemek için verdiğiniz girdi metni ya da yönergelerdir.
- EmbeddingYapay Zekâ ve Makine Öğrenmesi, s. 18Embedding, metin, görüntü ya da başka verilerin anlamını vektör denen bir sayı listesiyle temsil eden ve benzer öğeleri birbirine yakın konumlandıran yapıdır.
- RAGYapay Zekâ ve Makine Öğrenmesi, s. 38RAG, bir LLM'in soru anında getirilen ilgili belgelere dayanarak yanıt vermesini sağlayan ve yanıtları güncel, özel verilere dayandıran bir tekniktir.
- HalüsinasyonYapay Zekâ ve Makine Öğrenmesi, s. 25Halüsinasyon, bir LLM gibi yapay zekâ modelinin kendinden emin bir şekilde kulağa makul gelen ama yanlış, uydurma ya da kaynaksız bilgi üretmesidir.
- APIBackend ve API'ler, s. 2API, bir yazılımın başka bir yazılımdan veri ya da işlem talep etmesini sağlayan, belgelenmiş ve öngörülebilir kurallar bütünüdür.
- GPTYapay Zekâ ve Makine Öğrenmesi, s. 23GPT (Generative Pre-trained Transformer), bir sonraki token'ı tahmin ederek metin üreten, OpenAI'a ait bir büyük dil modeli ailesidir.
- Reasoning ModelYapay Zekâ ve Makine Öğrenmesi, s. 39Reasoning model, yanıt vermeden önce problemi adım adım çözmek üzere eğitilmiş, zor işlerde daha iyi sonuç için ek hesaplama harcayan bir dil modelidir.
- Mixture of ExpertsYapay Zekâ ve Makine Öğrenmesi, s. 31Mixture of experts (MoE), her girdiyi çok sayıda küçük uzman ağdan yalnızca birkaçına gönderen sinir ağı tasarımıdır; devasa bir model çok daha ucuza çalışır.
- EvalsYapay Zekâ ve Makine Öğrenmesi, s. 19Evals, yapay zekâ testleridir: beklenen sonucu ya da puanlama kuralı olan girdilerle her değişiklikten sonra bir modelin ya da prompt'un başarısını ölçer.
- Attention MekanizmasıYapay Zekâ ve Makine Öğrenmesi, s. 4Attention mekanizması, modelin her token için girdinin hangi bölümlerinin en önemli olduğuna karar verip onlara odaklanmasını sağlayan sinir ağı tekniğidir.
Kaynaklar
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin