Token
- Türkçe karşılığı
- belirteç
- Okunuşu
- tokın
Günlük kullanımda çoğunlukla İngilizcesi tercih edilir.
Kısaca
Token, bir LLM'nin okuduğu ve ürettiği temel metin birimidir; genellikle bir sözcük, sözcük parçası ya da noktalama işaretidir ve sayısal bir kimliğe eşlenir.
Bir LLM'de token nedir?
Dil modelleri metni harf harf ya da sözcük sözcük okumaz; token okur. Token, 'the' gibi yaygın bir sözcük, uzun bir sözcüğün 'ing' gibi bir parçası, bir noktalama işareti ya da bir boşluk ve ardından gelen sözcük gibi küçük bir metin parçasıdır. Metin modele ulaşmadan önce tokenizer adı verilen bir bileşen onu token'lara böler ve her birini token kimliği (ID) denen bir sayıya dönüştürür.
Çoğu tokenizer, eğitim metninden sık geçen parçaların bir sözlüğünü öğrenen byte-pair encoding gibi alt sözcük (subword) yöntemlerini kullanır. Yaygın sözcükler tek bir token olurken nadir sözcükler, isimler ve kod birkaç parçaya bölünür. İngilizcede bir token ortalama dört karakter, yani kabaca bir sözcüğün dörtte üçü kadardır; ancak diğer diller, emoji ve kaynak kod aynı miktarda metin için çoğu zaman daha fazla token gerektirir.
Token'lar geliştiriciler için önemlidir, çünkü hemen her şey onlarla ölçülür. Bağlam pencereleri, çıktı sınırları, hız sınırları ve API fiyatlandırması token cinsinden sayılır; üretim hızı da çoğunlukla saniyedeki token sayısıyla ifade edilir. Kullanışlı bir benzetme, web sayfası yerine gigabayt ile ölçülen bir mobil veri paketidir: token, bir LLM'nin kapasite ve faturalandırma için kullandığı birimdir.
LLM token'ı, kimliği ya da izni kanıtlayan JWT veya API anahtarı gibi bir güvenlik token'ıyla aynı şey değildir. Embedding'den de farklıdır: token, kimliği olan bir metin parçasıdır; modelin içinde her token kimliği, anlamını taşıyan bir embedding vektörüne dönüştürülür.
Önemli noktalar
- Token bir metin parçasıdır: sözcük, sözcük parçası ya da sembol.
- Tokenizer metni token'lara böler ve her birini sayısal bir kimliğe eşler.
- İngilizcede bir token kabaca dört karakter ya da bir sözcüğün dörtte üçüdür.
- Bağlam pencereleri, sınırlar ve fiyatlandırma token cinsinden ölçülür.
- Farklı modeller farklı tokenizer'lar kullanır; bu yüzden token sayıları aralarında değişir.
Örnek
// One way a tokenizer might split a sentence (the exact split varies by model)
const text = "Tokenization isn't hard!";
const tokens = ["Token", "ization", " isn", "'t", " hard", "!"];
console.log(tokens.join("") === text); // true: the tokens rebuild the original text
console.log(tokens.length); // 6 tokens
// Rule of thumb for English text: about 4 characters per token
function estimateTokens(input: string): number {
return Math.ceil(input.length / 4);
}
console.log(estimateTokens(text)); // 6 (24 characters / 4)Sık sorulan sorular
1.000 token kaç sözcük eder?
Tipik İngilizce metinde 1.000 token kabaca 750 sözcüktür. Kesin sayı tokenizer'a ve metne bağlıdır; kod ya da İngilizce dışındaki diller sözcük başına genellikle daha fazla token kullanır.
LLM'ler neden sözcük yerine token kullanır?
Alt sözcük token'larından oluşan sabit bir sözlük, daha küçük parçaları birleştirerek yeni sözcükler, yazım hataları, isimler ve kod dahil her metni temsil edebilir. Tam sözcük kullanmak devasa bir sözlük gerektirir ve modelin hiç görmediği sözcüklerde yine başarısız olur.
Girdi ve çıktı token'ları aynı ücrete mi tabidir?
Her zaman değil. Birçok yapay zekâ API'si girdi ve çıktı token'larını ayrı fiyatlandırır; model çıktı token'larını tek tek üretmek zorunda olduğu için çıktı token'ları çoğu zaman daha pahalıdır.
İlgili sayfalar
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- Bağlam PenceresiYapay Zekâ ve Makine Öğrenmesi, s. 5Bağlam penceresi, bir LLM'nin prompt, konuşma geçmişi ve kendi yanıtı dahil aynı anda dikkate alabildiği, token cinsinden en fazla metin miktarıdır.
- EmbeddingYapay Zekâ ve Makine Öğrenmesi, s. 18Embedding, metin, görüntü ya da başka verilerin anlamını vektör denen bir sayı listesiyle temsil eden ve benzer öğeleri birbirine yakın konumlandıran yapıdır.
- TransformerYapay Zekâ ve Makine Öğrenmesi, s. 45Transformer, bir dizideki her token'ın diğerleriyle ilişkisini attention ile tartan ve çoğu modern LLM'e güç veren bir sinir ağı mimarisidir.
- InferenceYapay Zekâ ve Makine Öğrenmesi, s. 26Inference, eğitilmiş bir makine öğrenmesi modelinin, öğrendiklerini değiştirmeden yeni verilerden tahmin ya da çıktı üretmek için kullanıldığı aşamadır.
- PromptYapay Zekâ ve Makine Öğrenmesi, s. 35Prompt, bir LLM gibi bir yapay zekâ modeline hangi görevi yapmasını ve nasıl bir yanıt istediğinizi söylemek için verdiğiniz girdi metni ya da yönergelerdir.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin