Ana içeriğe geç

Token

Türkçe karşılığı
belirteç
Okunuşu
tokın

Günlük kullanımda çoğunlukla İngilizcesi tercih edilir.

Güncellendi 2 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/llm-token

Kısaca

Token, bir LLM'nin okuduğu ve ürettiği temel metin birimidir; genellikle bir sözcük, sözcük parçası ya da noktalama işaretidir ve sayısal bir kimliğe eşlenir.

Bir LLM'de token nedir?

Dil modelleri metni harf harf ya da sözcük sözcük okumaz; token okur. Token, 'the' gibi yaygın bir sözcük, uzun bir sözcüğün 'ing' gibi bir parçası, bir noktalama işareti ya da bir boşluk ve ardından gelen sözcük gibi küçük bir metin parçasıdır. Metin modele ulaşmadan önce tokenizer adı verilen bir bileşen onu token'lara böler ve her birini token kimliği (ID) denen bir sayıya dönüştürür.

Çoğu tokenizer, eğitim metninden sık geçen parçaların bir sözlüğünü öğrenen byte-pair encoding gibi alt sözcük (subword) yöntemlerini kullanır. Yaygın sözcükler tek bir token olurken nadir sözcükler, isimler ve kod birkaç parçaya bölünür. İngilizcede bir token ortalama dört karakter, yani kabaca bir sözcüğün dörtte üçü kadardır; ancak diğer diller, emoji ve kaynak kod aynı miktarda metin için çoğu zaman daha fazla token gerektirir.

Token'lar geliştiriciler için önemlidir, çünkü hemen her şey onlarla ölçülür. Bağlam pencereleri, çıktı sınırları, hız sınırları ve API fiyatlandırması token cinsinden sayılır; üretim hızı da çoğunlukla saniyedeki token sayısıyla ifade edilir. Kullanışlı bir benzetme, web sayfası yerine gigabayt ile ölçülen bir mobil veri paketidir: token, bir LLM'nin kapasite ve faturalandırma için kullandığı birimdir.

LLM token'ı, kimliği ya da izni kanıtlayan JWT veya API anahtarı gibi bir güvenlik token'ıyla aynı şey değildir. Embedding'den de farklıdır: token, kimliği olan bir metin parçasıdır; modelin içinde her token kimliği, anlamını taşıyan bir embedding vektörüne dönüştürülür.

Önemli noktalar

  • Token bir metin parçasıdır: sözcük, sözcük parçası ya da sembol.
  • Tokenizer metni token'lara böler ve her birini sayısal bir kimliğe eşler.
  • İngilizcede bir token kabaca dört karakter ya da bir sözcüğün dörtte üçüdür.
  • Bağlam pencereleri, sınırlar ve fiyatlandırma token cinsinden ölçülür.
  • Farklı modeller farklı tokenizer'lar kullanır; bu yüzden token sayıları aralarında değişir.

Örnek

Metnin token'lara nasıl bölündüğütypescript
// One way a tokenizer might split a sentence (the exact split varies by model)
const text = "Tokenization isn't hard!";
const tokens = ["Token", "ization", " isn", "'t", " hard", "!"];

console.log(tokens.join("") === text); // true: the tokens rebuild the original text
console.log(tokens.length);            // 6 tokens

// Rule of thumb for English text: about 4 characters per token
function estimateTokens(input: string): number {
  return Math.ceil(input.length / 4);
}

console.log(estimateTokens(text)); // 6 (24 characters / 4)

Sık sorulan sorular

1.000 token kaç sözcük eder?

Tipik İngilizce metinde 1.000 token kabaca 750 sözcüktür. Kesin sayı tokenizer'a ve metne bağlıdır; kod ya da İngilizce dışındaki diller sözcük başına genellikle daha fazla token kullanır.

LLM'ler neden sözcük yerine token kullanır?

Alt sözcük token'larından oluşan sabit bir sözlük, daha küçük parçaları birleştirerek yeni sözcükler, yazım hataları, isimler ve kod dahil her metni temsil edebilir. Tam sözcük kullanmak devasa bir sözlük gerektirir ve modelin hiç görmediği sözcüklerde yine başarısız olur.

Girdi ve çıktı token'ları aynı ücrete mi tabidir?

Her zaman değil. Birçok yapay zekâ API'si girdi ve çıktı token'larını ayrı fiyatlandırır; model çıktı token'larını tek tek üretmek zorunda olduğu için çıktı token'ları çoğu zaman daha pahalıdır.

İlgili sayfalar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar