Transformer
- Okunuşu
- trensformır
Kısaca
Transformer, bir dizideki her token'ın diğerleriyle ilişkisini attention ile tartan ve çoğu modern LLM'e güç veren bir sinir ağı mimarisidir.
Yapay zekâda transformer nedir?
Transformer, 2017'de yayımlanan Attention Is All You Need adlı araştırma makalesiyle tanıtılan bir sinir ağı mimarisi türüdür. Cümle gibi dizilerle çalışmak üzere tasarlanmıştır ve neredeyse tüm modern büyük dil modellerinin temeli haline gelmiştir. Transformer'lar görüntüler, ses, kaynak kod ve hatta protein yapıları için de kullanılır.
Temel fikir self-attention'dır. Girdi metni önce token'lara bölünür ve her token bir embedding'e dönüştürülür; ardından her katmanda her token diğer tüm token'lara bakar ve her birine ne kadar dikkat edeceğini hesaplar. 'The cat didn't eat because it was full' cümlesinde attention, modelin 'it' sözcüğünü 'cat' ile ilişkilendirmesine yardımcı olur. Çok sayıda attention katmanını üst üste koymak, modelin bağlam hakkında zengin bir anlayış oluşturmasını sağlar.
Recurrent (yinelemeli) sinir ağları denen önceki yaklaşımlar metni sözcük sözcük okurdu; bu da eğitimi yavaşlatıyor ve uzun pasajların başını unutmaya yatkın hale getiriyordu. Transformer'lar girdinin tüm token'larına aynı anda bakar; bu da GPU gibi paralel donanıma uygundur ve çok büyük modelleri devasa veri kümeleriyle eğitmeyi mümkün kılmıştır. Bir benzetme, mesajın bir hat boyunca kişiden kişiye aktarılması yerine herkesin diğer herkesi aynı anda duyabildiği bir grup tartışmasıdır.
Transformer bir mimaridir; bir ürün ya da tek bir model değildir. Farklı boyutlara ve eğitim verilerine sahip birçok farklı model aynı temel transformer tasarımı üzerine kurulur. Temel sınırlaması, attention maliyetinin girdi uzunluğuyla hızla, kabaca token sayısının karesiyle artmasıdır; bağlam pencerelerinin sınırlı olmasının nedenlerinden biri budur.
Önemli noktalar
- Transformer, self-attention etrafında kurulmuş bir sinir ağı mimarisidir.
- Attention, her token'ın girdideki diğer her token'ın ilgisini tartmasını sağlar.
- Transformer'lar girdi token'larını paralel işler; bu da büyük ölçekli eğitimi mümkün kılar.
- Çoğu modern LLM transformer mimarisine dayanır.
- Attention maliyeti girdi uzunluğuyla hızla artar; bu da bağlam pencerelerini sınırlar.
Örnek
import math
def softmax(scores):
exps = [math.exp(s) for s in scores]
total = sum(exps)
return [e / total for e in exps]
# Toy vectors: the query for "it" and keys for three earlier words
query_it = [1.0, 0.5]
keys = {"cat": [0.9, 0.6], "eat": [0.1, -0.4], "full": [0.4, 0.2]}
# Score = dot product of the query with each key; softmax turns scores into weights
scores = [sum(q * k for q, k in zip(query_it, key)) for key in keys.values()]
for word, weight in zip(keys, softmax(scores)):
print(word, round(weight, 2)) # cat 0.57, eat 0.15, full 0.28Sık sorulan sorular
Transformer'lar yapay zekâda neden önemlidir?
Transformer'lar metni paralel işledikleri ve sözcükler arasındaki uzun mesafeli ilişkileri yakaladıkları için çok daha büyük dil modellerinin verimli biçimde eğitilmesini mümkün kıldı. Hemen hemen her modern LLM bu mimariye dayanır.
Self-attention nedir?
Self-attention, bir dizideki her token'ın diğer her token'ın kendisi için ne kadar ilgili olduğunu hesaplamasını ve bilgilerini buna göre birleştirmesini sağlayan mekanizmadır. Transformer, bir zamirin hangi isme işaret ettiği gibi bağlamı bu şekilde anlar.
Transformer ile LLM arasındaki fark nedir?
Transformer bir sinir ağı tasarımıdır; LLM ise büyük miktarda metinle eğitilmiş belirli bir modeldir. Çoğu LLM transformer mimarisini kullanır, ancak transformer'lar görüntü, konuşma ve diğer veri türleri için de kullanılır.
İlgili sayfalar
- Yapay Sinir AğıYapay Zekâ ve Makine Öğrenmesi, s. 49Yapay sinir ağı, bağlantılı yapay nöron katmanlarından oluşan ve sayısal ağırlıkları ayarlayarak verilerden örüntü öğrenen bir makine öğrenmesi modelidir.
- Derin ÖğrenmeYapay Zekâ ve Makine Öğrenmesi, s. 14Derin öğrenme, görüntü ve metin gibi ham verilerden karmaşık örüntüleri öğrenmek için çok katmanlı sinir ağları kullanan bir makine öğrenmesi alt kümesidir.
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- TokenYapay Zekâ ve Makine Öğrenmesi, s. 43Token, bir LLM'nin okuduğu ve ürettiği temel metin birimidir; genellikle bir sözcük, sözcük parçası ya da noktalama işaretidir ve sayısal bir kimliğe eşlenir.
- Bağlam PenceresiYapay Zekâ ve Makine Öğrenmesi, s. 5Bağlam penceresi, bir LLM'nin prompt, konuşma geçmişi ve kendi yanıtı dahil aynı anda dikkate alabildiği, token cinsinden en fazla metin miktarıdır.
- EmbeddingYapay Zekâ ve Makine Öğrenmesi, s. 18Embedding, metin, görüntü ya da başka verilerin anlamını vektör denen bir sayı listesiyle temsil eden ve benzer öğeleri birbirine yakın konumlandıran yapıdır.
- Attention MekanizmasıYapay Zekâ ve Makine Öğrenmesi, s. 4Attention mekanizması, modelin her token için girdinin hangi bölümlerinin en önemli olduğuna karar verip onlara odaklanmasını sağlayan sinir ağı tekniğidir.
Kaynaklar
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin