Mixture of Experts
MoE
- Türkçe karşılığı
- uzmanlar karışımı
- Okunuşu
- mikscır ov ekspörts
Günlük kullanımda çoğunlukla İngilizcesi tercih edilir.
Kısaca
Mixture of experts (MoE), her girdiyi çok sayıda küçük uzman ağdan yalnızca birkaçına gönderen sinir ağı tasarımıdır; devasa bir model çok daha ucuza çalışır.
Mixture of Experts nedir?
Sıradan, yoğun (dense) bir modelde her parametre her token'ın işlenmesine katılır. Mixture of experts modelinde ise bazı katmanlarda tek bir ağ yerine çok sayıda paralel uzman ağ bulunur. Küçük bir yönlendirici (router) ağ her token'a bakar ve ona en uygun birkaç uzmanı seçer; yalnızca onlar çalışır, diğer uzmanlar o token için boşta kalır.
Bu, modelin toplam boyutunu token başına yapılan işten ayırır. Bir model yüz milyarlarca parametrelik bilgi tutarken her token bunların yalnızca bir kısmından geçer. Mistral'in 2023'te yayımlanan Mixtral 8x7B modelinde bu tür her katmanda sekiz uzman vardır ve her token için ikisi kullanılır; bugünün en büyük dil modellerinin birçoğu da aynı fikri kullanır.
Fikir, 1991'de yerel uzmanların uyarlanabilir karışımları üzerine yazılmış bir makaleye dayanır; büyük ağlar için seyrek (sparse) türleri de 2017'de gösterildi. MoE modelleri aynı toplam boyuttaki yoğun modellerden daha hızlı eğitilir ve yanıt verir; ama bütün uzmanlar için bellek gerekir, eğitim sırasında da yönlendiricinin her şeyi birkaç gözde uzmana göndermesi engellenmelidir.
Sık yapılan bir yanlış, her uzmanın insanların anladığı bir konuda uzmanlaştığını düşünmektir; örneğin biri hukuk, biri kod için. Pratikte yönlendirici kendi kalıplarını öğrenir; bunlar çoğu zaman token türlerine ya da sözdizimine dayanır ve uzmanlaşma nadiren bu kadar düzenli ya da adlandırması kolaydır.
Önemli noktalar
- MoE katmanları çok sayıda uzman ağ ve her token için birkaçını seçen bir yönlendirici içerir.
- Yalnızca seçilen uzmanlar çalışır; böylece token başına hesaplama küçük kalır.
- Toplam parametre sayısı çok büyük olabilirken aktif parametreler mütevazı kalır.
- Yine de bütün uzmanların belleğe sığması ve yönlendirmenin dengeli kalması gerekir.
- Uzmanlar düzenli insan konularını değil, kendi kalıplarını öğrenir.
Sık sorulan sorular
Aktif parametreler nedir?
Bir token için gerçekten kullanılan parametrelerdir. MoE modelinde toplamdan çok daha azdır, çünkü yalnızca seçilen uzmanlar çalışır. Hız ve maliyet aktif sayıya, bellek ise toplama bağlıdır.
Mixture of experts birkaç ayrı model mi?
Hayır. Bazı katmanları birkaç uzman alt ağ içeren tek bir modeldir. Uzmanlar, yönlendirici ve ortak katmanlarla birlikte eğitilir.
Mixture of experts neden kullanılır?
Çok büyük bir modelin bilgisini çok daha küçük bir modelin çalışma maliyetiyle elde etmek için. Laboratuvarların, her token için gereken hesaplamayı aynı hızda büyütmeden model kapasitesini büyütmesini sağlar.
İlgili sayfalar
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- Yapay Sinir AğıYapay Zekâ ve Makine Öğrenmesi, s. 49Yapay sinir ağı, bağlantılı yapay nöron katmanlarından oluşan ve sayısal ağırlıkları ayarlayarak verilerden örüntü öğrenen bir makine öğrenmesi modelidir.
- Model ParametreleriYapay Zekâ ve Makine Öğrenmesi, s. 33Model parametreleri, bir makine öğrenmesi modelinin eğitimde öğrendiği ve girdileri çıktılara dönüştürmek için kullandığı ağırlık ve sapma gibi iç sayılardır.
- TransformerYapay Zekâ ve Makine Öğrenmesi, s. 45Transformer, bir dizideki her token'ın diğerleriyle ilişkisini attention ile tartan ve çoğu modern LLM'e güç veren bir sinir ağı mimarisidir.
- InferenceYapay Zekâ ve Makine Öğrenmesi, s. 26Inference, eğitilmiş bir makine öğrenmesi modelinin, öğrendiklerini değiştirmeden yeni verilerden tahmin ya da çıktı üretmek için kullanıldığı aşamadır.
- Derin ÖğrenmeYapay Zekâ ve Makine Öğrenmesi, s. 14Derin öğrenme, görüntü ve metin gibi ham verilerden karmaşık örüntüleri öğrenmek için çok katmanlı sinir ağları kullanan bir makine öğrenmesi alt kümesidir.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin