İçeriğe geç
Sıfırıncı Dakika
Son haberler

Aleph Alpha, 78,1 milyar parametreli açık ağırlıklı Kolibri modelini yayınladı

ModellerLansmanGüncellendi: 2 dk okuma
Aleph Alpha, 78,1 milyar parametreli açık ağırlıklı Kolibri modelini yayınladı

Kısaca

Alman yapay zekâ şirketi Aleph Alpha, İngilizce ve Almanca için geliştirdiği açık ağırlıklı Kolibri modelini Hugging Face üzerinde Apache 2.0 lisansıyla yayınladı. 78,1 milyar toplam parametreye sahip model, her token için yalnızca 3,46 milyar parametre (yüzde 4,4) çalıştırıyor ve 1.048.576 token'a kadar bağlam kabul ediyor. Model, kamu yönetimi ve havacılık gibi düzenlemeye tabi sektörlerde egeme

  • 78,1 milyar toplam parametre, token başına yalnızca 3,46 milyar aktif (yüzde 4,4)
  • 1.048.576 token'a kadar bağlam penceresi
  • İngilizce-Almanca iki dilli MoE mimarisi
  • İstek başına ayarlanabilir akıl yürütme eforu
  • Apache 2.0 lisansıyla Hugging Face'te açık ağırlıklar
  • Tek B200/B300/H200 veya 2 H100 SXM5 üzerinde çalışabilen FP8 sürümü

Kolibri nedir?

Aleph Alpha, İngilizce ve Almanca için geliştirdiği açık ağırlıklı Kolibri (Kolibri-1) modelini yayınladı. Model, Mixture-of-Experts (MoE) yani "uzmanlar karışımı" mimarisine dayanıyor: toplam 78,1 milyar parametre barındırıyor ama her token için yalnızca 3,46 milyar parametre, yani yüzde 4,4'ü devreye giriyor. Bu sayede büyük bir modelin kapasitesi, çok daha küçük bir modelin işlem maliyetine yakın çalıştırılabiliyor.

Model, Hugging Face üzerinde Apache 2.0 lisansıyla sunuluyor ve 1.048.576 token'a kadar bağlam penceresi kabul ediyor. Kullanıcılar her istek için "akıl yürütme eforu" seviyesini ayarlayabiliyor.

Mimari ve eğitim

Kolibri, 50 transformer bloğu ve 2.560 model genişliği kullanıyor. Her MoE katmanı 384 yönlendirilmiş uzmanı puanlıyor, token'ı en iyi 6 uzmana gönderiyor ve her zaman 1 paylaşılan uzmanı çalıştırıyor. Dikkat mekanizmasında her beşinci blok konum kodlaması olmadan tam dikkat kullanırken, diğer 40 blok önceki 512 token üzerinde kayan pencere dikkati kullanıyor. Şirkete göre bu hibrit yaklaşım, aynı hesaplama gücünde tam dikkatli bir modele kıyasla 4 kat daha uzun dizileri destekliyor.

Eğitim 768 NVIDIA B200 GPU üzerinde 20 trilyon token ile başladı, ardından 3,44 trilyon token orta eğitim ve 201 milyar token'lık uzun bağlam aşaması geldi. Aleph Alpha, web'den derlediği veya sentetik ürettiği 2 trilyondan fazla Almanca token eklediğini belirtiyor.

Almanca için özel tokenizer

128.000 token'lık sözlük, UniBPE yöntemiyle eğitilmiş. Almanca metinde token başına 4,90 bayta ulaşan model, GPT-5 tokenizer'ının 4,35 değerini geçerek Almanca web metinlerinde yüzde 11,2 daha az token kullanıyor.

Nerede çalışır?

FP8 sürümü yaklaşık 78 GB boyutunda ve tek bir B200, B300 veya H200 üzerinde ya da 2 adet H100 SXM5 GPU'da vLLM ile çalıştırılabiliyor. Aleph Alpha, modeli AB Genel Amaçlı Yapay Zekâ Uygulama Kuralları, AB Yapay Zekâ Yasası ve GDPR hedefleriyle uyumlu olacak şekilde tasarladığını, veri hattının eğitim öncesi kişisel verileri ayıkladığını belirtiyor.

Neden önemli?

Avrupa'da egemen yapay zekâ tartışması büyürken, açık ağırlıklı ve Almanca odaklı bir modelin tek sunucuda çalışabilmesi kurumlar için somut bir alternatif sunuyor. Seyrek mimarinin maliyet avantajını merak edenler için de iyi bir örnek.

Kaynaklar

  1. Hacker News (öne çıkanlar)İlk duyuran
    Kolibri: A Sovereign Open-Weight Model

İlgili haberler