Ne oldu?
GitHub'da Strata adıyla paylaşılan bir proje, 125 milyar parametreli Qwen 3.8 Flash Next modelinin tek bir RTX 4090 ekran kartında saniyede 100 token (100T/s) hızında çalıştırılabildiğini öne sürüyor. Haber, Hacker News'te 376 puanla öne çıktı.
Neden dikkat çekiyor?
Bu ölçekteki modeller normalde birden fazla üst düzey veri merkezi GPU'su gerektirir. Tüketici seviyesindeki tek bir kartta bu hızın yakalanması, yerel yapay zekâ çalıştırma tartışmalarını yeniden alevlendirdi.
Belirsizlikler
Kaynak metin yalnızca başlıktan oluşuyor; kullanılan nicemleme (quantization), bellek yönetimi veya hangi çıkarım motorunun kullanıldığı gibi teknik ayrıntılar paylaşılmadı. Bu nedenle iddianın bağımsız doğrulaması henüz yok.
