Fareed Khan isimli bir geliştirici, 2.8 trilyon parametreli Kimi K3 modelini 8 GB RAM ile çalıştırmayı başardı. Ancak geliştiricinin yaptığı şey K3ü küçültmek değil, modelin neredeyse 1.56 TB büyüklüğünde olan dosyalarını SSDde tutmak oldu. RAM ise hesaplama sırasında gereken küçük parçalar için geçici çalışma alanı olarak kullanıldı.
Kısacası yapay zeka bilgisayara sığdırılmadı; depolama birimi son derece yavaş çalışan bir bellek gibi kullanıldı.Bir Token İçin 33 SaniyeKimi K3, Mixture of Experts (MoE) temelini kullanıyor. Bilmeyenler için MoE, bir şirkette her işi tek kişinin yapması yerine, konuya göre muhasebecinin, avukatın veya mühendisin devreye girmesi gibi çalışan bir yapay zeka mimarisidir. Tüm parametreler aynı anda devreye girmediği için ihtiyaç duyulan kısımlar SSDden okunuyor.
Böylece Kimi K3, 8 GB belleğe sığmış gibi çalışıyor. Bunun karşılığında ise hız ciddi biçimde düşmüş. Tek tokenın üretilmesi yaklaşık 33 saniye sürmüş.
Bu tempo sıradan bir sohbet yanıtının bile uzun saatlere yayılması demek.Testin Asıl Önemi Nedir?Ortaya günlük kullanıma uygun bir yapay zeka aracı çıkmadı. Kısa bir yanıtın üretilmesi bile saatler sürebiliyor. Üstelik modelin 2 TB depolama alanına ve hızlı bir SSDye ihtiyacı var.
Yine de bu yapılan önemli, çünkü büyük modellerin bir şekilde düşük RAMli sistemlerde çalıştırılabileceğini de gösterdi.