Vera Rubin, CoreWeave’de üretime girdi: İlk müşteri Cognition oldu
CoreWeave, seçilmiş müşterilere açtığı yeni platformda Cognition’ın SWE-2 iş yükünde 4,8 kata kadar toplam token üretimi ölçtüğünü açıkladı.
Yeni çıkarım sistemi, Vera Rubin platformunda düşük gecikmeli yanıt üretimini ayrı bir donanım katmanına taşıyor.
Duyuru / olay tarihi:

NVIDIA, 24 Ağustos 2026’da Groq 3 LPX sisteminin tam üretime geçtiğini açıkladı. Platform, Vera Rubin altyapısında özellikle yanıt üretiminin düşük gecikmeyle yürütülmesini hedefliyor. Nebius ilk benimseyen şirket olarak duyuruldu; hizmeti Token Factory platformuna getirme planı da açıklandı. Bu ifade, aynı gün bütün bulut müşterilerinin ürüne erişebildiği veya tüm bölgelerde kapasite bulunduğu anlamına gelmiyor.
LPX belgeleri, sistemin 256 LPU içeren bir raf tasarımı kullandığını anlatıyor. NVIDIA, uzun bağlam işleme ile yanıt üretimini farklı bileşenler arasında paylaştıran mimarisini vurguluyor. Duyuruda Gemma 4 31B için belirtilen yüksek çıktı hızı, seçilmiş model ve bağlam koşullarındaki üretici değerlendirmesi. Bu sonucu bütün modellerin, bütün kullanıcı sayılarının veya herhangi bir uygulamanın aynı hızda çalışacağı biçiminde okumak doğru olmaz.
Mizan’ın değerlendirmesinde gelişmenin merkezinde, bir yapay zekâ ajanının birden fazla adımı art arda yapması bulunuyor. Kullanıcıya tek cevap veren bir uygulamayla araç çağıran, sonucu okuyan ve yeniden karar veren bir sistem farklı gecikme ihtiyacı taşır. Her adımın bekleme süresindeki azalma toplam görev süresine katkı sağlayabilir; fakat araçların kendi yavaşlığı varsa donanım kazancı son kullanıcıya aynı ölçüde yansımaz.
Bu nedenle altyapı satın alan ekip için saniyedeki çıktı miktarı kadar ilk yanıtın ne zaman geldiği de önemlidir. Aynı anda çalışan kullanıcı sayısı, çıktı uzunluğu ve modelin hafıza ihtiyacı ölçümü değiştirebilir. İdeal deneme, şirketin gerçek görev kayıtlarıyla yapılmalıdır. Bir çağrı merkezi, yazılım geliştirme ajanı veya belge inceleme uygulaması için aynı testin karar vermeye yeterli olmayacağı özellikle dikkate alınmalıdır.
Ayrı çıkarım katmanları kapasite planlamasını da daha karmaşık hale getirebilir. Uzun belgeleri işleyen bölüm boş kalırken yanıt üreten bölüm dolabilir veya bunun tersi yaşanabilir. İş yükü yönlendirme, ağ kapasitesi ve hata durumunda devralma mekanizması bu yüzden önem taşır. Ek donanımın ekonomik değeri, hız artışının yanında ne kadar düzenli kullanıldığıyla ve yönetiminin toplam maliyetiyle birlikte hesaplanmalıdır.
Tam üretim açıklaması teknik yol haritasında somut bir ilerleme olsa da kullanıcı açısından izlenecek eşik hizmet erişimidir. Nebius’un bölge, fiyat ve kullanım sınırlarını açıklaması daha uygulanabilir karşılaştırmalar sağlayacaktır. Bağımsız ölçümler de farklı model ailelerinde sonuçların nasıl değiştiğini gösterebilir. LPX, yapay zekâ altyapısında eğitim kapasitesinden günlük yanıt deneyimine doğru büyüyen rekabetin dikkat çekici örneklerinden biri haline geliyor.
Kaynak kontrolü: 2026-10-03. Metin yapay zekâ desteğiyle hazırlanmıştır.
■ MİZAN HABER