No. 60
2026-09-17
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Siyah bir arka plan üzerinde dizilmiş altın rengi devre kartları, yüksek performanslı bir hesaplama sistemini sergiliyor.

NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1'de öne çıkan performans gösterdiNVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

NVIDIA'nın Vera Rubin NVL72'si, MLPerf Inference v6.1'de önizleme sonuçlarıyla ilk kez sahne aldı. Şirket, Qwen3-VL'de önceki nesil GB300 NVL72'ye kıyasla 3,7 kat, DeepSeek-R1'de ise 2,5 kat daha yüksek çıktı iddia ediyor. GB300 ise 288 GPU'da %99 ölçeklenme verimliliği gösterdi.NVIDIA's Vera Rubin NVL72 made its debut with preview results in MLPerf Inference v6.1. The company claims 3.7x higher output on Qwen3-VL and 2.5x higher output on DeepSeek-R1 compared to the previous generation GB300 NVL72. Meanwhile, the GB300 demonstrated 99% scaling efficiency across 288 GPUs.

Neden ÖnemliWhy it matters

Çıkarım ekonomisi—dolar başına token, ölçeklenme verimliliği ve yazılım hızı—artık yapay zeka altyapı harcamalarının büyük kısmını yönlendiriyor. Bu nedenle 3-4 katlık nesil arası çıktı sıçraması, veri merkezi sermaye harcaması planlamasını doğrudan yeniden şekillendiriyor. %99'luk çoklu raf ölçeklenme oranı, çeşitli iş yüklerinde geçerliliğini korursa, raf ölçeğinde NVLink bağlantılarının artık bir laboratuvar merakı değil, pratik bir üretim standardı haline geldiğine işaret ediyor. Ayrıştırılmış prefill/decode sunumu ve NVFP4 hassasiyetine yönelim de, çıkarım yığını tasarımının bir sonraki dalgasının nereye gittiğine dair ipuçları veriyor.Inference economics—tokens per dollar, scaling efficiency, and software speed—now drive a significant portion of AI infrastructure spending. Consequently, a 3-4x generational jump in output directly reshapes data center capital expenditure planning. The 99% multi-rack scaling rate, if it holds up across various workloads, indicates that rack-scale NVLink connectivity has transitioned from a laboratory curiosity to a practical production standard. Additionally, the disaggregated prefill/decode presentation and the shift toward NVFP4 precision offer insights into where the next wave of inference stack design is heading.

Öne ÇıkanlarHighlights

  • Vera Rubin NVL72: Qwen3-VL'de (vLLM + Dynamo) GB300 NVL72'ye kıyasla 3,7 kat, DeepSeek-R1'de (TensorRT-LLM) 2,5 kat daha yüksek çıktıVera Rubin NVL72: 3.7x higher output on Qwen3-VL (vLLM + Dynamo) and 2.5x higher output on DeepSeek-R1 (TensorRT-LLM) compared to GB300 NVL72
  • GB300 NVL72, DeepSeek-R1 çevrimdışı testinde 72'den 288 GPU'ya ölçeklenirken %99 ölçeklenme verimliliğine ulaştıGB300 NVL72 achieved 99% scaling efficiency when scaling from 72 to 288 GPUs in the DeepSeek-R1 offline test
  • v6.0 ile v6.1 arasındaki yalnızca yazılım optimizasyonları, Qwen3-VL'de 1,6 kata varan kazanımlar sağladı; GPT-OSS-120B ve DLRMv3'teki gönderim sonrası sonuçlar, henüz doğrulanmamış ek kazanımlar gösteriyorSoftware optimizations alone between v6.0 and v6.1 yielded gains of up to 1.6x on Qwen3-VL; post-submission results for GPT-OSS-120B and DLRMv3 show additional, yet unverified, gains

EleştiriCritical take

Tüm başlık rakamları, NVIDIA'nın kendi blogunda paylaşılan, NVIDIA'nın yeni çipi ile eski çipi karşılaştıran veriler. Bu nedenle 3,7 katlık iddiayı bağlamlandıracak bağımsız üçüncü taraf donanım bir referans noktası yok. En dikkat çekici rakam olan SemiAnalysis AgentX'teki 30 katlık artış, açıkça 'önizleme testi' olarak belirtiliyor ve henüz standartlaştırılmış bir MLPerf çalışmasının parçası değil. Bu da metindeki en az doğrulanabilir rakam olmasını sağlıyor.All headline figures are data points comparing NVIDIA's new chip against its older chip, as shared on NVIDIA's own blog. Therefore, there is no independent third-party hardware benchmark to contextualize the 3.7x claim. The most striking figure, a 30x increase in SemiAnalysis AgentX, is explicitly labeled as a 'preview test' and is not yet part of a standardized MLPerf run, making it the least verifiable number in the text.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue