No. 55
2026-09-12
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görsel, HLE (metin), GDP pdf, Chartography, DeepSWE ve diğer çeşitli kıyaslamalarda Fugu Ultra, Opus, GPT-6 Astra gibi farklı dil modellerinin performansını karşılaştıran çubuk grafiklerini göstermektedir.

Sakana AI, Fugu Ultra v2 ile GPT-6 Astra'yı bazı testlerde geride bıraktıSakana AI's Fugu Ultra v2 outperforms GPT-6 Astra in some tests

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Sakana AI, Fugu Ultra v2 ve Fugu Max modellerini piyasaya sürdü. Şirket, Ultra v2'nin seçili kodlama kıyaslamalarında (DeepSWE) GPT-6 Astra ve Claude Fable 5.1'i geride bıraktığını iddia ediyor. Max modeli ise GPT-5.6 Terra, Claude Sonnet 5 ve Kimi K3'e kıyasla çıktı maliyetlerini %40-60 oranında düşürüyor. Her iki model de OpenAI ile uyumlu bir API üzerinden sunuluyor. Ultra v2'nin milyon token başına fiyatı 5/30 dolar, Max'in fiyatı ise 2/6 dolar.Sakana AI has released the Fugu Ultra v2 and Fugu Max models. The company claims that Ultra v2 outperforms GPT-6 Astra and Claude Fable 5.1 in selected coding benchmarks (DeepSWE). The Max model, on the other hand, reduces output costs by 40-60% compared to GPT-5.6 Terra, Claude Sonnet 5, and Kimi K3. Both models are served via an OpenAI-compatible API. Ultra v2 is priced at $5/$30 per million tokens, while Max is priced at $2/$6.

Neden ÖnemliWhy it matters

Sakana Fugu, tek bir büyük dil modeli (LLM) değil; bir model yönlendirme orkestratörüdür. Bu nedenle, monolitik sınır modellerine karşı yapılan kıyaslama iddiaları, 'daha iyi model' ile 'daha iyi yönlendirme' arasındaki çizgiyi bulanıklaştırıyor. Bir yönlendirici, dar kapsamlı görevlerde üst düzey modelleri düşük maliyetle eşitler veya aşarsa, bu durum OpenAI, Anthropic ve NVIDIA'nın açık ağırlıklı ürünlerinin fiyatlandırmasını ve konumlandırmasını aynı anda baskı altına alır.Sakana Fugu is not a single large language model (LLM); it is a model routing orchestrator. Therefore, benchmark claims made against monolithic frontier models blur the line between a 'better model' and 'better routing.' If an orchestrator can match or exceed top-tier models on narrow tasks at a lower cost, it simultaneously puts pressure on the pricing and positioning of open-weight products from OpenAI, Anthropic, and NVIDIA.

Öne ÇıkanlarHighlights

  • Fugu Ultra v2, DeepSWE'de GPT-6 Astra ve Claude Fable 5.1'i geride bırakıyor ancak her iki modeli de ortak model havuzuna dahil etmiyor.Fugu Ultra v2 outperforms GPT-6 Astra and Claude Fable 5.1 on DeepSWE, but does not include either model in its shared model pool.
  • Fugu Max, havuzuna NVIDIA Nemotron'u (açık ağırlıklı) ekliyor ve GPT-5.6 Terra, Claude Sonnet 5 ve Kimi K3'e kıyasla %40-60 daha düşük çıktı maliyeti iddiasında bulunuyor.Fugu Max adds NVIDIA Nemotron (open-weight) to its pool and claims 40-60% lower output costs compared to GPT-5.6 Terra, Claude Sonnet 5, and Kimi K3.
  • Fiyatlandırma: Ultra v2, milyon token başına girişte 5 dolar, çıkışta 30 dolar; Max ise girişte 2 dolar, çıkışta 6 dolar. Her ikisi de OpenAI ile uyumlu API üzerinden sunuluyor.Pricing: Ultra v2 is $5 per million input tokens and $30 per million output tokens; Max is $2 per million input tokens and $6 per million output tokens. Both are served via an OpenAI-compatible API.

EleştiriCritical take

Başlıktaki 'GPT-6 Astra'yı geride bırakıyor' iddiası, sınırlı sayıda kıyaslamaya (DeepSWE adı geçiyor) ve temelde bir yönlendirici olan, eğitimli bir model olmayan bir sisteme dayanıyor. Bu da karşılaştırmayı yapısal olarak dengesiz kılıyor. Ayrıca makalede bağımsız bir doğrulama, görev dağılımı kırılımı, gecikme veya güvenilirlik verisi bulunmuyor. Bu durum, 'üstün' iddiasını en iyi ihtimalle bir tedarikçi basın bülteni beyanı olarak bırakıyor.The claim in the headline that it 'outperforms GPT-6 Astra' relies on a limited set of benchmarks (DeepSWE is mentioned) and is based on a system that is fundamentally an orchestrator rather than a trained model. This makes the comparison structurally unbalanced. Furthermore, the article lacks independent verification, task distribution breakdowns, or latency and reliability data. This leaves the 'superiority' claim as, at best, a vendor press release statement.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue