No. 60
2026-09-17
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Açık renkli bir zeminde yan yana iki ahşap saksı duruyor; soldaki küçük yapraklı bir filiz, sağdaki ise çiçek açmış tam boy bir ağaç barındırıyor.
Temsilî görsel — FLUX.1-dev ile bilgisayarımda üretildi; haberin gerçek fotoğrafı değil.Illustrative image — generated with FLUX.1-dev on my computer; not a real photograph of the story.

Mozilla: Açık kaynak yapay zeka modelleri 4,4 ay gerideMozilla: Open-source AI models lag 4.4 months behind

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Mozilla'nın Eylül 2026 tarihli 'Açık Kaynak Yapay Zekâ Durumu' raporu, açık ağırlıklı ve kapalı uç modeller arasındaki 4,4 aylık performans farkını sayısal olarak ortaya koyuyor. Rapor, Epoch AI'ın ECI endeksini, METR'nin zaman ufku metriğini ve 1.400 geliştiriciyle yapılan bir anketi temel alıyor. En iyi açık model olan Moonshot'ın Kimi K3'ü ECI'da 157 puan alırken, Anthropic'in Claude Fable 5/Opus 5 modeli 162 puanda. Buna karşın açık modeller, API çağrısı başına yaklaşık %30 daha düşük maliyetle çalışıyor.Mozilla's September 2026 'State of Open-Source AI' report numerically highlights the 4.4-month performance gap between open-weight and closed-source models. The report is based on Epoch AI's ECI index, METR's time horizon metric, and a survey of 1,400 developers. The top open model, Moonshot's Kimi K3, scored 157 on the ECI, while Anthropic's Claude Fable 5/Opus 5 model scored 162. In contrast, open models operate at approximately 30% lower cost per API call.

Neden ÖnemliWhy it matters

Rapor, açık ağırlıklı yapay zekânın ne kadar yol katettiğini ve özel liderlerden ne kadar geride olduğunu gösteren somut, çok kaynaklı bir kıyaslama sunuyor. Bu durum, tedarik kararlarını, model yoğunlaşmasına ilişkin düzenleyici tartışmaları ve kendi çıkarım altyapısını kuran şirketlerin stratejik hesaplamalarını doğrudan etkiliyor. 4,4 aylık fark daralıyor; açık modeller görev ufuklarını her 3,9 ayda bir ikiye katlarken, kapalı modellerde bu süre 5,5 ay. Bu, açık ekosistemin yaklaştığını gösterse de, uç laboratuvarların bugün hâlâ elinde tuttuğu özerklik ve güvenilirlik avantajını ortadan kaldıracak kadar hızlı değil.The report provides a concrete, multi-source benchmark showing how far open-weight AI has come and how far behind it remains compared to proprietary leaders. This directly impacts procurement decisions, regulatory discussions regarding model concentration, and the strategic calculations of companies building their own inference infrastructure. The 4.4-month gap is narrowing; open models double their task horizons every 3.9 months, compared to 5.5 months for closed models. While this indicates the open ecosystem is closing in, it is not fast enough to eliminate the autonomy and reliability advantages currently held by frontier labs.

Öne ÇıkanlarHighlights

  • Kimi K3 (Moonshot), 157 ECI puanıyla şu an açık ağırlıklı modellerin lideri. Anthropic'in 162 puanına kıyasla, bu fark yaklaşık dört aylık Ar-Ge süresine denk geliyor.Kimi K3 (Moonshot) is currently the leader among open-weight models with an ECI score of 157. Compared to Anthropic's 162 points, this difference equates to approximately four months of R&D time.
  • Açık modeller, API çağrısı başına yaklaşık %30 daha düşük maliyetle çalışıyor. Bu sırada Artificial Analysis'ın fiyat-performans endeksinde yalnızca 2,1 puanlık bir kayıp yaşıyorlar.Open models operate at approximately 30% lower cost per API call. Meanwhile, they experience only a 2.1-point loss in Artificial Analysis's price-performance index.
  • 'Testere dişi uç' ifadesi, açık modellerin web arayüzü kodlamasında aslında önde olduğunu ve ajan gezinmesinde eşit duruma geldiğini, ancak uzman masaüstü işlerinde ve uzun metin analizlerinde geride kaldığını gösteriyor.The 'sawtooth edge' expression indicates that open models are actually leading in web interface coding and have reached parity in agent browsing, but are lagging behind in specialized desktop tasks and long-form text analysis.

EleştiriCritical take

4,4 aylık rakam, hangi bileşik endekse güvenildiğine (ECI mi, METR ufku mu) ve sınırlı sayıda adlandırılmış modele bağlı bir anlık görüntü. Bu nedenle, değişken ve göreve bağlı bir farktan çok, istikrarlı yapısal bir uçurum olarak aşırı yorumlanma riski taşıyor. Mozilla'nın kendisi de açık modellerin belirli kıyaslamalar için aşırı optimize edilmiş olabileceğini ve yaklaşık 16 saati aşan otonom çalışmalarda güvenilirliğin sert biçimde düştüğünü belirtiyor. Bu uyarılar, başlık rakamının göründüğünden daha az belirleyici olduğunu gösteriyor.The 4.4-month figure is a snapshot dependent on which composite index is trusted (ECI or METR horizon) and a limited number of named models. Therefore, it carries the risk of being over-interpreted as a stable structural chasm rather than a variable, task-dependent gap. Mozilla itself notes that open models may be over-optimized for specific benchmarks and that reliability drops sharply in autonomous tasks exceeding approximately 16 hours. These caveats suggest that the headline figure is less definitive than it appears.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue