No. 77
2026-10-04
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görselde, siyah bir arka plan üzerinde stilize sarı bir yazı tipiyle “THINKINGBOX” kelimesi ve Microsoft logosu yer alan Microsoft ThinkingBox logosu görülmektedir.

Microsoft ve Hugging Face, ajanların tutarlılığını ölçen ThinkingBox kıyaslamasını yayınladıMicrosoft and Hugging Face Release ThinkingBox Benchmark to Measure Agent Consistency

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Microsoft ve Hugging Face, ThinkingBox adlı kıyaslamayı yayımladı. Bu kıyaslama, yapay zeka ajanlarını ürettikleri araç çağrılarına veya son mesajlara göre değil, 507 durumlu iş akışında (her biri 20 kez çalıştırılarak) geride bıraktıkları gerçek veritabanı durumuna göre puanlıyor. Öne çıkan bulgu şu: 'temiz görünen' denemelerin %67'si hâlâ yanlış değerler yazdı, istenmeyen yan etkiler yarattı veya gerekli işlemleri atladı.Microsoft and Hugging Face released a benchmark called ThinkingBox. This benchmark scores AI agents not by the tool calls they generate or their final messages, but by the actual database state they leave behind in a 507-state workflow (each run 20 times). A key finding is that 67% of 'clean-looking' attempts still wrote incorrect values, created unwanted side effects, or skipped necessary operations.

Neden ÖnemliWhy it matters

Çoğu ajan değerlendirmesi, biçim olarak doğru bir araç çağrısını veya kibar bir son yanıtı başarı kanıtı olarak kabul eder. Ancak bu kıyaslama, bu açığın çok büyük olduğunu gösteriyor. Ajanlar, gerekli son durum 'beklemede' iken biletleri rutin olarak 'çözüldü' olarak kapatıyor. Her görevi 20 kez tekrarlayıp pass@1, pass@20 ve katı 20/20 sayısını raporlayarak, bir modelin ne yapabildiğini neyi güvenilir şekilde yaptığını ayırıyor. Bu ayrım, %90 başarı oranının her on müşteriden birinin bozuk bir sonuç alması anlamına geldiği üretim ortamlarında son derece önemli.Most agent evaluations treat a formally correct tool call or a polite final response as proof of success. However, this benchmark shows that this gap is massive. Agents routinely close tickets as 'resolved' when the required final state is 'pending.' By repeating each task 20 times and reporting pass@1, pass@20, and the strict 20/20 count, it distinguishes what a model can do from what it does reliably. This distinction is critical in production environments, where a 90% success rate means one in ten customers receives a broken outcome.

Öne ÇıkanlarHighlights

  • Başarısız denemelerin %67,24'ü hiçbir araç hatası olmadan temiz şekilde sonlandı. Ancak bu denemelerin %77,61'inde arka uçta yanlış alan değerleri vardı.67.24% of failed attempts ended cleanly without any tool errors. However, 77.61% of these attempts had incorrect field values in the backend.
  • Gerçek ayırt edici unsur tutarlılıktır: GPT-6 Astra, 20 tekrardan sonra pass@1 performansının %78'ini korurken, GLM-5.1, Kimi-K2.6 ve DeepSeek-V4-Pro yalnızca yaklaşık %8'ini koruyor.The real differentiator is consistency: GPT-6 Astra retains 78% of its pass@1 performance after 20 repetitions, while GLM-5.1, Kimi-K2.6, and DeepSeek-V4-Pro retain only about 8%.
  • Kimi-K3 (açık ağırlıklı), görevlerin %93,89'unu en az bir kez çözüyor. Ancak bunların yalnızca %13,41'inde 20 denemenin tamamını geçiyor. Bu durum, mülkiyetli modellerde görülen kapsam-güvenilirlik dengesizliğini tersine çeviriyor.Kimi-K3 (open-weight) solves at least one attempt for 93.89% of tasks. However, it passes all 20 attempts in only 13.41% of cases. This reverses the coverage-reliability imbalance seen in proprietary models.

EleştiriCritical take

Kıyaslama yalnızca beş iş alanı ve 507 görevle sınırlı. Bu nedenle sıralamaları, kodlama, araştırma veya çoklu ajan orkestrasyonu iş yükleri hakkında az şey söylüyor. Ayrıca 'gözlemlenen 20/20' metriği, güven aralığı olmayan ham bir sayıdır. Bu, güvenilirliğin son derece muhafazakâr (ve tartışılabilir şekilde ikili) bir ölçüsüdür. Gerçek deneme başına %95 başarı oranına sahip bir model, 20 çalıştırma boyunca bu eşiği neredeyse asla yakalayamaz.The benchmark is limited to five business domains and 507 tasks. Therefore, its rankings say little about coding, research, or multi-agent orchestration workloads. Additionally, the 'observed 20/20' metric is a raw count without a confidence interval. This is an extremely conservative (and arguably binary) measure of reliability. A model with a 95% success rate per attempt will almost never reach this threshold over 20 runs.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue