No. 77
2026-10-04
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

Claude Opus 5, muhasebe görevlerinde sertifikalı muhasebecileri geride bıraktıClaude Opus 5 outperforms certified accountants in accounting tasks

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Rohan Paul, Mercor'un araştırmasına atıfta bulunarak, Claude Opus 5'in orta uzunlukta ve iyi tanımlanmış muhasebe görevlerinde dakikalar içinde 20/20 mükemmel bir sonuç aldığını bildiriyor. Buna karşılık 12 lisanslı CPA, 3 saatlik süre içinde işi bitiremeyenler dahil olmak üzere %0 ile %90 arasında değişen puanlar aldı. Kriter başına maliyet farkı da çarpıcıydı: Model için 0,21 dolar, insan muhasebeciler için ise 10,35 dolar.Rohan Paul, citing Mercor's research, reports that Claude Opus 5 achieved a perfect 20/20 score within minutes on medium-length, well-defined accounting tasks. In contrast, 12 licensed CPAs scored between 0% and 90%, with some failing to complete the work within a 3-hour timeframe. The cost difference per criterion was also striking: $0.21 for the model versus $10.35 for human accountants.

Neden ÖnemliWhy it matters

Öncü modeller, yapılandırılmış ve kural tabanlı işlerde artık junior seviyedeki profesyonellerle yarışabiliyor veya onları geçebiliyorsa, beyaz yakalı arka ofis işlerinin büyük bir kısmını otomatize etmenin ekonomik gerekçesi spekülasyondan somut bir duruma dönüşüyor. İnsan performansının altında olmaktan üstüne çıkmaya giden 18 aylık seyir, bu açığın hızla genişlediğine işaret ediyor. Bu durum, şirketlerin personel sayısını ve eğitim süreçlerini yeniden düşünmesine yol açıyor. Ayrıca, bu sertifikaların kodladığı 'kural uygulama' katmanı giderek emtialaştıkça, profesyonel sertifikaların değer önerisini de yeniden çerçevelemesi gerekiyor.If leading models can now compete with or outperform junior-level professionals in structured, rule-based work, the economic case for automating a significant portion of white-collar back-office tasks is shifting from speculation to reality. The 18-month trajectory from underperforming to outperforming human baselines indicates that this gap is widening rapidly. This situation is prompting companies to rethink headcount and training processes. Furthermore, as the 'rule application' layer encoded in these certifications becomes increasingly commoditized, the value proposition of professional certifications needs to be reframed.

Öne ÇıkanlarHighlights

  • Claude Opus 5: %100 doğruluk, görev başına dakikalar, kriter başına 0,21 dolar. CPA'lar: %0–90, en fazla 3 saat, kriter başına 10,35 dolar.Claude Opus 5: 100% accuracy, minutes per task, $0.21 per criterion. CPAs: 0–90% accuracy, up to 3 hours, $10.35 per criterion.
  • Ethan Mollick (Wharton) doğruluyor: İyi tanımlanmış görevlerde, öncü yapay zeka artık araştırmadaki en iyi junior muhasebeciyi bile geride bırakıyor.Ethan Mollick (Wharton) confirms: On well-defined tasks, leading AI now outperforms even the best junior accountant in the study.
  • 18 ay önce aynı modeller, insan baz çizgisinin çok altında puan alıyordu. Bu, hızlı bir yetenek sıçramasına işaret ediyor.Eighteen months ago, the same models scored well below the human baseline. This signals a rapid leap in capability.

EleştiriCritical take

Araştırma, kapsamı 'orta uzunlukta ve iyi tanımlanmış' görevlerle sınırlıdır ve junior muhasebecilerle kıyaslama yapar. Bu nedenle sonuçları karmaşık, yargı ağırlıklı veya belirsiz muhasebe işlerine genellemek yerinde değildir. Ayrıca Mercor, yapay zekânın üstünlüğünü göstermede ticari bir çıkarı vardır. 12 kişilik CPA örneklemi ve %0–90 aralığındaki dağılım, 'insanlar kaybetti' başlığını verilerin katı olarak desteklediğinden daha dramatik hale getiriyor.The study is limited to 'medium-length and well-defined' tasks and compares performance against junior accountants. Therefore, generalizing these results to complex, judgment-heavy, or ambiguous accounting work is inappropriate. Additionally, Mercor has a commercial interest in demonstrating AI superiority. The sample of 12 CPAs and the 0–90% distribution make the 'humans lost' headline more dramatic than the data strictly supports.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue