2026-09-19
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Grafik, Anthropic'te model Ar-Ge görevlerinin aylık payını, Epoch AI'ın otomasyon ölçeğine göre sınıflandırarak Ağustos 2025 ile Ağustos 2026 arasındaki dönemi göstermektedir; bu dönemde Claude, görevlerin giderek artan…

Anthropic, yapay zeka geliştirme çalışmalarının yüzde 26'sının Claude tarafından yürütüldüğünü açıkladıAnthropic reveals that 26% of its AI development work is now led by Claude

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Anthropic'in iç düşünce tankı, yapay zeka araştırma ve geliştirme görevlerinin %26'sının artık 'yapay zekâ öncelikli' (AL4) seviyesinde olduğunu bildirdi. Bu oran Şubat ayında %1'in altındaydı. Claude bu işleri yaparken insanlar denetim yapıyor. Görevlerin %90'ından fazlasında en azından işbirlikçi yapay zekâ kullanımı söz konusu.Anthropic's internal think tank reported that 26% of AI research and development tasks are now at the 'AI-first' (AL4) level. This ratio was below 1% in February. While humans oversee these tasks, collaborative AI usage is present in over 90% of them.

Neden ÖnemliWhy it matters

Bu, sınırları zorlayan bir laboratuvarda özyinelemeli iyileştirmenin ilk somut ve nicel anlık görüntülerinden biri. Genellikle varsayımsal kalan 'yapay zekânın yapay zekâ inşa etmesi' döngüsü, operasyonel terimlerle görünür hâle geliyor. Altı ayda %1'in altından %26'ya sıçrama, yapay zekâ destekli geliştirme hızının çoğu dış gözlemcinin modellediğinden çok daha hızlı arttığını gösteriyor. Bu durum, hesaplama talebi, güvenlik denetimi ve sınırları zorlayan laboratuvarlar arasındaki rekabet takvimi için doğrudan sonuçlar doğuruyor.This provides one of the first concrete, quantitative snapshots of recursive improvement in a frontier lab. The cycle of 'AI building AI,' often hypothetical, is becoming visible in operational terms. The jump from under 1% to 26% in six months indicates that AI-assisted development speed is increasing much faster than most external observers model. This has direct implications for compute demand, safety oversight, and the competitive timeline among frontier labs.

Öne ÇıkanlarHighlights

  • Yöntem: Claude, örneklenen personel Slack ve belgelerini okuyarak yaklaşık 15.000 görevi Epoch AI'nın AL0–AL5 ölçeğine göre sınıflandırdı. AL4 seviyesi %26, AL5 seviyesi ise sıfır olarak ölçüldü.Methodology: Claude classified approximately 15,000 tasks according to Epoch AI's AL0–AL5 scale by reading sampled staff Slack messages and documents. The AL4 level was measured at 26%, while the AL5 level was zero.
  • Anthropic'in en çok kullanılan altyapısında yaklaşık 30.000 yapay zekâ ajanı eş zamanlı çalışıyor. İzleme sistemi, Ağustos ayında 1 milyarı aşkın kararın yalnızca %0,002'sini engelledi.Approximately 30,000 AI agents are operating concurrently on Anthropic's most heavily used infrastructure. The monitoring system blocked only 0.002% of over 1 billion decisions in August.
  • Muhafazakâr bir tahmine göre, bir hafta içindeki araştırma ve geliştirme hesaplama kaynaklarının yaklaşık %6'sı güvenlik çalışmalarına ayrılıyor. Anthropic, bu metrikleri yayımlamaya devam edeceğini belirtiyor.According to a conservative estimate, about 6% of research and development compute resources within a week are allocated to safety work. Anthropic states it will continue to publish these metrics.

EleştiriCritical take

Ölçümün tamamı kendi kendine yönetiliyor. Anthropic örneklem çerçevesini seçti, sınıflandırmayı kendi modeli olan Claude'a yaptırdı ve sonuçları kendi zaman çizelgesinde yayımladı. Bu nedenle %26 rakamı bir kıyaslama kadar bir halka ilişkisi ürünü niteliğinde. Yaklaşık sıfıra yakın engelleme oranı (47.000'de 1) ise bağımsız bir denetim olmadan, o 4.700 engellenen eylemin ne olduğu teyit edilmeden rahatlatıcı bir gösterge olarak sunuluyor.The entire measurement is self-administered. Anthropic selected the sampling frame, had its own model, Claude, perform the classification, and published the results on its own timeline. Consequently, the 26% figure is as much a public relations product as it is a benchmark. The near-zero blocking rate (1 in 47,000) is presented as a reassuring indicator without independent audit or verification of what those 4,700 blocked actions actually were.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue