No. 78
2026-10-05
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

DeReAct, ajanlarda güvenilirliği artıran yeni bir mimari sunuyorDeReAct introduces a new architecture to enhance reliability in AI agents

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

DeReAct, monolitik ReAct döngüsünü bir Beyin ve iki dış denetim politikası olarak bölüyor: kötü eylemleri veto eden bir Eleştirmen ve görevin tamamlandığını onaylayan bir Bağlam Yöneticisi. Bu mimari, zayıf modellerde GAIA/SWE-bench üzerinde 4–7 puanlık Pass@1 artışı sağlarken, üst düzey modellerin skorlarına ulaşmayı ve yörünge dayanaklarını iyileştirmeyi başarıyor.DeReAct splits the monolithic ReAct loop into a Brain and two external oversight policies: a Critic that vetoes bad actions and a Context Manager that confirms task completion. This architecture yields a 4–7 point Pass@1 improvement on GAIA/SWE-bench for weaker models, successfully matching top-tier model scores and improving trajectory grounding.

Neden ÖnemliWhy it matters

Üretim ortamındaki ajan devreye almalarında tek bir büyük dil modeli (LLM) hem eylemleri öneriyor hem de bunları doğruluyor. Bu durumda, özgüvenli bir halüsinasyon, desteklenmeyen bir 'tamamlandı' iddiasıyla görevi sonlandırabilir. DeReAct, yetkilendirmeyi ve tamamlanmayı ayrı, denetlenebilir politikalara ayırarak, çekirdek modeli yeniden eğitmeye gerek kalmadan bağımsız kontroller gerektiren güvenlik kritik akışlar için pratik bir şablon sunuyor.In production agent deployments, a single large language model (LLM) both proposes and validates actions. In this setup, a confident hallucination can terminate a task with an unsupported 'completed' claim. By separating authorization and completion into distinct, auditable policies, DeReAct offers a practical template for security-critical workflows requiring independent checks, without needing to retrain the core model.

Öne ÇıkanlarHighlights

  • Eleştirmen + Bağlam Yöneticisi denetimi, GAIA/SWE-bench Verified üzerinde Qwen3-Coder-480B için Pass@1 skorunu 6,5–7,0 puan artırıyor.Critic + Context Manager oversight boosts Pass@1 scores by 6.5–7.0 points for Qwen3-Coder-480B on GAIA/SWE-bench Verified.
  • Beyin modeli ne kadar güçlüyse, kazançlar o kadar azalıyor; Claude Opus 4.5 ile Pass@1 skoru, standart ReAct ile aynı seviyede.The stronger the Brain model, the smaller the gains; with Claude Opus 4.5, Pass@1 scores remain at the same level as standard ReAct.
  • Ablasyonlar, mimarinin yalnızca hedeflenen hata modu yeterince sık görülüyorsa ve denetim politikası kendi başına yetkinse faydalı olduğunu gösteriyor.Ablations show the architecture is only beneficial if the targeted error mode is frequent enough and the oversight policy is competent on its own.

EleştiriCritical take

Makalenin kendi ablasyonları, faydanın koşullu olduğunu kabul ediyor: denetim, yalnızca hatalar 'yeterince yaygın' ve denetim politikası 'kendi başına yeterli' olduğunda işe yarıyor. Bu, nerede devreye alınacağına dair az miktarda rehberlik sunan, neredeyse tautolojik bir başarı kriteri. Zaten sınır sınıfı Beyin modelleri kullanan ekipler için pratik Pass@1 farkı neredeyse sıfır. Geriye, kıyaslama için net bir operasyonel metrik sunmayan, yalnızca 'daha kanıt eksiksiz yörüngeler' iddiası kalıyor.The paper’s own ablations admit the benefit is conditional: oversight only works when errors are 'sufficiently common' and the oversight policy is 'sufficiently competent' on its own. This is a near-tautological success criterion that offers little guidance on where to deploy it. For teams already using frontier-class Brain models, the practical Pass@1 difference is nearly zero. What remains is merely a claim of 'more evidence-complete trajectories' without a clear operational metric for benchmarking.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue