![]() NVIDIA, terminal ajanlarda başarıyı artıran Mid-Harness yöntemini tanıttıNVIDIA Introduces Mid-Harness Method to Boost Success Rates in Terminal AgentsHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryNVIDIA'nın Mid-Harness makalesi, büyük dil modeli (LLM) ile terminal aracı (harness) arasına bir doğrulama adımı eklemeyi öneriyor. Sistem birden fazla aday kabuk komutu örnekliyor, bir doğrulayıcı en iyisini seçiyor ve ardından komutu çalıştırıyor. TerminalBench-Lite üzerinde, 8 aday arasından seçim yapan GPT-5.6 Sol doğrulayıcısı Pass@1 oranını %50'den %68'e çıkarıyor.NVIDIA's Mid-Harness paper proposes adding a verification step between a large language model (LLM) and a terminal tool (harness). The system samples multiple candidate shell commands, a verifier selects the best one, and then the command is executed. On TerminalBench-Lite, a GPT-5.6 Sol verifier selecting from 8 candidates increases the Pass@1 rate from 50% to 68%. |
Neden ÖnemliWhy it mattersTerminal ajanları, LLM'ler için hâlâ zayıf bir nokta. Bu çalışma, modele veya araca herhangi bir değişiklik gerektirmeyen, doğrudan uygulanabilir bir test zamanı hesaplama (test-time-compute) tekniği sunuyor. Çalışmanın temel ampirik bulgusu, doğrulayıcının kalitesinin örnek sayısından çok daha önemli olduğu yönünde. Bu durum, mühendislik çabasını kaba kuvvetle örneklemekten daha iyi doğrulamaya yönlendiriyor. Bu yaklaşım, üretim ortamındaki ajan yığınları için doğrudan maliyet etkileri taşıyor.Terminal agents remain a weak point for LLMs. This study offers a directly applicable test-time compute technique that requires no changes to the model or the tool. The core empirical finding is that verifier quality is far more important than the number of samples. This directs engineering effort toward better verification rather than brute-force sampling. This approach carries direct cost implications for production agent stacks. |
Öne ÇıkanlarHighlights
|
EleştiriCritical take18 puanlık artış gerçek, ancak %32'lik bir hata oranı hâlâ mevcut. Üstelik bu sonuç, GPT-5.6 Sol gibi sınırlayıcı sınıf (frontier-class) bir doğrulayıcıya dayanıyor. Daha zayıf bir model kullanıldığında fayda hızla kayboluyor. Bu durum, her adımda üst düzey bir modeli yargıç olarak çalıştıramayan ekipler için yöntemin pratikliğini sınırlıyor. Ayrıca bu yaklaşımı 'mid-harness' mimari bir katkı olarak nitelendirmek, yeniliği abartıyor olabilir. Zira yöntem temelde örnek-doğrula-seç (sample-verify-select) desenidir. Bu desen, kod üretim hatlarında zaten yaygın olan bir yapıdır ve burada yalnızca kabuk komutları için yeniden paketlenmiştir.The 18-point increase is real, but a 32% error rate remains. Moreover, this result relies on a frontier-class verifier like GPT-5.6 Sol. The benefit quickly disappears when a weaker model is used. This limits the practicality of the method for teams that cannot afford to run a high-end model as a judge at every step. Additionally, labeling this approach a 'mid-harness' architectural contribution may overstate the novelty. The method is fundamentally a sample-verify-select pattern, which is already common in code generation pipelines and is merely repackaged here for shell commands. |
