2026-10-02
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

Hermes: Bağlamsal akıl yürütmeyi öğrenme, çıkarım anı ölçeklemesini açığa çıkarıyorHermes: Learning Contextual Reasoning Unlocks Test-Time Scaling

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Hermes, çıkarım sırasında bağlam pencerelerinin nasıl dağıtılacağına ve yeniden kullanılacağına modelin kendisinin karar vermesini sağlayarak test zamanı ölçeklendirmeyi yeniden kurguluyor. Bu kararları sabit bir iskeletin dayatması yerine modelin yönetmesi söz konusu. Hermes-Learn adlı iki aşamalı bir eğitim tarifi, daha küçük açık kaynak modellerin, büyük modellerle arasındaki farkı kapatmalarına olanak tanıyan uyarlanabilir bağlamsal akıl yürütme stratejileri geliştirmesini öğretiyor.Hermes reimagines test-time scaling by allowing the model itself to decide how context windows are allocated and reused during inference, rather than having these decisions imposed by a fixed skeleton. The two-stage training recipe, called Hermes-Learn, teaches smaller open-source models to develop adaptive contextual reasoning strategies that help them close the gap with larger models.

Neden ÖnemliWhy it matters

Test zamanı ölçeklendirme, sabit boyutlu modellerden daha fazla yetenek çıkarmak için birincil kaldıraç haline geliyor. Ancak mevcut sistemlerin çoğu, bağlam yönetimini çıkarım iskeletinde sabit kod olarak tanımlıyor. Bu çalışma, bu kararı modele içselleştiriyor ve öğrenilen stratejilerin eğitim sırasında kullanılan hesaplama gücünün ötesine genellenebildiğini ve dışa vurulabildiğini gösteriyor. Bu durum, çıkarım zamanı hesaplama gücü dağıtımı için daha esnek, model odaklı bir paradigma işaret ediyor. Bu yaklaşım, geniş bir yelpazede aşağı akış görevlerine fayda sağlayabilir.Test-time scaling is becoming the primary lever for extracting more capability from fixed-size models. However, most existing systems define context management as hard-coded logic within the inference skeleton. This work internalizes this decision-making process within the model and demonstrates that learned strategies can generalize beyond the computational power used during training and be extrapolated. This points to a more flexible, model-centric paradigm for distributing inference-time compute, an approach that could benefit a wide range of downstream tasks.

Öne ÇıkanlarHighlights

  • Bağlam dağıtımı ve yeniden kullanım kararlarını iskeletten alıp modelin kendi akıl yürütme döngüsüne taşırShifts context allocation and reuse decisions from the inference skeleton to the model's own reasoning loop
  • Hermes-Learn iki aşamalı eğitimi, küçük açık kaynak modellerin test zamanı ölçeklendirme davranışında büyük modelleri yakalamasını sağlarHermes-Learn's two-stage training enables smaller open-source models to match the test-time scaling behavior of larger models
  • Raporlanan kazanımlar, eğitimde görülen çıkarım hesaplama gücünün ötesine dışa vurulur ve tamamlayıcı ölçeklendirme yöntemlerine aktarılırReported gains extrapolate beyond the inference compute observed during training and transfer to complementary scaling methods

EleştiriCritical take

Özet, güçlü genelleme ve dışa vurma iddiaları içeriyor. Ancak bu çalışma henüz hakem değerlendirmesinden geçmemiş 45 sayfalık bir ön baskı. Kıyaslamaların kapsamı, kapatılan 'farkın' boyutu ve görülmemiş hesaplama bütçelerine karşı dışa vurma sağlamlığı henüz doğrulanmadı. 'Basit, yapılandırılabilir iskeletler' ifadesi de, bir modelin pratikte kendi bağlam pencerelerini güvenilir şekilde yönetmesi için gereken mühendislik karmaşıklığını hafife alma riski taşıyor.The summary contains strong claims regarding generalization and extrapolation. However, this work is still a 45-page preprint that has not undergone peer review. The scope of the comparisons, the magnitude of the 'gap' closed, and the robustness of extrapolation against unseen compute budgets have not yet been verified. Furthermore, the phrase 'simple, configurable skeletons' risks underestimating the engineering complexity required for a model to reliably manage its own context windows in practice.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue