2026-09-22
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görsel, büyük dil modellerinde blok seçimi yöntemini gösteren iki diyagramı içermektedir; bunlardan biri Ising modeli optimizasyonunu, diğeri ise LLM dönüştürücü bloklarını kullanan bir blok seçimi sürecini tasvir…

Büyük dil modellerinde blok seçimi Ising modeliyle çözüldüBlock selection in large language models solved with the Ising model

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Multiverse Computing'deki araştırmacılar, büyük dil modellerindeki (LLM) derinlik budamasını (blok silme işlemini) bir Ising camına eşdeğer, kısıtlı bir ikili optimizasyon problemi olarak yeniden formüle ediyor. Hessian tabanlı bir enerji manzarası kullanarak aday blok silme yapılandırmalarını sıralıyorlar; her birini ayrı ayrı kıyaslamaya gerek kalmıyor. Llama-3.3-70B-Instruct modelinde %50 sıkıştırma oranında, en iyi önceki blok silme taban çizgisine kıyasla MMLU'da yaklaşık 23 puanlık bir iyileşme raporluyorlar.Researchers at Multiverse Computing reformulate depth pruning (block removal) in large language models (LLMs) as a constrained binary optimization problem equivalent to an Ising glass. By using a Hessian-based energy landscape, they rank candidate block removal configurations without needing to evaluate each one individually. On the Llama-3.3-70B-Instruct model, they report an improvement of approximately 23 points on MMLU at a 50% compression rate compared to the best previous block pruning baseline.

Neden ÖnemliWhy it matters

Derinlik budaması, çıkarım maliyetini düşürmek için en ucuz kaldıraçlardan biri. Ancak mevcut yöntemler blokları bağımsız (ortalama alan) varsayıyor. Agresif sıkıştırma oranlarında baskın olan kombinatoryal etkileşimleri kaçırıyorlar. Tek bir Hessian hesabı binlerce kıyaslama çalışmasının yerini alabiliyorsa, budama uzayını keşfetmenin pratik maliyeti dramatik biçimde düşer. Aynı formülasyon, brüt kuvvetle çözülemeyecek kadar büyük modeller için kuantum tavlama veya QAOA çözücülerine de kapı aralıyor.Depth pruning is one of the cheapest levers for reducing inference costs. However, current methods assume blocks are independent (mean-field), missing the combinatorial interactions that dominate at aggressive compression rates. If a single Hessian calculation can replace thousands of benchmark runs, the practical cost of exploring the pruning space drops dramatically. The same formulation also opens the door to quantum annealing or QAOA solvers for models too large to be solved by brute force.

Öne ÇıkanlarHighlights

  • Kaybın ikinci mertebeden Taylor açılımı, Hessian'ı verir. Hessian'ın çapraz elemanları, blok çiftleri arasındaki bağlaşımı kodlar. 'Hangi blokları kesmeliyiz?' sorusu, kuadratik bir ikili optimizasyon problemine dönüşür.The second-order Taylor expansion of the loss yields the Hessian. The cross-elements of the Hessian encode the correlation between block pairs. The question 'Which blocks should we cut?' becomes a quadratic binary optimization problem.
  • Hessian, küçük bir kalibrasyon kümesi üzerinde bir kez hesaplanır ve birçok sıkıştırma hedefi arasında yeniden kullanılır. Böylece her aday değerlendirmesi, tam bir model çalıştırması yerine ucuz bir kuadratik form hesabına dönüşür.The Hessian is calculated once on a small calibration set and can be reused across multiple compression targets. This turns each candidate evaluation into a cheap quadratic form calculation rather than a full model run.
  • Çözülebilir en zor durumda (Llama-3.3-70B'de 80 bloğun 8'i, yaklaşık 29 milyar yapılandırma), tek bir GPU'da brüt kuvvet yöntemi yaklaşık iki gün sürdü. Bu ölçeğin ötesinde, açık kaynak bir tabu çözücüsü saniyeler içinde neredeyse optimal durumlara ulaşıyor.In the hardest solvable case (8 out of 80 blocks in Llama-3.3-70B, approximately 29 billion configurations), the brute-force method took about two days on a single GPU. Beyond this scale, an open-source tabu solver reaches near-optimal states in seconds.

EleştiriCritical take

23 puanlık MMLU iyileşmesi dikkat çekici. Ancak bu sonuç, kaybın ikinci mertebeden (kuadratik) bir yaklaşımına dayanıyor. %50 sıkıştırma oranında silinen bloklar, Hessian'ın yakalayamadığı yüksek mertebeden terimler aracılığıyla etkileşime giriyor. Bu nedenle 'enerji ≈ kalite' vekili, yöntemin en çok ihtiyaç duyulduğu rejimde zayıflayabilir. Ayrıca 'kuantum' çerçevesi büyük ölçüde iddialı. Yazarların kendileri bile en zor durumları klasik bir tabu çözücüsünün ele aldığını belirtiyor. Kuantum bilişim tedarikçisiyle ticari bağ, fizik temelli markalaşmayı temel bir yöntemsel ilerlemeden çok konumlandırma stratejisi gibi hissettiriyor.The 23-point MMLU improvement is striking. However, this result relies on a second-order (quadratic) approximation of the loss. At a 50% compression rate, the removed blocks interact through higher-order terms that the Hessian cannot capture. Therefore, the 'energy ≈ quality' proxy may weaken precisely in the regime where the method is most needed. Additionally, the 'quantum' framing is largely aspirational. The authors themselves acknowledge that even the hardest cases are handled by a classical tabu solver. The commercial tie to a quantum computing provider makes the physics-based branding feel more like a positioning strategy than a fundamental methodological advance.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue