![]() Büyük dil modellerinde blok seçimi Ising modeliyle çözüldüBlock selection in large language models solved with the Ising modelHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryMultiverse Computing'deki araştırmacılar, büyük dil modellerindeki (LLM) derinlik budamasını (blok silme işlemini) bir Ising camına eşdeğer, kısıtlı bir ikili optimizasyon problemi olarak yeniden formüle ediyor. Hessian tabanlı bir enerji manzarası kullanarak aday blok silme yapılandırmalarını sıralıyorlar; her birini ayrı ayrı kıyaslamaya gerek kalmıyor. Llama-3.3-70B-Instruct modelinde %50 sıkıştırma oranında, en iyi önceki blok silme taban çizgisine kıyasla MMLU'da yaklaşık 23 puanlık bir iyileşme raporluyorlar.Researchers at Multiverse Computing reformulate depth pruning (block removal) in large language models (LLMs) as a constrained binary optimization problem equivalent to an Ising glass. By using a Hessian-based energy landscape, they rank candidate block removal configurations without needing to evaluate each one individually. On the Llama-3.3-70B-Instruct model, they report an improvement of approximately 23 points on MMLU at a 50% compression rate compared to the best previous block pruning baseline. |
Neden ÖnemliWhy it mattersDerinlik budaması, çıkarım maliyetini düşürmek için en ucuz kaldıraçlardan biri. Ancak mevcut yöntemler blokları bağımsız (ortalama alan) varsayıyor. Agresif sıkıştırma oranlarında baskın olan kombinatoryal etkileşimleri kaçırıyorlar. Tek bir Hessian hesabı binlerce kıyaslama çalışmasının yerini alabiliyorsa, budama uzayını keşfetmenin pratik maliyeti dramatik biçimde düşer. Aynı formülasyon, brüt kuvvetle çözülemeyecek kadar büyük modeller için kuantum tavlama veya QAOA çözücülerine de kapı aralıyor.Depth pruning is one of the cheapest levers for reducing inference costs. However, current methods assume blocks are independent (mean-field), missing the combinatorial interactions that dominate at aggressive compression rates. If a single Hessian calculation can replace thousands of benchmark runs, the practical cost of exploring the pruning space drops dramatically. The same formulation also opens the door to quantum annealing or QAOA solvers for models too large to be solved by brute force. |
Öne ÇıkanlarHighlights
|
EleştiriCritical take23 puanlık MMLU iyileşmesi dikkat çekici. Ancak bu sonuç, kaybın ikinci mertebeden (kuadratik) bir yaklaşımına dayanıyor. %50 sıkıştırma oranında silinen bloklar, Hessian'ın yakalayamadığı yüksek mertebeden terimler aracılığıyla etkileşime giriyor. Bu nedenle 'enerji ≈ kalite' vekili, yöntemin en çok ihtiyaç duyulduğu rejimde zayıflayabilir. Ayrıca 'kuantum' çerçevesi büyük ölçüde iddialı. Yazarların kendileri bile en zor durumları klasik bir tabu çözücüsünün ele aldığını belirtiyor. Kuantum bilişim tedarikçisiyle ticari bağ, fizik temelli markalaşmayı temel bir yöntemsel ilerlemeden çok konumlandırma stratejisi gibi hissettiriyor.The 23-point MMLU improvement is striking. However, this result relies on a second-order (quadratic) approximation of the loss. At a 50% compression rate, the removed blocks interact through higher-order terms that the Hessian cannot capture. Therefore, the 'energy ≈ quality' proxy may weaken precisely in the regime where the method is most needed. Additionally, the 'quantum' framing is largely aspirational. The authors themselves acknowledge that even the hardest cases are handled by a classical tabu solver. The commercial tie to a quantum computing provider makes the physics-based branding feel more like a positioning strategy than a fundamental methodological advance. |
