No. 44
2026-09-01
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görselde, siyah çerçeveli beyaz bir kutu içinde "AI Weekly" metni ve bunun altında "by essentials" metni yer almaktadır.

Tsinghua ekibi 2 milyar parametreli LLM'yi tüketici donanımında eğittiTsinghua team trains 2B parameter LLM on consumer hardware

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Tsinghua Üniversitesi araştırmacıları, 2 milyar parametreli bir büyük dil modeli (LLM) olan Puro-2B'yi, tüketici segmentindeki RTX 5090 GPU'larında, 6.900 doların altında bir maliyetle sıfırdan eğitti. Ekip, tam eğitim tarifi, ağırlıkları ve verileri Apache 2.0 lisansı altında yayımladı. Makale ayrıca, Qwen2-1.5B seviyesindeki performansa ulaşmak için yaklaşık 4.400 doların yeterli olacağını öngören 'Puro Maliyet Ölçek Yasası'nı da tanıtır.Researchers at Tsinghua University trained Puro-2B, a 2-billion parameter large language model (LLM), from scratch on consumer-grade RTX 5090 GPUs for a total cost of under $6,900. The team released the full training recipe, weights, and data under an Apache 2.0 license. The paper also introduces the 'Puro Cost Scaling Law,' which predicts that approximately $4,400 is sufficient to achieve performance levels comparable to Qwen2-1.5B.

Neden ÖnemliWhy it matters

LLM'lerin ön eğitimi, büyük ölçüde sektörel ölçekli hesaplama bütçelerinin arkasında kalmış; bu durum, modelleri sıfırdan inşa etme imkânını çoğu akademik laboratuvar için fiilen ortadan kaldırmıştır. Tüketici donanımında, GPU'nun kendi perakende satış fiyatının bile altında bir maliyetle tam ve tekrarlanabilir bir tarif yayımlayarak bu çalışma, bağımsız araştırmalar için engeli anlamlı biçimde düşürüyor. Apache 2.0 lisansı ise herhangi bir laboratuvarın ya da bireyin, bu sonuçlar üzerinde kısıtlama olmadan çalışabilmesini sağlıyor.The pre-training of LLMs has largely remained behind the curtain of industry-scale compute budgets, effectively eliminating the possibility of building models from scratch for most academic laboratories. By publishing a full, reproducible recipe on consumer hardware at a cost even lower than the GPU's own retail price, this work significantly lowers the barrier for independent research. The Apache 2.0 license further ensures that any lab or individual can work with these results without restriction.

Öne ÇıkanlarHighlights

  • RTX 5090'larda FP8 hassasiyetinde en fazla 1.4 trilyon token ile eğitildi; gerçek maliyet 6.900 doların altında, ölçek yasası ise Qwen2-1.5B seviyesindeki performans için yaklaşık 4.400 dolar öngörüyorTrained with up to 1.4 trillion tokens at FP8 precision on RTX 5090s; the actual cost was under $6,900, while the scaling law predicts approximately $4,400 for Qwen2-1.5B-level performance.
  • Puro-2B, ekibin değerlendirme protokolüne göre Qwen2.5-1.5B'ye yaklaşırken, SmolLM3-3B'ün yeniden üretimi 700.000 doların üzerinde bir maliyetle tahmin ediliyorPuro-2B approaches Qwen2.5-1.5B according to the team's evaluation protocol, whereas reproducing SmolLM3-3B is estimated to cost over $700,000.
  • Ön eğitim veri müfredatlarının sonradan eğitime (post-training) olan etkisini inceleyen kontrollü çalışmaları içeriyor; bu da maliyet manşetinin ötesinde metodolojik derinlik katıyorIncludes controlled studies examining the impact of pre-training data curricula on post-training, adding methodological depth beyond the cost headline.

EleştiriCritical take

Manşetteki '5.090 dolar' rakamı aslında ölçek yasasından gelen bir maliyet tahmini olup gerçek eğitim harcaması (6.900 doların altı) değildir; bu, ince ama anlamlı bir karışıklıktır. Ayrıca mutlak anlamda 1.5B'lik bir taban değere yaklaşan 2B'lik bir model, mütevazı bir başarıdır. arXiv ön baskısı henüz hakem değerlendirmesinden geçmediğinden, maliyet iddiaları ve performans karşılaştırmaları bağımsız olarak tekrarlanana kadar geçici kabul edilmelidir.The '$5,090' figure in the headline is actually a cost estimate derived from the scaling law, not the actual training expenditure (which was under $6,900); this is a subtle but significant confusion. Additionally, a 2B model approaching a 1.5B baseline is a modest achievement. Since the arXiv preprint has not yet undergone peer review, cost claims and performance comparisons should be considered provisional until independently replicated.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue