No. 84
2026-10-11
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Koyu bir arka plan üzerinde, açık kahverengi saçları topuz yapılmış bir insan kulağının yakın çekimi gösterilmektedir.

Hayamimi, GPU ve bulut olmadan CPU'da gerçek zamanlı çok dilli konuşma tanıma sağlıyorHayamimi Delivers Real-Time Multilingual Speech Recognition on CPU Without GPU or Cloud

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Hayamimi, yalnızca CPU ile çalışan, açık kaynaklı ve gerçek zamanlı çok dilli konuşma-dan-metin sistemidir. 2 GB RAM altında canlı altyazı, konuşmacı etiketleri ve çeviri sunar; GPU veya bulut API'si gerektirmez. Sistem, her cümleyi sherpa-onnx üzerinde dil bazlı INT8 ONNX modellerine yönlendirir. 6 çekirdekli masaüstü CPU'da 10–50 kat gerçek zamanlı hızda, Japonca TV sesinde %3,8 CER (karakter hata oranı) elde eder.Hayamimi is an open-source, real-time multilingual speech-to-text system that runs exclusively on CPU. It delivers live subtitles, speaker labels, and translation with under 2 GB of RAM, requiring no GPU or cloud APIs. The system routes each sentence to language-specific INT8 ONNX models via sherpa-onnx. On a 6-core desktop CPU, it achieves 10–50x real-time speed and a 3.8% Character Error Rate (CER) on Japanese TV audio.

Neden ÖnemliWhy it matters

GPU ve bulut bağımlılıklarını ortadan kaldırarak, mütevazı donanımlarda üretim kalitesinde canlı altyazıyı mümkün kılar. Bu durum, bağımsız yayıncılar, erişilebilirlik araçları ve çevrimdışı/kenar (edge) dağıtımları için büyük önem taşır. Cümle bazlı dil yönlendirme mimarisi ve INT8 ONNX hattı, ağır çerçeve yükü olmadan çok dilli ASR için pratik ve tekrarlanabilir bir şablon sunar.By eliminating dependencies on GPUs and the cloud, it enables production-quality live subtitling on modest hardware. This is crucial for independent broadcasters, accessibility tools, and offline/edge deployments. Its sentence-level language routing architecture and INT8 ONNX pipeline offer a practical, reproducible template for multilingual ASR without the overhead of heavy frameworks.

Öne ÇıkanlarHighlights

  • Temiz Japonca yayın sesinde %3,8 CER; iki aşamalı düzeltme CER'i %15,5'ten %12,0'ye düşürür3.8% CER on clean Japanese broadcast audio; a two-stage correction reduces CER from 15.5% to 12.0%
  • Cümle bazlı dil algılama ile uzmanlaşmış INT8 ONNX modellerine yönlendirme (PyTorch/CUDA yok); Meta Omnilingual ASR ile ~1.600 dillik yedeklemeSentence-level language detection routing to specialized INT8 ONNX models (no PyTorch/CUDA); Meta Omnilingual ASR serves as a fallback for ~1,600 languages
  • Tam özellik seti: canlı taslak altyazılar (~0,5 sn güncelleme), ~100 ms nihai onay, CAM++/pyannote konuşmacı ayrıştırma, gerçek zamanlı çeviri, OBS katmanı, WebSocket ses girişi ve 2 GB altında kalmak için LRU model atmaFull feature set: live draft subtitles (~0.5s updates), ~100ms final confirmation, CAM++/pyannote speaker diarization, real-time translation, OBS overlay, WebSocket audio input, and LRU model eviction to stay under 2 GB

EleştiriCritical take

Başlıkta yer alan %3,8 CER değeri, gürültülü gerçek dünya koşullarında değil, temiz TV yayın sesinde ölçülmüştür. Sistem ayrıca karma dilli cümleleri, aynı anda konuşan iki kişiyi veya BGM/ses efektlerinin ardından gelen kısa cümleleri güvenilir şekilde transkribe edemez. Çeviri kalitesi küçük modellerle sınırlıdır; Çincede ve Korecede sayı ve para birimi hataları kabul edilmiştir. Bu durum, sayısal doğruluğun kritik olduğu her görevde sistemin kullanımını kısıtlar.The 3.8% CER cited in the title was measured on clean TV broadcast audio, not in noisy real-world conditions. The system also fails to reliably transcribe mixed-language sentences, overlapping speakers, or short sentences following background music/sound effects. Translation quality is limited by small models; errors in numbers and currencies are acknowledged for Chinese and Korean. This restricts the system's use in any task where numerical accuracy is critical.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır. Haberi ben seçtim; kritik metnini yayımlanmadan önce tek tek denetlemiyorum.This critique was written by the local AI model Qwen3.8-27B. I chose the story; I do not review each critique before it is published.
Bültene dönBack to the issue