![]() Hayamimi, GPU ve bulut olmadan CPU'da gerçek zamanlı çok dilli konuşma tanıma sağlıyorHayamimi Delivers Real-Time Multilingual Speech Recognition on CPU Without GPU or CloudHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryHayamimi, yalnızca CPU ile çalışan, açık kaynaklı ve gerçek zamanlı çok dilli konuşma-dan-metin sistemidir. 2 GB RAM altında canlı altyazı, konuşmacı etiketleri ve çeviri sunar; GPU veya bulut API'si gerektirmez. Sistem, her cümleyi sherpa-onnx üzerinde dil bazlı INT8 ONNX modellerine yönlendirir. 6 çekirdekli masaüstü CPU'da 10–50 kat gerçek zamanlı hızda, Japonca TV sesinde %3,8 CER (karakter hata oranı) elde eder.Hayamimi is an open-source, real-time multilingual speech-to-text system that runs exclusively on CPU. It delivers live subtitles, speaker labels, and translation with under 2 GB of RAM, requiring no GPU or cloud APIs. The system routes each sentence to language-specific INT8 ONNX models via sherpa-onnx. On a 6-core desktop CPU, it achieves 10–50x real-time speed and a 3.8% Character Error Rate (CER) on Japanese TV audio. |
Neden ÖnemliWhy it mattersGPU ve bulut bağımlılıklarını ortadan kaldırarak, mütevazı donanımlarda üretim kalitesinde canlı altyazıyı mümkün kılar. Bu durum, bağımsız yayıncılar, erişilebilirlik araçları ve çevrimdışı/kenar (edge) dağıtımları için büyük önem taşır. Cümle bazlı dil yönlendirme mimarisi ve INT8 ONNX hattı, ağır çerçeve yükü olmadan çok dilli ASR için pratik ve tekrarlanabilir bir şablon sunar.By eliminating dependencies on GPUs and the cloud, it enables production-quality live subtitling on modest hardware. This is crucial for independent broadcasters, accessibility tools, and offline/edge deployments. Its sentence-level language routing architecture and INT8 ONNX pipeline offer a practical, reproducible template for multilingual ASR without the overhead of heavy frameworks. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeBaşlıkta yer alan %3,8 CER değeri, gürültülü gerçek dünya koşullarında değil, temiz TV yayın sesinde ölçülmüştür. Sistem ayrıca karma dilli cümleleri, aynı anda konuşan iki kişiyi veya BGM/ses efektlerinin ardından gelen kısa cümleleri güvenilir şekilde transkribe edemez. Çeviri kalitesi küçük modellerle sınırlıdır; Çincede ve Korecede sayı ve para birimi hataları kabul edilmiştir. Bu durum, sayısal doğruluğun kritik olduğu her görevde sistemin kullanımını kısıtlar.The 3.8% CER cited in the title was measured on clean TV broadcast audio, not in noisy real-world conditions. The system also fails to reliably transcribe mixed-language sentences, overlapping speakers, or short sentences following background music/sound effects. Translation quality is limited by small models; errors in numbers and currencies are acknowledged for Chinese and Korean. This restricts the system's use in any task where numerical accuracy is critical. |
