2026-10-02
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görsel, mavi bir arka plan üzerinde çok sayıda tırnak işareti ve “Sesli asistanlar için hızlı, doğru ve düşük maliyetli ses anlama ve üretimi” metnini içeriyor.

Microsoft, ilk akışlı yazıya dökme modelini duyurduMicrosoft announces its first streaming transcription model

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Microsoft AI, ilk akışkan transkripsiyon modeli MAI-Transcribe-2-Streaming'i ve iki metinden konuşma (TTS) modeli olan MAI-Voice-2.1 ile Flash varyantını Microsoft Foundry üzerinde herkese açık önizleme olarak tanıttı. Bu modeller, gerçek zamanlı sesli ajanlar geliştirmeye odaklanıyor.Microsoft AI has introduced its first streaming transcription model, MAI-Transcribe-2-Streaming, along with two text-to-speech (TTS) models, MAI-Voice-2.1 and its Flash variant, as a public preview on Microsoft Foundry. These models are designed with a focus on developing real-time voice agents.

Neden ÖnemliWhy it matters

Bu hamle, Microsoft'u hızla değişen gerçek zamanlı sesli yapay zeka alanında OpenAI'nin GPT-Realtime-Whisper'ı, Google'ın Gemini 3.8 Live'ı ve Meta'nın açık kaynak Omnilingual ASR'siyle doğrudan rekabete sokuyor. 100 milisaniyenin altındaki geçici transkripsiyon gecikmesi ve agresif başlangıç fiyatı (saat başına 0,54 dolar), Microsoft'un kurumsal sesli ajan iş yüklerini Foundry platformuna kilitleme niyetini gösteriyor. Geliştiriciler için ise ASR, TTS ve ses klonlama bileşenlerinin tek pakette sunulması, çok dilli konuşma ürünlerinde entegrasyon engellerini düşürüyor.This move places Microsoft in direct competition with OpenAI's GPT-Realtime-Whisper, Google's Gemini 3.8 Live, and Meta's open-source Omnilingual ASR in the rapidly evolving real-time voice AI space. A provisional transcription latency of under 100 milliseconds and an aggressive starting price ($0.54 per hour) indicate Microsoft's intent to lock in enterprise voice agent workloads to the Foundry platform. For developers, the bundling of ASR, TTS, and voice cloning components reduces integration barriers for multilingual speech products.

Öne ÇıkanlarHighlights

  • 60 dilde otomatik algılama ile yaklaşık 100 milisaniye geçici transkripsiyon gecikmesi; Artificial Analysis akışkan ASR kıyaslamasında 1 numara olduğu iddiasıApproximately 100 milliseconds of provisional transcription latency with automatic detection across 60 languages; claims to rank #1 in the Artificial Analysis streaming ASR benchmark
  • MAI-Voice-2.1-Flash, 150 milisaniye gecikmeyle 45 saniyelik ses üretiyor. Benzer TTS modellerinden yaklaşık %60 daha ucuz (milyon karakter başına 15 dolar)MAI-Voice-2.1-Flash generates 45 seconds of audio with 150 milliseconds of latency. It is approximately 60% cheaper than similar TTS models ($15 per million characters)
  • Ses klonlama, onay ve inceleme süreciyle sınırlı. Japonya Doğu bölgesinde hizmet sunulmasına rağmen varsayılan ses listesinde Japonca yer almıyorVoice cloning is limited by an approval and review process. Although the service is available in the Japan East region, Japanese is not included in the default voice list

EleştiriCritical take

Öne çıkan 'Chatter' demosu Japonca girdiyi kabul ediyor ancak yalnızca İngilizce yanıt verebiliyor. Bu durum, modelin bölgesel olarak barındırıldığı Japonya pazarında 60 dil iddiasındaki pratik bir eksikliği gözler önüne seriyor. Ayrıca 1 numara doğruluk oranı, Artificial Analysis'ten kendi kendine alıntılanıyor. Saat başına 0,54 dolarlık ASR fiyatı ise yalnızca yıl sonuna kadar geçerli olan açık bir başlangıç ücreti. Bu da uzun vadeli maliyet rekabetçiliğini belirsiz kılıyor.The highlighted 'Chatter' demo accepts Japanese input but can only respond in English. This exposes a practical gap in the 60-language claim within the Japanese market, where the model is regionally hosted. Additionally, the #1 accuracy rate is self-cited from Artificial Analysis. The $0.54 per hour ASR price is an explicit introductory rate valid only through the end of the year, leaving long-term cost competitiveness uncertain.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue