Microsoft, ilk akışlı yazıya dökme modelini duyurduMicrosoft announces its first streaming transcription modelHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryMicrosoft AI, ilk akışkan transkripsiyon modeli MAI-Transcribe-2-Streaming'i ve iki metinden konuşma (TTS) modeli olan MAI-Voice-2.1 ile Flash varyantını Microsoft Foundry üzerinde herkese açık önizleme olarak tanıttı. Bu modeller, gerçek zamanlı sesli ajanlar geliştirmeye odaklanıyor.Microsoft AI has introduced its first streaming transcription model, MAI-Transcribe-2-Streaming, along with two text-to-speech (TTS) models, MAI-Voice-2.1 and its Flash variant, as a public preview on Microsoft Foundry. These models are designed with a focus on developing real-time voice agents. |
Neden ÖnemliWhy it mattersBu hamle, Microsoft'u hızla değişen gerçek zamanlı sesli yapay zeka alanında OpenAI'nin GPT-Realtime-Whisper'ı, Google'ın Gemini 3.8 Live'ı ve Meta'nın açık kaynak Omnilingual ASR'siyle doğrudan rekabete sokuyor. 100 milisaniyenin altındaki geçici transkripsiyon gecikmesi ve agresif başlangıç fiyatı (saat başına 0,54 dolar), Microsoft'un kurumsal sesli ajan iş yüklerini Foundry platformuna kilitleme niyetini gösteriyor. Geliştiriciler için ise ASR, TTS ve ses klonlama bileşenlerinin tek pakette sunulması, çok dilli konuşma ürünlerinde entegrasyon engellerini düşürüyor.This move places Microsoft in direct competition with OpenAI's GPT-Realtime-Whisper, Google's Gemini 3.8 Live, and Meta's open-source Omnilingual ASR in the rapidly evolving real-time voice AI space. A provisional transcription latency of under 100 milliseconds and an aggressive starting price ($0.54 per hour) indicate Microsoft's intent to lock in enterprise voice agent workloads to the Foundry platform. For developers, the bundling of ASR, TTS, and voice cloning components reduces integration barriers for multilingual speech products. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeÖne çıkan 'Chatter' demosu Japonca girdiyi kabul ediyor ancak yalnızca İngilizce yanıt verebiliyor. Bu durum, modelin bölgesel olarak barındırıldığı Japonya pazarında 60 dil iddiasındaki pratik bir eksikliği gözler önüne seriyor. Ayrıca 1 numara doğruluk oranı, Artificial Analysis'ten kendi kendine alıntılanıyor. Saat başına 0,54 dolarlık ASR fiyatı ise yalnızca yıl sonuna kadar geçerli olan açık bir başlangıç ücreti. Bu da uzun vadeli maliyet rekabetçiliğini belirsiz kılıyor.The highlighted 'Chatter' demo accepts Japanese input but can only respond in English. This exposes a practical gap in the 60-language claim within the Japanese market, where the model is regionally hosted. Additionally, the #1 accuracy rate is self-cited from Artificial Analysis. The $0.54 per hour ASR price is an explicit introductory rate valid only through the end of the year, leaving long-term cost competitiveness uncertain. |