Microsoft AI ha annunciato MAI-Transcribe-2-Streaming, un nuovo modello speech-to-text pensato per la trascrizione in tempo reale, insieme a MAI-Voice-2.1 e MAI-Voice-2.1-Flash per la sintesi vocale. Il pacchetto punta soprattutto agli agenti vocali: ascoltare, trascrivere, ragionare e rispondere con meno attese tra una fase e l’altra.
L’annuncio è del 1 ottobre 2026. Microsoft indica per MAI-Transcribe-2-Streaming il supporto a 60 lingue con rilevamento automatico e continuo della lingua, mentre MAI-Voice-2.1 copre 23 lingue e 26 varianti locali. I tre modelli sono disponibili tramite Microsoft Foundry e MAI Playground; i due modelli vocali sono accessibili anche tramite altri canali indicati da Microsoft.
MAI-Transcribe-2-Streaming: trascrizione mentre stai ancora parlando
La differenza principale rispetto a una trascrizione tradizionale è il comportamento in streaming. Il modello non aspetta la fine della frase: genera trascrizioni parziali mentre riceve l’audio e le aggiorna quando arriva più contesto.
Secondo Microsoft, le prime ipotesi parziali vengono prodotte in poco più di 100 millisecondi dall’arrivo dell’audio. Questo permette a un’applicazione vocale di iniziare a lavorare prima che l’utente abbia terminato la frase, per esempio preparando una ricerca, chiamando uno strumento o aggiornando in diretta i sottotitoli.
Microsoft dichiara inoltre che MAI-Transcribe-2-Streaming è al primo posto su Artificial Analysis per accuratezza sia sulle trascrizioni finali sia su quelle parziali. È un claim del produttore basato sul benchmark citato da Microsoft, quindi va letto nel contesto delle condizioni di test e non come una superiorità assoluta in ogni scenario reale.
60 lingue e rilevamento continuo
Il supporto multilingua è una parte centrale del modello. MAI-Transcribe-2-Streaming lavora in 60 lingue e può rilevare automaticamente il cambio di lingua durante la conversazione. Per un agente vocale significa non dover necessariamente fissare una sola lingua prima di iniziare.
Questo tipo di approccio è utile in assistenza clienti internazionale, dettatura, sottotitoli in tempo reale e applicazioni dove una stessa conversazione può passare da una lingua all’altra.
MAI-Voice-2.1 e Flash: due modelli per rispondere a voce
Accanto alla trascrizione, Microsoft ha aggiornato anche la parte text-to-speech. MAI-Voice-2.1 è il modello orientato alla qualità vocale e supporta 23 lingue e 26 locali. Una singola voce può mantenere la propria identità passando da una lingua all’altra, invece di cambiare completamente timbro quando cambia idioma.
MAI-Voice-2.1-Flash usa lo stesso supporto linguistico, ma è progettato per carichi elevati e scenari sensibili alla latenza. Microsoft dichiara una latenza end-to-end di circa 150 ms per generare 45 secondi di audio, oltre a un’inferenza del 55% più veloce rispetto ai modelli comparabili citati nell’annuncio.
Prezzi dichiarati da Microsoft
- MAI-Transcribe-2-Streaming: prezzo introduttivo di 0,54 dollari per ora di audio fino alla fine del 2026;
- MAI-Voice-2.1: 22 dollari per un milione di caratteri;
- MAI-Voice-2.1-Flash: 15 dollari per un milione di caratteri.
I costi possono incidere molto nei servizi vocali ad alto volume, quindi la variante Flash è chiaramente posizionata per call center, assistenti e workflow dove il tempo di risposta conta più della massima fedeltà disponibile.
Perché questi modelli interessano gli agenti AI
Un agente vocale deve concatenare quattro passaggi: ascoltare, capire, decidere e parlare. Ridurre la latenza nel primo e nell’ultimo passaggio lascia più tempo al modello per ragionare o usare strumenti senza far percepire una pausa innaturale all’utente.
È lo stesso problema che sta spingendo molte aziende a costruire infrastrutture più specifiche per gli agenti. Su Tech abbiamo già visto come NVIDIA stia lavorando sulla sicurezza e sul controllo degli agenti AI, mentre Microsoft sta intervenendo qui sul lato voce e trascrizione.
Per chi sviluppa workflow più generali, è utile anche il quadro di Microsoft Copilot Code per app e automazioni: i nuovi modelli audio aggiungono un livello ulteriore, perché permettono di portare input e output vocali dentro esperienze agentiche che prima erano soprattutto testuali.
Dove sono disponibili
Microsoft indica Microsoft Foundry e MAI Playground tra i punti di accesso per tutti e tre i modelli. MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono inoltre indicati come disponibili tramite OpenRouter, mentre Microsoft cita anche Vercel, Azure Voice Live e LiveKit, quest’ultimo in arrivo.
L’azienda ha pubblicato anche una demo chiamata Chatter nel MAI Playground per mostrare come trascrizione e sintesi vocale possano lavorare insieme in un agente conversazionale.
Cosa cambia in pratica
La novità più importante non è un singolo numero di benchmark, ma l’integrazione tra riconoscimento e generazione vocale a bassa latenza. Se i dati dichiarati da Microsoft si traducono bene nei carichi reali, gli sviluppatori possono iniziare a costruire assistenti che reagiscono mentre l’utente parla, mantengono la stessa voce in più lingue e riducono le pause artificiali.
La fonte primaria è l’annuncio ufficiale Microsoft AI del 1 ottobre 2026, che contiene i dati su lingue, latenza, prezzi, benchmark e disponibilità.




Entra nella conversazione
Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.