Vai al contenuto
iCrewPlay.com Un progetto editoriale indipendente
Continua con App e software

MAI-Transcribe-2-Streaming: cosa cambia per agenti vocali AI

I nuovi modelli vocali Microsoft puntano su trascrizione in tempo reale, voce multilingua e meno latenza negli agenti AI.

Microsoft ai e copilot, contesto per modelli vocali e agenti ai
Valencia, Spain - June, 2023: Microsoft Copilot combines the Microsoft 365 apps, Microsoft Graph and Artificial Intelligence. Microsoft 365 apps in a Copilot box in 3D illustration
Tempo di lettura4 minuti
Commenta

Microsoft AI ha annunciato MAI-Transcribe-2-Streaming, un nuovo modello speech-to-text pensato per la trascrizione in tempo reale, insieme a MAI-Voice-2.1 e MAI-Voice-2.1-Flash per la sintesi vocale. Il pacchetto punta soprattutto agli agenti vocali: ascoltare, trascrivere, ragionare e rispondere con meno attese tra una fase e l’altra.

L’annuncio è del 1 ottobre 2026. Microsoft indica per MAI-Transcribe-2-Streaming il supporto a 60 lingue con rilevamento automatico e continuo della lingua, mentre MAI-Voice-2.1 copre 23 lingue e 26 varianti locali. I tre modelli sono disponibili tramite Microsoft Foundry e MAI Playground; i due modelli vocali sono accessibili anche tramite altri canali indicati da Microsoft.

MAI-Transcribe-2-Streaming: trascrizione mentre stai ancora parlando

La differenza principale rispetto a una trascrizione tradizionale è il comportamento in streaming. Il modello non aspetta la fine della frase: genera trascrizioni parziali mentre riceve l’audio e le aggiorna quando arriva più contesto.

Pubblicità

Secondo Microsoft, le prime ipotesi parziali vengono prodotte in poco più di 100 millisecondi dall’arrivo dell’audio. Questo permette a un’applicazione vocale di iniziare a lavorare prima che l’utente abbia terminato la frase, per esempio preparando una ricerca, chiamando uno strumento o aggiornando in diretta i sottotitoli.

Microsoft dichiara inoltre che MAI-Transcribe-2-Streaming è al primo posto su Artificial Analysis per accuratezza sia sulle trascrizioni finali sia su quelle parziali. È un claim del produttore basato sul benchmark citato da Microsoft, quindi va letto nel contesto delle condizioni di test e non come una superiorità assoluta in ogni scenario reale.

60 lingue e rilevamento continuo

Il supporto multilingua è una parte centrale del modello. MAI-Transcribe-2-Streaming lavora in 60 lingue e può rilevare automaticamente il cambio di lingua durante la conversazione. Per un agente vocale significa non dover necessariamente fissare una sola lingua prima di iniziare.

Questo tipo di approccio è utile in assistenza clienti internazionale, dettatura, sottotitoli in tempo reale e applicazioni dove una stessa conversazione può passare da una lingua all’altra.

MAI-Voice-2.1 e Flash: due modelli per rispondere a voce

Accanto alla trascrizione, Microsoft ha aggiornato anche la parte text-to-speech. MAI-Voice-2.1 è il modello orientato alla qualità vocale e supporta 23 lingue e 26 locali. Una singola voce può mantenere la propria identità passando da una lingua all’altra, invece di cambiare completamente timbro quando cambia idioma.

MAI-Voice-2.1-Flash usa lo stesso supporto linguistico, ma è progettato per carichi elevati e scenari sensibili alla latenza. Microsoft dichiara una latenza end-to-end di circa 150 ms per generare 45 secondi di audio, oltre a un’inferenza del 55% più veloce rispetto ai modelli comparabili citati nell’annuncio.

Prezzi dichiarati da Microsoft

  • MAI-Transcribe-2-Streaming: prezzo introduttivo di 0,54 dollari per ora di audio fino alla fine del 2026;
  • MAI-Voice-2.1: 22 dollari per un milione di caratteri;
  • MAI-Voice-2.1-Flash: 15 dollari per un milione di caratteri.

I costi possono incidere molto nei servizi vocali ad alto volume, quindi la variante Flash è chiaramente posizionata per call center, assistenti e workflow dove il tempo di risposta conta più della massima fedeltà disponibile.

Perché questi modelli interessano gli agenti AI

Un agente vocale deve concatenare quattro passaggi: ascoltare, capire, decidere e parlare. Ridurre la latenza nel primo e nell’ultimo passaggio lascia più tempo al modello per ragionare o usare strumenti senza far percepire una pausa innaturale all’utente.

È lo stesso problema che sta spingendo molte aziende a costruire infrastrutture più specifiche per gli agenti. Su Tech abbiamo già visto come NVIDIA stia lavorando sulla sicurezza e sul controllo degli agenti AI, mentre Microsoft sta intervenendo qui sul lato voce e trascrizione.

Per chi sviluppa workflow più generali, è utile anche il quadro di Microsoft Copilot Code per app e automazioni: i nuovi modelli audio aggiungono un livello ulteriore, perché permettono di portare input e output vocali dentro esperienze agentiche che prima erano soprattutto testuali.

Dove sono disponibili

Microsoft indica Microsoft Foundry e MAI Playground tra i punti di accesso per tutti e tre i modelli. MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono inoltre indicati come disponibili tramite OpenRouter, mentre Microsoft cita anche Vercel, Azure Voice Live e LiveKit, quest’ultimo in arrivo.

L’azienda ha pubblicato anche una demo chiamata Chatter nel MAI Playground per mostrare come trascrizione e sintesi vocale possano lavorare insieme in un agente conversazionale.

Cosa cambia in pratica

La novità più importante non è un singolo numero di benchmark, ma l’integrazione tra riconoscimento e generazione vocale a bassa latenza. Se i dati dichiarati da Microsoft si traducono bene nei carichi reali, gli sviluppatori possono iniziare a costruire assistenti che reagiscono mentre l’utente parla, mantengono la stessa voce in più lingue e riducono le pause artificiali.

La fonte primaria è l’annuncio ufficiale Microsoft AI del 1 ottobre 2026, che contiene i dati su lingue, latenza, prezzi, benchmark e disponibilità.

La tua opinione in un clic

Cosa ne pensi?

La sala è aperta

Entra nella conversazione

Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.

Traguardo della community0 / 5
Mancano 5 interventi al prossimo traguardo.

Aggiungi la tua voce

Partecipazione libera: inserisci i dati richiesti e pubblica senza registrarti.