Google ha presentato due nuovi modelli vocali, Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, pensati per rendere le conversazioni con l’AI più naturali e capaci di gestire compiti complessi senza interrompere il dialogo. L’annuncio, diffuso dal team audio di Google, segna un passo ulteriore verso agenti vocali in grado di ascoltare, ragionare e agire in tempo quasi reale. La notizia è stata ripresa anche nella newsletter di Futurepedia.
Due modelli, due obiettivi
I due modelli non sono identici. Gemini 3.8 Live è descritto come la variante costruita per scalare e contenere i costi, con una conversazione fluida e la capacità di interpretare input visivi in tempo quasi reale. Gemini 3.8 Live Extended Thinking è invece pensato per attività ad alta complessità: ragiona e parla allo stesso tempo, usando frasi di raccordo come “Fammi controllare…” per non lasciare l’utente senza risposta mentre elabora.
Entrambi sono disponibili tramite Gemini API, Google Workspace e l’app Gemini, oltre che in Search.
Cosa cambia rispetto al passato
Il punto centrale è la gestione del flusso conversazionale. Secondo Google, i modelli possono:
- gestire interruzioni e cambi di lingua durante la conversazione, con supporto a 97 lingue rilevate e commutate automaticamente;
- eseguire chiamate a strumenti e API in background mentre la conversazione continua, così l’utente non resta in attesa silenziosa;
- elaborare input visivi in tempo quasi reale per arricchire il contesto della risposta;
- narrare i progressi di un compito multi-step mentre viene svolto.
In pratica, l’obiettivo è rendere l’interazione vocale più simile a una conversazione con una persona che sta effettivamente lavorando su qualcosa, invece di un turno di domanda e risposta rigido.
I numeri dichiarati da Google
La fonte riporta alcuni risultati di benchmark per Gemini 3.8 Live Extended Thinking:
- primo posto con 82,6 sullo Speech to Speech Quality Index di Artificial Analysis;
- 68,6% su τ-Voice per il completamento di compiti agentici;
- 35,1% sul benchmark τ-Voice-banking di Sierra;
- 97,7% su Big Bench Audio per le capacità di ragionamento.
Gemini 3.8 Live, dal canto suo, si posiziona secondo nella Speech Agent Arena e viene presentato come particolarmente efficiente in termini di costi. Google cita anche EVA-Bench di ServiceNow, sostenendo che i modelli spostano la frontiera di Pareto per i flussi di lavoro complessi bilanciando accuratezza e qualità conversazionale.
Si tratta di dati forniti dall’azienda stessa o da piattaforme terze citate nella comunicazione: utili come riferimento, ma da leggere con la consueta cautela, perché i benchmark non sempre riflettono l’uso reale.
A chi serve
Il pubblico più direttamente interessato è quello degli sviluppatori e delle aziende che costruiscono agenti vocali. Google elenca alcune piattaforme che integrano la Live API — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents — e partnership con Salesforce, Genspark e Lumeris. Queste infrastrutture gestiscono lo streaming multimediale in tempo reale, lasciando agli sviluppatori il compito di progettare l’esperienza.
Sul fronte degli utenti finali, le novità arrivano in prodotti concreti: Docs Live, Gmail Live e Keep Live in Workspace, il supporto passo-passo in Search Live e, nell’app Gemini, funzioni come il Daily Brief o la gestione vocale delle attività quotidiane.
Limiti e cose da verificare
Alcuni aspetti restano da chiarire. La fonte non indica prezzi specifici né limiti di utilizzo, e non entra nel dettaglio di come i modelli si comportino in condizioni di rete instabili o con accenti e rumori di fondo. La disponibilità effettiva nelle diverse aree geografiche e nei piani Workspace non è specificata.
Un elemento interessante è la trasparenza: Google dichiara che tutto l’audio generato dai suoi prodotti AI è marcato con SynthID, una filigrana impercettibile. È un dettaglio rilevante in un momento in cui la distinzione tra voce umana e sintetica diventa sempre più difficile.
La direzione è chiara: l’AI vocale non è più solo un’interfaccia per fare domande, ma un assistente che ragiona, agisce e racconta cosa sta facendo. Resta da vedere quanto questa esperienza regga nella pratica quotidiana, fuori dalle demo e dai benchmark.
