Google e DeepMind lançam Gemini 3.8, modelos de síntese de voz com suporte a mais de 100 idiomas. Os novos modelos permitem voz agentes e conversas simultâneas via API.
Google e DeepMind lançaram dois novos modelos de síntese de voz: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. O modelo Flash TTS permite criar vozes personalizadas com prompts de linguagem natural, suportando mais de 100 idiomas e dialetos. Além disso, a empresa apresentou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, destinados a desenvolvedores via API e Google AI Studio.
O modelo Live suporta mais de 97 idiomas e permite voz agentes com chamadas de API, processamento de entrada visual e conversa simultânea. O modelo Live Extended Thinking lidera o leaderboard de análise artificial com 82,6%. O custo do Gemini 3.8 Live é de US$ 0,005 por minuto para entrada e US$ 0,018 para saída, contra US$ 0,05 por minuto do GPT-Live-1 da OpenAI.
Uma conversa de 1 hora com o Gemini 3.8 Live custa US$ 1,38, contra US$ 3,00 com o GPT-Live-1 da OpenAI. Os modelos estão disponíveis para desenvolvedores e integrados em serviços como Search, Workspace e Gemini-app.
O Flash-Lite TTS é uma versão mais leve, com menos demanda de recursos computacionais. Essa funcionalidade abre espaço para aplicações como assistentes virtuais que interagem em tempo real com usuários em múltiplas línguas. Isso reduz o gasto em conversas longas, como uma de uma hora, que custa US$ 1,38, contra US$ 3,00 com o GPT-Live-1.
Isso reflete uma maior capacidade de processar informações complexas e oferecer respostas mais precisas. A versão Extended Thinking tem custo mais baixo por minuto de saída do que o GPT-Live-1 da OpenAI.
A novidade está em voz agentes e conversas simultâneas, recursos que antes eram limitados a poucos sistemas. Antes, a geração de voz era estática, mas agora transforma-se em um estúdio criativo. A competição com a OpenAI ganha força, já que os novos modelos custam menos.
A versão Live e Extended Thinking lidera em desempenho, segundo dados do Artificial Analysis. A empresa já oferece soluções em voz, mas o avanço está em permitir conversas em tempo real, algo que antes era difícil. O modelo Flash-Lite TTS também entra na disputa, com custos competitivos. A tecnologia permite que a voz processe informações e continue falando, algo que antes não era possível.
O Gemini 3.8 Live redefine a síntese de voz com suporte a idiomas e dialectos, escalabilidade e desempenho em tarefas complexas. O modelo permite conversas simultâneas e processamento de entrada visual, algo inédito no setor. A escalabilidade do sistema reduz custos, com preços definidos para longos períodos.
A comparação com o GPT-Live-1 da OpenAI mostra vantagem em custo e eficiência. A falta de preços específicos para o Extended Thinking deixa espaço para observação futura.
Ficha técnica
| Item | Especificação |
|---|---|
| Suporte a idiomas | Mais de 100 idiomas e dialectos; outra fonte: Mais de 97 idiomas |
| Funcionalidade | Permite criação de vozes personalizadas com prompts de linguagem natural; outra fonte: Permite voz agentes com chamadas de API, processamento de entrada visual |
| Desempenho no leaderboard | 82,6% |
| Custo por minuto (entrada) | $0,005 |
| Custo por minuto (saída) | $0,018 |
Preço e disponibilidade
| Versão | Preço | Mercado | Disponibilidade |
|---|---|---|---|
| Gemini 3.8 Live | US$ 0,005 por minuto (entrada) | Estados Unidos | Disponível para desenvolvedores |
Sem confirmação
- Preço e data no Brasil não informados
- Suporte em português não foi confirmado em todas as fontes
- Data exata do lançamento não foi confirmada em todas as fontes.
Mais imagens

Fontes
- Say hello to gemini 3 8 text to speechdeepmind.google
- Gemini 3 8 text to speechblog.google
- Google launches gemini 3 8 live to take on openais gpt live 1 at a fraction of the costthe-decoder.com
- Google gemini 38 live modellen moeten ai spraakassistenten slimmer makentweakers.net
- Gemini tts 3 8 flash voice design cloningthenextweb.com
- techmeme.com
- Say hello to gemini 38 text to speechdeepmind.google



