⚡ Últimas

Gemini agora clona sua voz em 30 segundos e atua com risos e sussurros

Radar Olhar Aguçado(há cerca de 2 horas)
Gemini agora clona sua voz em 30 segundos e atua com risos e sussurros

O Google anunciou os novos modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, voltados à geração de voz por inteligência artificial. As ferramentas trazem recursos para criar vozes personalizadas e mais expressivas, incluindo a reprodução de uma voz existente a partir de uma amostra de apenas 30 segundos. A tecnologia também consegue interpretar instruções de atuação e adicionar elementos, como risadas, sussurros e suspiros, às falas. 

Os novos modelos foram desenvolvidos para criar vozes expressivas e personalizadas em diferentes tipos de conteúdo. Eles podem ser usados em audiobooks e podcasts, na criação de vozes para personagens de jogos, em dublagens e na narração de vídeos. A função atende a simulações de atendimento ao cliente, treinamentos e produções narrativas. As empresas, inclusive, podem criar perfis de voz para manter uma identidade sonora consistente em diferentes conteúdos. 

Nos conteúdos de longa duração, a tecnologia busca manter a qualidade, o timbre e o tom da voz ao longo de horas de áudio, reduzindo o chamado speaker drift. O recurso é especialmente útil para audiobooks e podcasts, nos quais alterações na voz podem ficar mais perceptíveis. 

Os modelos também podem ser usados em dublagem e localização de conteúdo, com suporte a mais de 100 idiomas e dialetos. A lista inclui português brasileiro, francês do Quebec e espanhol mexicano. Também é possível gerar agentes de voz mais naturais, com interjeições como “mhm” e “yeah” durante conversas para simular sinais de escuta ativa e diálogos entre duas vozes diferentes a partir de um único roteiro. 

Google Gemini

Para quem preferir, o catálogo já oferece mais de 2.000 vozes prontas para produção. Ainda, o Google prepara uma opção para personalizar as vozes da biblioteca com instruções em texto. A ferramenta deverá permitir ajustes de timbre, tom, ritmo e sotaque sem a necessidade de criar uma voz do zero.

Assim, o Flash TTS tem foco em direção criativa e design de personagens, com controles detalhados para orientar a interpretação linha por linha. Já o Flash-Lite TTS foi desenvolvido para geração em alta escala, com foco em eficiência de custos. 

Além disso, o Google solicita uma gravação de consentimento verbal correspondente ao locutor de referência antes da reprodução de uma voz existente. Os áudios gerados pelos modelos Gemini Audio também recebem o SynthID, uma marca d'água imperceptível incorporada ao conteúdo para ajudar na identificação de material sintético, e credenciais C2PA, que registram informações sobre a origem e a autenticidade do conteúdo.

A clonagem de voz pelo Google AI Studio tem algumas restrições regionais. A função não está disponível no Reino Unido, Espaço Econômico Europeu (EEE), Suíça, Índia e nos estados americanos de Illinois e Texas.

20260924_091905

Onde usar os novos modelos de voz do Gemini?

O Gemini 3.8 Flash TTS será integrado ao Gemini Notebook e o Gemini 3.8 Flash-Lite TTS chegará ao Google Vids para gerar narrações e dublagens em apresentações e outros conteúdos em vídeo. 

Para desenvolvedores, os modelos já estão disponíveis na Gemini API e no Google AI Studio, que oferece um playground de áudio para testar a geração de voz e criar diálogos entre múltiplos personagens. 

O Google também prevê disponibilizar os modelos para clientes do Gemini Enterprise, mas ainda não detalhou todos os recursos que estarão disponíveis nessa versão.

Se você gostou do conteúdo, talvez também se interesse por conferir “7 comandos de voz do Gemini para se manter produtivo e informado”. 

{{WHATSAPP_CHANNEL}}

Gemini agora clona sua voz em 30 segundos e atua com risos e sussurros — Radar Olhar Aguçado | Radar Olhar Aguçado