Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Gemini 3.8 Flash TTS: voces IA y clonación rápida


Google despliega Gemini 3.8 Flash TTS, nuevos modelos de IA capaces de crear o replicar voces utilizando tan solo un audio de 30 segundos.



Google presenta Gemini 3.8 Flash TTS: clonación de voz ultrarrápida

  • Google ha lanzado sus nuevos modelos Gemini 3.8 Flash TTS y Flash-Lite TTS, herramientas especializadas en la generación de audio. La característica más destacada de esta tecnología es su capacidad para crear voces artificiales desde cero o replicar la voz de una persona utilizando una muestra de sonido de tan solo 30 segundos.



Google ha comenzado a desplegar Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, donde la gran novedad está en la creación o replicación de las voces con IA. TTS ya nos da muchas pistas, y es que estamos ante dos nuevos modelos de generación de voz que buscan ir bastante más allá de los sistemas tradicionales de texto a voz. La principal novedad está en que la IA no se limita a leer un texto con una voz predefinida, sino que puede interpretar un guion siguiendo instrucciones sobre emoción, ritmo, acento, pausas e incluso replicar sonidos propios de una conversación humana.

Gemini 3.8 Flash TTS es el modelo más avanzado y orientado a la creación y personalización, mientras que Gemini 3.8 Flash-Lite TTS está optimizado para reducir costes y generar grandes volúmenes de audio, como doblajes, contenido narrado o agentes de voz. Google plantea estos modelos para aplicaciones como videojuegos, audiolibros, podcasts, vídeos, asistentes de voz y localización de contenidos. Es decir, para creadores de contenido que quieran doblar sus vídeos a otros idiomas para llegar a más gente.

Gemini 3.8 Flash TTS puede crear voces desde cero o replicarlas con solo 30 segundos de audio

Una de las principales novedades de Gemini 3.8 Flash TTS es la posibilidad de diseñar una voz mediante lenguaje natural. El usuario puede describir el tipo de perfil de persona que busca, su edad aparente, personalidad, acento o características vocales. Tras ello, Gemini genera una voz adaptada a esas instrucciones. Google asegura que esta funcionalidad funciona en más de 100 idiomas y dialectos, además de ofrecer una biblioteca de más de 2.000 voces listas para producción.

También incorpora Voice Replication. Bajo este nombre nos encontramos con una función capaz de reproducir de forma consistente una voz existente utilizando únicamente una muestra de audio de unos 30 segundos. Ahora bien, Google exige que se trate de la propia voz del usuario, aunque también permite recurrir a una voz de terceros, siempre y cuando se tengan los correspondientes derechos, y además solicita una grabación verbal de consentimiento del propietario antes de poder crear la réplica. Aunque ya sabemos que muchos actores maliciosos se estarán frotando las manos.

El modelo permite guardar estas voces para reutilizarlas manteniendo su timbre y personalidad en proyectos extensos. Es decir, Gemini evitará así que estas voces vayan cambiando durante el paso de tiempo y generación del contenido. Google también prepara una función bautizada como Voice Remixing. Esta permitirá tomar una de sus voces existentes y modificar mediante instrucciones aspectos como el timbre, tono, velocidad o acento. Esta última característica todavía figura como próximamente disponible. Ahora bien, como ya sucede con todo lo nuevo que sale en IA, por ahora, la replicación de voz a través de Google AI Studio no está disponible en el Espacio Económico Europeo.

La generación de vídeo ahora tendrá un complemento para aportar mayor realismo

Más allá de que Gemini pueda generar una voz convincente, Google ha trabajado especialmente en la interpretación. Los modelos de IA Gemini 3.8 Flash TTS y Flash-Lite TTS permiten introducir instrucciones diferentes para cada línea de un guion, modificando el ritmo, tono emocional, intensidad, acento o forma de pronunciar una frase. También entienden indicaciones para susurrar, reír, suspirar, jadear o introducir pequeñas respuestas naturales como "mhm" cuando piensa o duda. Es decir, se busca ya un gran realismo más allá que una simple lectura automatizada.

Los modelos también pueden manejar escenas con dos interlocutores directamente desde un único guion, manteniendo separadas ambas voces y generando conversación naturales por turnos. Google destaca además que Gemini 3.8 puede conservar la calidad, el ritmo y el timbre de los personajes durante horas de audio. Esto será muy explotado en audiolibros y podcasts largos donde los sistemas de síntesis pueden ir modificando gradualmente la voz..

benchmark modelo Gemini 3.8 TTS generacion de voz

Según los resultados publicados por Google, Gemini 3.8 Flash TTS obtuvo en los test 71,4 puntos. Esto fue suficiente para obtener la primera posición global en la "Prueba de Referencia de Diseño de Voz de Hume AI". Además obtuvo 60,8 puntos en la prueba específica de modelado de acentos. Gemini 3.8 Flash TTS y Flash-Lite TTS también ocuparon las dos primeras posiciones del "Índice de Calidad Global de Hume AI".

Gemini 3.8 Flash TTS ya ha comenzado a desplegarse mediante la API de Gemini API, Google AI Studio y Gemini Notebook. Por su parte, Gemini 3.8 Flash-Lite TTS llega a la API de Gemini, AI Studio y Google Vids. Las empresas también tendrán acceso próximamente mediante Gemini Enterprise. Google indica que todo el audio generado con los modelos Gemini Audio incorpora la marca de agua invisible SynthID. Mientras que la replicación de voces añade credenciales C2PA y el mencionado sistema de verificación de consentimiento.


Fuentes:
https://elchapuzasinformatico.com/2026/09/gemini-3-8-tts-ia-crea-replica-voces/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.