Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6788
)
-
▼
September
(Total:
46
)
-
Anthropic lanza Claude Fable y Mythos 5.1 para pro...
-
Claude Fable 5.1 eleva su rendimiento en ciencia y...
-
El AMD Ryzen 9 9950X3D queda al descubierto: solo ...
-
Bancos frenan financiación de centros de datos de IA
-
LaLiga usa IA contra el fútbol pirata
-
Anthropic lanza Claude Mythos y Fable 5.1 más pote...
-
Astra de OpenAI halla fallos de seguridad y crea e...
-
Meta crea IA que distingue 20 voces
-
Más de 21,000 servidores Microsoft Exchange siguen...
-
Ciberataque a Boston Scientific interrumpe producc...
-
Usan enlaces reales de ChatGPT para instalar malwa...
-
WordPress usa IA para hallar fallos de seguridad
-
Casi 22.000 servidores de Microsoft Exchange en ri...
-
Google lanza Pics para competir con Canva
-
Cinco venezolanos se declaran culpables de vaciar ...
-
Fingen ser reclutadores para infectar a desarrolla...
-
Explotan fallos críticos en Langflow y Rails
-
Firefox 155: actualizaciones cada dos semanas
-
Filtración de datos en Novocure afecta a más de 1....
-
13 paquetes maliciosos de Packagist atacan iPhones...
-
Cronos reinicia su blockchain tras el hackeo de 74...
-
Ciberataques sanitarios afectan a marcapasos y a m...
-
Atacantes aprovechan fallos críticos en Langflow y...
-
OpenClaw 2.0 intenta maquillar un desastre de segu...
-
IA desborda a mantenedores de Linux con fallos
-
Microsoft advierte sobre ataques de TerminalFix qu...
-
El MacBook Neo desgasta el SSD de forma exagerada ...
-
Iraníes se hacen pasar por reclutadores para distr...
-
ChatGPT supera los 45 millones de usuarios y las o...
-
Vulneran routers de Cisco para espiar redes e infr...
-
UE clasifica a ChatGPT, Reddit y Roblox como gigan...
-
Sony y Warner demandan a Anthropic por robo de can...
-
Atacan cuentas root de AWS en más de 150 organizac...
-
Secuestro de BGP desvía tráfico de Softaculous par...
-
HardBreacher reporta zero-day de escalada de privi...
-
El fraude laboral de Corea del Norte se extiende m...
-
Project Helix superará a Xbox
-
Detectan 19 extensiones de Chrome y Edge diseñadas...
-
TerminalFix despliega backdoor de túnel inverso me...
-
Brave lanza alias de correo para proteger tu priva...
-
Fallos en routers D-Link permiten cambiar contrase...
-
Android 17 añade protección contra el rastreo Wi-Fi
-
Debian permite la IA generativa en Linux
-
KVM: varias PC en un solo ordenador
-
Ubuntu 26.04.1 LTS ya disponible
-
KDE Gear 26.08: novedades en Dolphin
-
-
▼
September
(Total:
46
)
Blogroll
Labels
Entradas populares
-
Python 3.15 ya es oficial, introduciendo optimizaciones en TypedDict, Tachyon, JIT y soporte ABI para mejorar la productividad del ecosist...
-
La UE propone un temporizador de 30 minutos para bloquear el fútbol pirata y las IPTV, basándose en el modelo italiano Piracy Shield, afect...
-
Dopamine 3.0 ha lanzado el jailbreak para iOS 26 , confirmando que estas herramientas de desbloqueo siguen vigentes a pesar de las restricc...
Meta crea IA que distingue 20 voces
Meta presenta una IA para transcribir voz en tiempo real
La compañía Meta ha desarrollado una nueva herramienta llamada Muse Voice Transcribe, creada por su equipo de Superinteligencia. Este modelo destaca por su capacidad para identificar hasta 20 voces diferentes dentro de una misma grabación, permitiendo distinguir quién habla y reconocer las pausas en la conversación.
Este avance tecnológico, que se posiciona frente a las propuestas de OpenAI, estará integrado en la app de Meta AI para Mac y también estará disponible a través de su API.

Meta se ha adelantado a OpenAI al lanzar un modelo que transcribe voz en tiempo real. Desarrollado por el equipo de Superinteligencia, Muse Voice Transcribe es capaz de identificar distintas personas en una conversación y detectar las pausas. El nuevo modelo estará disponible en la API y en la app de Meta AI para Mac.
De acuerdo con una publicación en su blog, Muse Voice Transcribe es el primer modelo de percepción en tiempo real que desarrolla Meta. A diferencia de otras variantes con las que ha experimentado la compañía, esta IA puede distinguir más de 20 hablantes distintos dentro de una misma grabación. Si has intentado grabar una reunión con varias personas hablando a la vez, seguramente sabrás que es casi imposible realizar una transcripción.
Meta entrenó el sistema con más de 70 idiomas, de los cuales 25 pasaron por un proceso de validación exhaustiva antes del lanzamiento. Esta variedad no solo permite que más personas puedan hacer transcripciones, sino también hablar en múltiples idiomas en la misma conversación. La compañía señala que los hablantes bilingües alternan entre idiomas de forma natural y a veces lo hacen a mitad de una frase, lo cual no representará problemas para este modelo.

En la parte técnica, la arquitectura detrás de Muse Voice Transcribe procesa el audio en fragmentos de 80 milisegundos. Esto equivale a 12,5 segmentos por segundo, los cuales se convierten cada uno en un token que analiza de forma autorregresiva. En cada fragmento, la IA es capaz de elegir si emite una palabra de inmediato o espera el siguiente bloque de audio para obtener más contexto.
Muse Voice Transcribe reconoce a más de 20 personas hablando, incluso si cambian idioma
Según Meta, este sistema funciona porque no todas las palabras requieren el mismo tiempo de análisis. Las palabras sencillas se transcriben casi al instante, mientras que aquellas que son ambiguas o más difíciles de interpretar necesitan más contexto antes de que la IA las convierta a texto. Los ingenieros de Meta usaron entrenamiento con refuerzo que combina la precisión de la transcripción y el tiempo de espera como parte de la recompensa.
Introducing Muse Voice Transcribe! 🗣️
— Spencer Barnett (@spencerbarnett) September 1, 2026
This is our first real-time audio perception model from @AIatMeta. It's trained on 70+ languages and delivers diarization with 20+ speakers.
Available now in the Meta AI macOS app! pic.twitter.com/28jMzyR88L
Muse Voice Transcribe es compatible con grabaciones de más de una hora sin necesidad de procesamiento adicional. Cuando el audio se detiene, un token le indica al modelo que no hay más información entrante, por lo que libera cualquier texto pendiente de emitir. La compañía define este comportamiento como escucha flexible y lo aplica también al momento de identificar quién está hablando en ese momento.
En términos de rendimiento, el modelo registra una tasa de error de palabras del 3.1% en idioma inglés, superando a GPT Live Transcribe y Gemini Transcribe Live. A la hora de identificar distintos hablantes, la tasa de error se ubica en 17,5%, que representa el valor más bajo entre los modelos de transcripción más populares.

Muse Voice Transcribe ya está disponible a través de la API por un coste de 3 dólares por cada 1.000 minutos de audio procesado. Meta confirmó que no tiene planes de publicar los pesos abiertos de este modelo, pero podrás acceder a él a través del dictado de Meta AI para Mac y Muse Code. Si ya la instalaste, solo presiona la tecla Fn y comienza a hablar en cualquier aplicación.
Fuentes:
https://hipertextual.com/inteligencia-artificial/meta-muse-voice-transcribe-ia-transcripcion-tiempo-real/
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.