Meta lanza Muse Voice Transcribe para voz en tiempo real
Meta Superintelligence Labs presenta Muse Voice Transcribe, un único modelo que transcribe, distingue hasta 20 voces y detecta pausas en tiempo real, ya disponible en su API y en Meta AI para Mac.

Meta Superintelligence Labs presentó el 1 de septiembre de 2026 Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real. El sistema transcribe voz, distingue a más de 20 hablantes distintos dentro de una misma grabación y detecta el momento exacto en que una persona termina de hablar, tres tareas que hasta ahora exigían tres sistemas separados —uno para transcribir, otro para diarizar y un tercer detector de fin de turno— conectados entre sí, con la latencia y los fallos que cada conexión añade. El modelo ya está disponible a través de la API de Meta, identificado como muse-voice-transcribe-1.0, y alimenta el dictado por voz de la app Meta AI para Mac y de Muse Code, la herramienta de programación asistida de la compañía. Meta no ha publicado los pesos del modelo, así que solo puede usarse de forma alojada, sin opción de instalarlo en servidores propios.
Cómo funciona: escuchar y escribir en el mismo bucle
Muse Voice Transcribe pertenece a la familia Muse Spark y procesa el audio en fragmentos de 80 milisegundos, es decir, 12,5 fragmentos por segundo. Cada fragmento se convierte en un token que el modelo analiza de forma autorregresiva dentro del mismo decodificador que también genera el texto: no existe una fase separada de alineación entre lo que se oye y lo que se escribe, que es precisamente donde los sistemas tradicionales suelen desincronizarse. Tras cada fragmento, el modelo toma una decisión binaria: predice un token que le pide seguir escuchando o emite directamente una palabra. Cuando el audio se detiene, un token especial le indica que no llegará más información y el modelo libera de inmediato cualquier texto pendiente, un comportamiento que Meta llama «escucha flexible» y que también aplica para decidir quién habla en cada momento.
Un retraso que se entrena, no se fija de antemano
La cantidad de audio que el modelo espera antes de escribir una palabra —lo que Meta llama «retraso»— no es un valor fijo: cuanto más contexto acumula, más precisa es la transcripción, pero también aumenta la espera. En lugar de fijar ese equilibrio a mano, los ingenieros de Meta lo entrenaron con aprendizaje por refuerzo, combinando de forma multiplicativa una recompensa por precisión (tasa de error de palabra) y otra por rapidez, de modo que el propio modelo aprende a variar el retraso palabra por palabra según su dificultad. Para identificar a los hablantes, el sistema no recurre a un modelo aparte, sino a tokens especiales dentro del mismo flujo: uno marca un posible cambio de turno en cuanto ocurre, y otro, ligeramente retrasado, asigna una etiqueta de hablante, de la A a la Z; el audio de una misma persona puede repartirse en varios fragmentos que igualmente se resuelven bajo la misma etiqueta. Dos tokens adicionales marcan el inicio y el final de una intervención para el detector de fin de turno, y las tres tareas se entrenan juntas sobre la misma recompensa base de transcripción.
Resultados por encima de Cartesia, ElevenLabs y Gemini
- 3,1% de tasa de error de palabra en la transcripción final, a 0,16 segundos del fin del habla, según el benchmark Artificial Analysis AA-WER Streaming, mejor que Cartesia Ink-2 (3,4% a 0,43 s) y ElevenLabs Scribe v2 Realtime (3,6% a 0,14 s).
- 3,6% de error en la primera transcripción parcial, a solo 0,13 segundos; la variante de Cartesia Ink-2 con puntos finales externos es más rápida (0,07 s) pero menos precisa (4,0%).
- 17,5% de tasa media de error de diarización en las pruebas AMI-IHM, AMI-SDM y VoxConverse, frente a un rango de 21,1% a 28,6% en los otros cinco sistemas evaluados.
- Compatible con grabaciones de más de una hora y con más de 20 hablantes simultáneos, sin procesamiento adicional posterior; la precisión puede reforzarse aún más ajustando el idioma, palabras clave y contexto.
- Precio de 3 dólares por cada 1.000 minutos de audio procesados (0,18 dólares por hora), por debajo de los 4 dólares de Cartesia Ink-2 y menos de la mitad de los 6,50 dólares de ElevenLabs Scribe v2 Realtime y Deepgram Flux.
El modelo se entrenó en más de 70 idiomas, de los cuales 25 pasaron por una validación exhaustiva antes del lanzamiento, y admite el cambio de idioma dentro de una misma frase sin perder precisión, algo habitual entre hablantes bilingües. Meta anunció el lanzamiento el 1 de septiembre de 2026 a través de su cuenta @AIatMeta en X, y lo presenta como su primer modelo de percepción en tiempo real, un paso que llega antes de que OpenAI o Google muestren una versión equivalente para transcripción en vivo. Quien tenga instalada la app Meta AI en un Mac puede probarlo ya: basta con mantener pulsada la tecla Fn y hablar en cualquier aplicación para que el dictado se transcriba con el nuevo modelo.
Para empresas y profesionales de España y América Latina que graban reuniones, ruedas de prensa o entrevistas con varias personas hablando a la vez —periodistas, despachos de abogados, equipos de atención al cliente o servicios de accesibilidad para personas sordas—, un modelo que transcribe, separa voces y detecta pausas en un único paso reduce el coste de infraestructura y el margen de error de encadenar varias herramientas. A cambio, exige aceptar que solo puede usarse a través de la API de Meta, sin la opción de alojarlo en servidores propios ni de auditar sus pesos. Antes de sustituir un flujo de transcripción ya en producción conviene comparar la tasa de error real con el idioma y el acento de cada equipo, ya que solo 25 de los más de 70 idiomas soportados han pasado por una validación exhaustiva.
Fuentes
- Meta lanza Muse Voice Transcribe, su IA de transcripción en vivoHipertextual · 1 de septiembre de 2026
- Meta Superintelligence Labs Releases Muse Voice Transcribe: One Real-Time Model for Streaming ASR, Diarization, and EndpointingMarkTechPost · 1 de septiembre de 2026


