Meta ha lanzado Muse Voice Transcribe, un modelo de audio en tiempo real que transcribe conversaciones y puede identificar a más de 20 oradores sin necesidad de sistemas adicionales. Este modelo segmenta el audio en fragmentos de 80 milisegundos, ajustando el tiempo de espera para cada palabra según su dificultad, lo que permite equilibrar velocidad y precisión durante la transcripción.
Con un costo de $0.18 por hora, Meta se posiciona por debajo de competidores como OpenAI y ElevenLabs. El modelo es compatible con más de 70 lenguas y está disponible tanto en Meta AI como a través de la API de Meta Model.
El sistema también permite detectar límites de oraciones y atribuir palabras a oradores específicos en tiempo real, manteniendo la precisión incluso en grabaciones de más de una hora. En una demostración, el modelo gestionó eficazmente la interacción de ocho personas en una sala, asignando palabras correctamente a cada orador.
La capacidad de manejar el cambio entre idiomas, conocido como code-switching, también se destaca como un punto clave de venta, aumentando la precisión mediante el uso de pistas sobre el idioma y el contexto durante la conversación.