Microsoft lanza MAI-Transcribe-2-Streaming, su primer modelo de transcripción en tiempo real, y anuncia dos nuevos modelos de voz
Microsoft AI, el equipo que desarrolla los modelos propios de Microsoft (MAI), presentó el 1 de octubre MAI-Transcribe-2-Streaming, un modelo que pasa la voz a texto mientras la persona habla, sin esperar a que termine la frase. Funciona en 60 idiomas, entre ellos el castellano, y detecta automáticamente el idioma en el que se habla.
Según Microsoft, da sus primeros resultados en algo más de 100 milisegundos y es el número 1 en precisión en Artificial Analysis, una web que compara modelos de IA. Así, un agente de voz puede empezar a pensar o a usar herramientas antes de que el cliente acabe de hablar.
Con él llegan dos voces nuevas (modelos que convierten texto en voz): MAI-Voice-2.1, que habla 23 idiomas con la misma voz y acento nativo en cada uno, y MAI-Voice-2.1-Flash, la versión pensada para mucho volumen y respuestas rápidas. Las dos pueden clonar una voz con unos segundos de audio y llevan controles de consentimiento para evitar abusos.
Precios publicados: 0,54 dólares por hora de audio para la transcripción, como precio de lanzamiento hasta final de año; 22 dólares por millón de caracteres para MAI-Voice-2.1 y 15 dólares para la versión Flash.
Los tres modelos se usan en Microsoft Foundry, la plataforma de Microsoft para crear aplicaciones con IA. La transcripción está en vista previa pública: se puede usar desde cualquier país, se sirve desde la región de Suecia y Microsoft aún no la recomienda para producción.
Creemos que es una pieza interesante para pymes que atienden muchas llamadas: Microsoft pone como ejemplo agentes de atención al cliente que entienden la petición mientras el cliente habla y contestan con voz natural. Al ser una vista previa, conviene probarlo antes de montarlo en un servicio real.