Las claves verificadas
- MAI-Transcribe-2 incorpora diarización, marcas temporales por palabra y estilos configurables. Ver evidencia
- Microsoft lo ofrece en Foundry, MAI Playground y OpenRouter. Ver evidencia
- La empresa reporta liderazgo en FLEURS y en pruebas de Artificial Analysis, pero las cifras pertenecen al proveedor. Ver evidencia
Qué cambió
Microsoft presentó MAI-Transcribe-2, un modelo de reconocimiento de voz orientado a audio real con ruido, varios hablantes y vocabulario especializado. La novedad agrega diarización para separar voces, marcas temporales por palabra y estilos configurables que permiten adaptar la salida a distintos tipos de transcripción.
También puede servirte: Microsoft capacitó a casi 20.000 personas en IA responsable
La compañía lo describe como su modelo más capaz y sostiene que supera a Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large y ScribeV2. Esa afirmación reúne tres dimensiones diferentes: precisión, velocidad y precio. Un modelo puede liderar una y no necesariamente ofrecer el mejor resultado para cada idioma o grabación.
Microsoft destaca resultados en FLEURS, un conjunto multilingüe creado para evaluar reconocimiento automático de voz en numerosos idiomas. También cita mediciones de Artificial Analysis. Los benchmarks facilitan comparaciones repetibles, pero no reemplazan pruebas con acentos, micrófonos, interrupciones y vocabulario propios de cada uso.
Tabla de decisión: función, utilidad y dato pendiente
La diarización responde quién habló y cuándo. Resulta útil para reuniones, entrevistas, atención al cliente y podcasts, donde una transcripción literal sin identidad de voces obliga a corregir el texto manualmente. Las marcas por palabra agregan precisión para subtítulos, búsqueda y edición sincronizada.
Los estilos configurables permiten pedir una salida más literal o más limpia según el caso. Esa flexibilidad debe evaluarse con cuidado: limpiar muletillas puede mejorar lectura, mientras que en una investigación, una declaración o una historia clínica podría borrar señales relevantes del registro original.

El modelo puede probarse en Microsoft Foundry, MAI Playground y OpenRouter. La publicación no confirma por sí sola igualdad de funciones, precio, límites o residencia de datos entre esas plataformas. Antes de usarlo con material sensible conviene revisar retención, región, permisos y acuerdos aplicables.
Qué límites tiene la evidencia
La comparación útil separa tres preguntas. Para una reunión importa reconocer nombres y turnos; para subtítulos pesan latencia y marcas precisas; para archivos masivos dominan costo y rendimiento. El anuncio ofrece indicadores generales, pero cada organización necesita un lote representativo y una tasa de error medida por idioma.
El dato confirmado es el lanzamiento y las funciones declaradas. La superioridad universal sigue siendo una afirmación del proveedor hasta que pruebas independientes, con configuraciones comparables y muestras públicas, permitan reproducir precisión, velocidad y costo en los mismos escenarios.
En español rioplatense, una prueba mínima debería incluir conversación superpuesta, nombres propios, números, marcas, ruido de calle y cambios de distancia al micrófono. La tasa global puede ocultar errores pequeños pero costosos, como confundir una negación, un monto o la identidad de quien hizo una afirmación.
También conviene conservar audio y texto de referencia bajo controles de privacidad, comparar por separado error de palabras y error de hablante, y revisar el tiempo hasta obtener la salida. Así se evita elegir por una cifra agregada que no representa el trabajo cotidiano.
Una demostración sirve para explorar funciones, pero una adopción requiere documentar versión, parámetros y proveedor. Sin ese registro, una actualización del servicio puede cambiar el resultado y volver imposible comparar la prueba inicial con el desempeño posterior.
Qué aporta VisteEsto: Nuestro trabajo en esta nota
VisteEsto separó los máximos publicados, las condiciones de prueba y lo que todavía requiere validación independiente.
Fuentes, actualizaciones y metodología 3 fuentes
Fuentes consultadas
- Fuente primariaMicrosoft AI: MAI-Transcribe-2
- Fuente secundariaArtificial Analysis: Speech to Text
- Fuente secundariaGoogle Research: FLEURS
Historial de actualización
- Publicación inicial con fuentes verificadas y aporte original visible.
Cómo elaboramos esta nota
Definimos la consulta principal “qué ofrece MAI-Transcribe-2”, contrastamos los datos con 3 fuentes —1 primaria— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.



