# Microsoft lanza MAI-Transcribe-2 para audio con ruido

> La empresa afirma que supera a modelos rivales en precisión, velocidad y costo. La comparación depende de benchmarks y condiciones publicadas por Microsoft.

- URL canónica: https://visteesto.com/nota/microsoft-mai-transcribe-2-voz-ruido
- Autor: [Martin Rodriguez](https://visteesto.com/autor/martin-rodriguez)
- Publicado: 2026-09-07T21:03:29.736316Z
- Actualizado: 2026-09-07T21:03:29.736316Z
- Sección: Tecnología
- Tema: mai-transcribe-2
- Idioma: es
- Consulta principal: qué ofrece MAI-Transcribe-2

## Resumen verificable

- MAI-Transcribe-2 incorpora diarización, marcas temporales por palabra y estilos configurables. ([evidencia](https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/))
- Microsoft lo ofrece en Foundry, MAI Playground y OpenRouter. ([evidencia](https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/))
- La empresa reporta liderazgo en FLEURS y en pruebas de Artificial Analysis, pero las cifras pertenecen al proveedor. ([evidencia](https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/))

## Aporte editorial de VisteEsto

VisteEsto separó los máximos publicados, las condiciones de prueba y lo que todavía requiere validación independiente.

## Qué cambió

Microsoft presentó MAI-Transcribe-2, un modelo de reconocimiento de voz orientado a audio real con ruido, varios hablantes y vocabulario especializado. La novedad agrega diarización para separar voces, marcas temporales por palabra y estilos configurables que permiten adaptar la salida a distintos tipos de transcripción.

La compañía lo describe como su modelo más capaz y sostiene que supera a Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large y ScribeV2. Esa afirmación reúne tres dimensiones diferentes: precisión, velocidad y precio. Un modelo puede liderar una y no necesariamente ofrecer el mejor resultado para cada idioma o grabación.

Microsoft destaca resultados en FLEURS, un conjunto multilingüe creado para evaluar reconocimiento automático de voz en numerosos idiomas. También cita mediciones de Artificial Analysis. Los benchmarks facilitan comparaciones repetibles, pero no reemplazan pruebas con acentos, micrófonos, interrupciones y vocabulario propios de cada uso.

## Tabla de decisión: función, utilidad y dato pendiente

La diarización responde quién habló y cuándo. Resulta útil para reuniones, entrevistas, atención al cliente y podcasts, donde una transcripción literal sin identidad de voces obliga a corregir el texto manualmente. Las marcas por palabra agregan precisión para subtítulos, búsqueda y edición sincronizada.

Los estilos configurables permiten pedir una salida más literal o más limpia según el caso. Esa flexibilidad debe evaluarse con cuidado: limpiar muletillas puede mejorar lectura, mientras que en una investigación, una declaración o una historia clínica podría borrar señales relevantes del registro original.

El modelo puede probarse en Microsoft Foundry, MAI Playground y OpenRouter. La publicación no confirma por sí sola igualdad de funciones, precio, límites o residencia de datos entre esas plataformas. Antes de usarlo con material sensible conviene revisar retención, región, permisos y acuerdos aplicables.

## Qué límites tiene la evidencia

La comparación útil separa tres preguntas. Para una reunión importa reconocer nombres y turnos; para subtítulos pesan latencia y marcas precisas; para archivos masivos dominan costo y rendimiento. El anuncio ofrece indicadores generales, pero cada organización necesita un lote representativo y una tasa de error medida por idioma.

El dato confirmado es el lanzamiento y las funciones declaradas. La superioridad universal sigue siendo una afirmación del proveedor hasta que pruebas independientes, con configuraciones comparables y muestras públicas, permitan reproducir precisión, velocidad y costo en los mismos escenarios.

En español rioplatense, una prueba mínima debería incluir conversación superpuesta, nombres propios, números, marcas, ruido de calle y cambios de distancia al micrófono. La tasa global puede ocultar errores pequeños pero costosos, como confundir una negación, un monto o la identidad de quien hizo una afirmación.

También conviene conservar audio y texto de referencia bajo controles de privacidad, comparar por separado error de palabras y error de hablante, y revisar el tiempo hasta obtener la salida. Así se evita elegir por una cifra agregada que no representa el trabajo cotidiano.

Una demostración sirve para explorar funciones, pero una adopción requiere documentar versión, parámetros y proveedor. Sin ese registro, una actualización del servicio puede cambiar el resultado y volver imposible comparar la prueba inicial con el desempeño posterior.

## Fuentes consultadas

- Fuente primaria: [Microsoft AI: MAI-Transcribe-2](https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/)
- Fuente secundaria: [Artificial Analysis: Speech to Text](https://artificialanalysis.ai/speech-to-text)
- Fuente secundaria: [Google Research: FLEURS](https://arxiv.org/abs/2205.12446)

## Imágenes y licencias

- Edificio de oficinas de Microsoft rodeado de árboles. Autor: ArthurPants. Licencia: [CC0](https://creativecommons.org/publicdomain/zero/1.0/deed.en). [Origen](https://commons.wikimedia.org/wiki/File:20140511_Microsoft_Development_Game_Studios_Japan.jpg).
- Micrófono de estudio visto en primer plano. Autor: Lucasbosch. Licencia: [CC BY-SA 3.0](https://creativecommons.org/licenses/by-sa/3.0). [Origen](https://commons.wikimedia.org/wiki/File:AKG_C214_Condenser_microphone.jpg).
- Formas de onda de dos pistas de audio. Autor: Kosmosi. Licencia: [CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0). [Origen](https://commons.wikimedia.org/wiki/File:ABBA_-_Super_Trouper_Title_Track_Remaster_Waveform_Comparisons.png).

## Cómo citar

Citar título, autor, fecha de publicación o actualización y la URL canónica. Las afirmaciones centrales incluyen su evidencia directa arriba. Esta versión Markdown es una representación accesible; la nota HTML canónica es la fuente editorial de referencia.
