Las claves verificadas

  • Gemini 3.5 Transcribe reconoce automáticamente más de 85 variantes lingüísticas y puede cambiar de idioma dentro de una conversación. Ver evidencia
  • El modelo ofrece vocabulario personalizado de hasta 1.000 términos, aunque Google recomienda listas de hasta 100 para obtener mejores resultados. Ver evidencia
  • La transcripción literal puede incluir identificación de hablantes y marcas de tiempo por palabra. Ver evidencia
  • El modo inteligente elimina muletillas, resuelve autocorrecciones habladas y aplica formato al texto. Ver evidencia
  • Google ofrece procesamiento de grabaciones y una variante en tiempo real mediante APIs diferentes. Ver evidencia

Qué es Gemini 3.5 Transcribe

Google presentó Gemini 3.5 Transcribe, un modelo especializado en convertir voz y archivos de audio en texto. Está disponible para desarrolladores con el identificador gemini-3.5-transcribe y tiene una variante separada para transmisiones en tiempo real.

La herramienta detecta automáticamente más de 85 idiomas y variantes regionales. También puede reconocer cambios de idioma dentro de una frase o entre intervenciones sin que el desarrollador configure manualmente cada tramo.

Google lo orienta a dictado, reuniones, registros de llamadas y aplicaciones de voz. No es un modelo general para responder preguntas sobre un audio: la compañía mantiene esa tarea dentro de sus funciones de comprensión de audio.

Qué puede hacer con una grabación

La modalidad literal conserva lo que se dijo, incluidas muletillas, repeticiones y comienzos fallidos. Sobre esa salida se pueden activar marcas de tiempo para cada palabra e identificación de hablantes.

La documentación admite hasta ocho hablantes, aunque advierte que la atribución de tres o más todavía es experimental. Las marcas de tiempo también pueden reducir la precisión general de la transcripción.

Interfaz de Google Gemini en una computadora
Gemini incorpora distintas capacidades de texto, audio y asistencia. Captura de archivo. · Google · Fuente · Public Domain

El vocabulario personalizado permite indicar nombres propios, siglas y términos técnicos. El límite es de 1.000 expresiones, pero Google señala que los mejores resultados suelen obtenerse con listas más enfocadas, de hasta 100 términos.

Modo inteligente o literal: cuál conviene usar

El modo literal conviene cuando importa conservar exactamente lo dicho: entrevistas, declaraciones, evidencia, subtitulado preciso o análisis lingüístico. Es el modo compatible con identificación de hablantes y tiempos por palabra.

El modo inteligente prioriza legibilidad. Quita “eh”, “um” y otras muletillas, elimina repeticiones, interpreta correcciones sobre la marcha y puede transformar una secuencia hablada en párrafos, listas, fechas, monedas y números con formato.

La elección tiene un límite importante: Google no permite combinar el modo inteligente con diarización o marcas de tiempo. Quien necesite saber quién dijo cada frase y en qué segundo debe usar la versión literal y limpiar el texto después.

Cómo maneja las autocorrecciones y la intención

Si una persona dice “reunión el martes, no, el miércoles a las dos”, el modo inteligente puede conservar solo la corrección final y escribir la fecha y la hora de manera ordenada. Esa limpieza busca producir texto listo para leer.

La palabra “intención” no significa que el sistema garantice comprender todo contexto. Describe su capacidad para resolver patrones de habla, correcciones y estructura. Nombres poco comunes, ruido intenso o voces superpuestas todavía pueden generar errores.

Micrófono de estudio preparado para grabar voz
La calidad del audio y la separación entre voces siguen influyendo en el resultado. Foto de archivo. · Will Fisher · Fuente · CC BY-SA 2.0

Para contenidos periodísticos, legales, médicos o financieros, la revisión humana sigue siendo necesaria. Una transcripción fluida puede parecer correcta incluso cuando reemplaza una palabra crítica por otra fonéticamente similar.

Dónde está disponible y cuáles son sus límites

Los desarrolladores pueden procesar archivos mediante la Interactions API y usar audio en vivo con la Live API. Google también viene integrando dictado inteligente en productos de consumo, como la aplicación Gemini para macOS.

Las solicitudes estándar admiten archivos de hasta una hora. Cuando se activan identificación de hablantes o tiempos por palabra, el procesamiento queda limitado a 30 minutos, según la documentación publicada por Google.

La disponibilidad en una API no implica que todas las cuentas de la aplicación Gemini reciban de inmediato los mismos controles. Los despliegues de productos y la plataforma para desarrolladores siguen cronogramas diferentes.

Qué cambia frente a un transcriptor tradicional

Un reconocedor clásico intenta convertir sonidos en palabras. Gemini 3.5 Transcribe agrega una capa que normaliza números, organiza ideas y resuelve ciertas correcciones, lo que puede ahorrar edición en notas, actas y dictados.

Ese beneficio también introduce una decisión editorial: cuanto más limpia el sistema, más se aleja del registro literal. Por eso Google conserva dos modos en lugar de aplicar la corrección automática a todos los trabajos.

La mejora útil no es simplemente “transcribir mejor”, sino poder elegir entre fidelidad documental y texto listo para usar. La configuración correcta depende del destino de la grabación y del nivel de revisión que tendrá después.

Qué aporta VisteEsto: Nuestro trabajo en esta nota

Compara las dos modalidades de transcripción, muestra qué combinaciones de funciones no están permitidas y convierte la documentación técnica en una guía de elección práctica.

Fuentes consultadas

Historial de actualización

  • Publicación inicial basada en la documentación técnica de Google y el anuncio del producto.
Cómo elaboramos esta nota

Definimos la consulta principal “cómo funciona Gemini 3.5 Transcribe”, contrastamos los datos con 3 fuentes —2 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.