
Google ha puesto sobre la mesa su apuesta más ambiciosa en el campo del reconocimiento de voz. Se llama Gemini 3.5 Transcribe y no es un conversor de voz a texto al uso: promete entender lo que decimos, limpiarlo y devolvernos un texto pulido, sin muletillas y con la puntuación bien puesta. La compañía lo presenta como su modelo más preciso hasta la fecha, y los primeros datos apuntan a que la mejora es notable, sobre todo en entornos ruidosos o con acentos complicados.
La gran novedad es que el sistema no se limita a copiar lo que escucha. Si dices «quedamos el martes… no, el miércoles», el resultado final será «quedamos el miércoles». También elimina los «eh» y «em», formatea números, códigos postales y hasta reconoce vocabulario especializado si se le proporciona una lista personalizada. Todo ello, además, con una velocidad que Google cifra en un 70% más rápida que su anterior motor, Chirp 3, y con soporte para más de 85 idiomas.
Una transcripción que entiende lo que quieres decir
La clave de Gemini 3.5 Transcribe está en la llamada transcripción inteligente. El modelo está entrenado para captar la intención del hablante, no solo las palabras sueltas. Esto se nota en detalles como las autocorrecciones: si te equivocas a mitad de frase y te corriges, el sistema se queda con la versión final. También es capaz de distinguir hasta tres interlocutores en un audio pregrabado y asignar marcas de tiempo a cada intervención, algo muy útil para reuniones, entrevistas o análisis de llamadas.

En cuanto a precisión, los datos que maneja Google hablan de una tasa de error por palabra (WER) del 4% en streaming y del 2,6% en audio ya grabado, según mediciones de Artificial Analysis. Eso significa que, en la práctica, los errores se reducen a menos de tres palabras por cada cien en condiciones normales. La compañía también destaca su rendimiento en entornos con ruido de fondo, donde otros modelos suelen perder pie.
Otra de las bazas del modelo es el vocabulario personalizado. Puedes subir una lista con nombres propios, siglas o términos técnicos y el sistema los reconocerá sin necesidad de deletrearlos. Esto es especialmente útil para médicos, abogados o periodistas que trabajan con jerga específica. Además, el modelo detecta automáticamente el idioma y puede cambiar de uno a otro en mitad de una conversación, algo que hasta ahora era un quebradero de cabeza.
Dónde está disponible y qué productos lo usan
Gemini 3.5 Transcribe no se queda en un experimento de laboratorio. Google ya lo ha integrado en varios de sus productos. El más visible es Rambler, la función de dictado de Gboard en Android, que ahora utiliza este modelo para ofrecer transcripciones más limpias en los teclados de Android. También está presente en la aplicación Gemini para macOS, donde permite dictar comandos de voz que se combinan con el contexto de la pantalla para resumir archivos, generar imágenes o reutilizar texto entre aplicaciones.
Para los desarrolladores, el modelo está disponible en vista previa pública a través de la API de Gemini, tanto en Google AI Studio como en Antigravity. También se puede probar en Gemini Enterprise Agent Platform, la plataforma empresarial de la compañía. Con estas herramientas, los equipos técnicos pueden crear agentes de voz, sistemas de subtitulado en tiempo real o herramientas de análisis de llamadas sin depender de servicios externos.
La siguiente parada será Chrome. Google ha confirmado que está trabajando en la integración del modelo en el navegador, de modo que los usuarios puedan dictar texto en cualquier campo web sin necesidad de cambiar de aplicación. Esto abriría la puerta a redactar correos, rellenar formularios o interactuar con Gemini directamente con la voz, aunque todavía no hay una fecha concreta para su despliegue.
Precios y límites de la versión preliminar
La versión para desarrolladores tiene sus propias reglas. La API Live, pensada para streaming en tiempo real, permite sesiones de hasta diez minutos y no incluye identificación de hablantes. La API Interactions, para audio pregrabado, admite archivos de hasta una hora y sí ofrece diarización con hasta tres voces, aunque la atribución de más de tres hablantes se considera experimental. En cuanto a precios, Google estima un coste combinado de 0,009 dólares por minuto en streaming y 0,005 dólares por minuto en archivos, aunque son cálculos orientativos basados en el consumo de tokens.

Conviene tener en cuenta que la disponibilidad varía según el país y el idioma. Rambler, por ejemplo, solo está activo en determinados mercados, y la aplicación de Gemini para macOS funciona de momento únicamente en inglés. Google no ha dado detalles sobre cuándo se ampliará el soporte a más regiones, pero todo apunta a que será cuestión de meses.
En el plano competitivo, Gemini 3.5 Transcribe llega con un argumento sólido: la corrección automática integrada. Servicios como Whisper de OpenAI o AssemblyAI ofrecen buena precisión, pero no incluyen esa capa de edición que elimina muletillas y formatea el texto. Eso sí, los expertos recuerdan que la supervisión humana sigue siendo necesaria en contextos donde la fidelidad literal sea crítica, como declaraciones legales o informes médicos.
Qué significa esto para el usuario medio
Para quien dicta mensajes, notas o correos desde el móvil, la diferencia se nota desde el primer uso. Las transcripciones llegan más limpias, sin esos «eh» y «em» que luego hay que borrar a mano, y con la puntuación bien colocada. También se agradece que el sistema entienda las correcciones sobre la marcha, algo que ahorra tiempo y evita frustraciones.

En el ámbito profesional, la herramienta puede suponer un antes y un después para periodistas, investigadores o asistentes que trabajan con grabaciones. La posibilidad de identificar quién habla y cuándo en una reunión reduce drásticamente el tiempo de edición. Y para los equipos de atención al cliente, el análisis posterior a las llamadas se vuelve mucho más sencillo con transcripciones precisas y etiquetadas.
Eso sí, conviene recordar que el modelo está en fase de vista previa y que algunas funciones, como la diarización con más de tres voces, aún son experimentales. Google ha prometido mejoras en los próximos meses, pero por ahora la recomendación es revisar siempre las transcripciones antes de darles un uso oficial.
Con la llegada de Gemini 3.5 Transcribe, Google demuestra que la voz puede ser una interfaz tan potente como el teclado, siempre que la tecnología esté a la altura. La combinación de velocidad, precisión y edición automática lo convierte en una herramienta muy atractiva, tanto para usuarios particulares como para empresas. Queda por ver cómo se comporta en el mundo real, pero las primeras impresiones son prometedoras.
