
La tecnología puede convertir voz en texto en más de 85 idiomas y detectar cambios de idioma dentro de una misma conversación
Google presentó Gemini 3.5 Transcribe, una nueva herramienta de inteligencia artificial diseñada para convertir grabaciones de voz en texto y facilitar la transcripción de conversaciones en diferentes idiomas y contextos.
La compañía destaca que el sistema puede procesar audio en más de 85 idiomas, incluyendo situaciones en las que existen acentos regionales marcados, ruido de fondo o vocabulario especializado.
Una de las principales características de Gemini 3.5 Transcribe es su capacidad para trabajar con conversaciones multilingües. El sistema puede detectar cuando una persona cambia de idioma durante una misma conversación, evitando que el usuario tenga que establecer manualmente un idioma diferente para cada segmento del audio.
Esta función puede resultar especialmente útil en reuniones internacionales, entrevistas, conferencias, llamadas y otros escenarios en los que participan personas con diferentes idiomas o acentos.
La herramienta también puede tener aplicaciones en la creación de subtítulos, ya que permite transformar contenido hablado en texto que posteriormente puede ser utilizado para acompañar videos u otros materiales audiovisuales.
El alcance lingüístico constituye uno de los principales elementos diferenciadores de la nueva tecnología. Google busca que el sistema pueda comprender una mayor variedad de formas de pronunciación y reducir algunos de los errores que suelen aparecer en las herramientas tradicionales de reconocimiento de voz.
Los acentos regionales representan uno de los desafíos habituales para los sistemas de transcripción automática. Una misma palabra puede ser pronunciada de manera diferente dependiendo del país, la región o incluso del contexto en el que se utiliza.
Gemini 3.5 Transcribe está diseñado para adaptarse a estas variaciones y ofrecer una transcripción más precisa incluso cuando el audio presenta características que pueden dificultar el reconocimiento.
Otro reto importante es el ruido de fondo. Las conversaciones reales no siempre se producen en ambientes completamente silenciosos y pueden incluir voces secundarias, sonidos ambientales o interferencias.
La capacidad de procesar este tipo de grabaciones amplía las posibilidades de utilización de la herramienta más allá de los estudios o espacios profesionales especialmente acondicionados.
El reconocimiento de vocabulario especializado también puede resultar relevante para profesionales que trabajan con términos técnicos o específicos de determinadas industrias.
De esta manera, la herramienta busca convertirse en una solución aplicable a diferentes tipos de usuarios y no únicamente a quienes necesitan realizar transcripciones sencillas de conversaciones cotidianas.
En el ámbito empresarial, por ejemplo, una tecnología de este tipo podría facilitar la documentación de reuniones, entrevistas con clientes, conferencias internacionales y llamadas de trabajo.
En el sector educativo también puede utilizarse para transformar exposiciones o conferencias en documentos de texto, mientras que los creadores de contenido pueden aprovecharla para generar transcripciones y subtítulos de manera más automatizada.
El procesamiento de varios idiomas dentro de una misma conversación representa además una ventaja para equipos internacionales que alternan entre diferentes lenguas durante sus reuniones.
La incorporación de inteligencia artificial al reconocimiento de voz continúa avanzando hacia sistemas capaces no solo de identificar palabras, sino también de comprender diferentes condiciones acústicas y lingüísticas.
Con Gemini 3.5 Transcribe, Google apuesta por ampliar esas capacidades mediante una herramienta enfocada específicamente en la transcripción de audio.
La compañía busca así mejorar la interacción entre voz y texto y ofrecer una tecnología que pueda adaptarse a escenarios donde las herramientas convencionales pueden presentar mayores dificultades.
El desarrollo de sistemas de transcripción cada vez más precisos también puede reducir el tiempo que personas y empresas dedican a convertir manualmente grabaciones en documentos escritos.
Para periodistas, investigadores, productores audiovisuales, estudiantes y profesionales de diferentes áreas, la automatización de este proceso puede representar una reducción considerable del trabajo necesario para organizar información obtenida mediante entrevistas, reuniones o grabaciones.
La capacidad de reconocer más de 85 idiomas también amplía el potencial internacional de la herramienta, especialmente en un contexto en el que las comunicaciones entre personas de diferentes países son cada vez más frecuentes.
Gemini 3.5 Transcribe se incorpora así a la creciente oferta de herramientas basadas en inteligencia artificial orientadas a procesar contenido audiovisual y convertirlo en información utilizable en diferentes formatos.
El avance refleja además una tendencia de la industria tecnológica hacia modelos capaces de comprender información multimodal y desenvolverse en situaciones más cercanas a las condiciones reales en las que las personas utilizan la voz para comunicarse.
Con esta nueva herramienta, Google busca que la transcripción automática sea más flexible frente a los idiomas, los acentos, el ruido y los términos especializados, ampliando las posibilidades de uso de la inteligencia artificial en tareas cotidianas y profesionales.
