Gemini 3.5 Live Translate: traducción de voz en tiempo real en más de 70 idiomas
IA

Gemini 3.5 Live Translate: traducción de voz en tiempo real en más de 70 idiomas

En resumen

Google DeepMind lanza Gemini 3.5 Live Translate, un modelo de audio que ofrece traducción de voz a voz casi en tiempo real en más de 70 idiomas, preservando la entonación, el ritmo y el tono del hablante. La solución se despliega simultáneamente para desarrolladores, empresas y usuarios finales a través de Google AI Studio, Google Meet y la aplicación Google Translate. Esta actualización representa un salto cualitativo respecto a los sistemas de traducción por turnos, al generar audio continuo y fluido con apenas unos segundos de desfase.

Puntos clave

  • Gemini 3.5 Live Translate detecta automáticamente más de 70 idiomas y genera voz traducida preservando la entonación, el ritmo y el tono del hablante original, sin necesidad de configuración manual.
  • A diferencia de los sistemas de traducción por turnos, el modelo procesa el audio de forma continua mientras el hablante habla, manteniéndose apenas unos segundos por detrás del orador en todo momento.
  • El despliegue es inmediato en tres frentes: acceso público en Google AI Studio y la Gemini Live API para desarrolladores, versión privada para clientes empresariales de Google Workspace en Google Meet, y disponibilidad global en la aplicación Google Translate para Android e iOS.
  • Google Meet pasa de soportar 5 idiomas y traducciones únicamente hacia y desde el inglés, a ofrecer más de 70 idiomas y más de 2000 combinaciones lingüísticas dentro de una misma reunión.
  • La empresa Grab, que gestiona más de 10 millones de llamadas de voz mensuales entre conductores y pasajeros, ya está probando el modelo para habilitar comunicación multilingüe casi en tiempo real en sus servicios de transporte.
  • Todo el audio generado por el modelo incluye la marca de agua imperceptible SynthID, integrada directamente en la señal de audio para permitir la detección de contenido generado por inteligencia artificial y combatir la desinformación.

Análisis

El lanzamiento de Gemini 3.5 Live Translate marca una inflexión tecnológica relevante en la historia de la traducción automática en Google, que acumula más de veinte años de desarrollo y traduce hoy más de un billón de palabras al mes para miles de millones de usuarios. El salto de un sistema reactivo basado en turnos a un modelo de generación continua de audio supone una mejora percibida muy significativa en naturalidad y fluidez, dos factores que determinan la adopción real por parte de los usuarios en contextos profesionales y cotidianos.

Para las agencias y los responsables de marketing, la expansión de Google Meet de 5 a más de 70 idiomas y de un número muy reducido de combinaciones lingüísticas a más de 2000 transforma radicalmente la logística de las reuniones internacionales. Esto elimina fricciones operativas que antes obligaban a contratar intérpretes o a limitar los mercados objetivo en las comunicaciones en directo, abriendo oportunidades para campañas y eventos globales sin barreras idiomáticas.

La disponibilidad del modelo a través de la Gemini Live API implica que los equipos de desarrollo pueden integrar traducción de voz en tiempo real en aplicaciones propias con un esfuerzo de infraestructura reducido, gracias a los socios de plataforma que ya han adaptado sus herramientas a esta API. Esto democratiza el acceso a capacidades que hasta ahora requerían inversiones importantes en tecnología especializada, y acorta notablemente el tiempo de llegada al mercado para productos con funcionalidades multilingües.

La introducción del modo de escucha en Android, que permite recibir la traducción directamente a través del auricular del teléfono sin necesidad de auriculares externos, responde a un caso de uso cotidiano de alto valor: entender en tiempo real una conversación o una visita guiada en otro idioma de manera discreta. Este tipo de experiencia, pensada para el usuario final, tiene el potencial de incrementar significativamente la frecuencia de uso de la aplicación Google Translate y de generar nuevos patrones de comportamiento en la búsqueda de información en entornos físicos.

La incorporación de SynthID como marca de agua en el audio generado es un elemento relevante desde el punto de vista de la responsabilidad y la confianza digital. En un contexto en el que el contenido sintético puede utilizarse para difundir desinformación, contar con una capa de trazabilidad imperceptible para el oyente pero detectable por sistemas automatizados aporta un nivel de garantía que puede influir positivamente en la adopción institucional y empresarial de la tecnología.

Qué hacer

  • Evaluar de forma inmediata la integración de la Gemini Live API en los flujos de trabajo de comunicación internacional de la agencia, especialmente para reuniones con clientes o mercados en idiomas distintos al inglés, aprovechando la disponibilidad en acceso público desde hoy mismo.
  • Revisar la estrategia de SEO internacional a la luz de la expansión de herramientas de traducción de voz en tiempo real: anticipar un posible aumento del consumo de contenido en idiomas locales y ajustar la arquitectura del sitio y los hreflang en consecuencia.
  • Solicitar acceso a la versión privada de Google Meet con Gemini 3.5 Live Translate para clientes empresariales de Google Workspace, con el objetivo de probar la tecnología en contextos reales antes de la disponibilidad general y posicionarse como early adopter ante clientes internacionales.
  • Explorar los casos de uso de la API en la creación de experiencias de contenido de audio multilingüe, como podcasts doblados en tiempo real o transmisiones en directo con traducción simultánea, para ampliar el alcance de campañas de branded content a nuevas audiencias sin incrementar proporcionalmente los costes de producción.
  • Comunicar a los clientes las implicaciones de SynthID en términos de trazabilidad del contenido de audio generado por IA, especialmente en sectores sensibles como el legal, el financiero o el educativo, donde la autenticidad y la verificabilidad del origen de los contenidos son factores de cumplimiento normativo.
  • Monitorizar los resultados de casos de uso reales como el de Grab, donde la traducción de voz se aplica a más de 10 millones de llamadas mensuales, para extraer aprendizajes sobre tasas de adopción, satisfacción de usuario y modelos de negocio replicables en otros sectores de servicios con alta frecuencia de interacción vocal.
Impacto

La irrupción de la traducción de voz en tiempo real en herramientas ampliamente utilizadas como Google Meet y Google Translate puede modificar los comportamientos de búsqueda y la demanda de contenido multilingüe, obligando a las marcas a replantearse su estrategia de SEO internacional y la optimización de contenido vocal para audiencias en múltiples idiomas.

Fuente oficial
No te pierdas ninguna novedad

Novedades de producto, actualizaciones de algoritmos y buenas prácticas, directamente en tu correo.

Volver al seguimiento

Mantente un paso por delante de los algoritmos

Pulsar sigue tus posiciones en Google, tu visibilidad en las IA y tus redes sociales en un único dashboard. 14 días de prueba, sin tarjeta bancaria.

Empezar una prueba gratuita