Google lleva la traducción de lengua de señas en tiempo real al Pixel 11 con una nueva IA de DeepMind
El Pixel 11 estrena SL2T, un modelo de Google DeepMind capaz de convertir la lengua de señas americana en texto en inglés desde Gboard y Live Transcribe. La tecnología permite escribir mensajes, buscar en Internet o interactuar con Gemini utilizando señas frente a la cámara
Google ha convertido la accesibilidad en una de las novedades más importantes de su nueva generación Pixel 11.La compañía ha presentado una tecnología de inteligencia artificial capaz de interpretar lengua de señas en tiempo real y convertirla directamente en texto, permitiendo que una persona pueda comunicarse con el teléfono mediante señas en situaciones donde normalmente tendría que utilizar el teclado.
La tecnología está impulsada por SL2T —Sign Language to Text—, un nuevo modelo desarrollado conjuntamente por los equipos de Google DeepMind y Android. Su primera implementación permite traducir lengua de señas americana (ASL) a texto en inglés y está integrada inicialmente en Gboard y Live Transcribe.
El objetivo va mucho más allá de ofrecer un traductor independiente. Google quiere que las señas puedan convertirse en un método de entrada comparable a escribir con el teclado o utilizar el dictado por voz, permitiendo emplearlas directamente en aplicaciones y servicios cotidianos.
Las señas se convierten en una nueva forma de escribir en Android
La integración con Gboard es una de las partes más importantes de la tecnología.
Una persona sorda puede situarse frente a la cámara del Pixel 11, realizar señas y hacer que SL2T las convierta automáticamente en texto.
Esto permite utilizar ASL para tareas como:
- Escribir mensajes.
- Realizar búsquedas en Internet.
- Redactar documentos.
- Introducir texto en aplicaciones.
- Hacer preguntas a Gemini.
- Dar instrucciones a herramientas de inteligencia artificial.
La idea es similar al dictado por voz disponible desde hace años en los smartphones. Mientras una persona oyente puede hablar al teléfono en lugar de escribir, Google quiere que una persona que utiliza lengua de señas pueda hacer esencialmente lo mismo utilizando su forma natural de comunicación.
Según Google DeepMind, participantes en las pruebas señalaron que utilizar ASL podía resultar más rápido y natural que escribir en inglés.
Live Transcribe también permite responder utilizando señas
La segunda gran integración se encuentra en Live Transcribe, la herramienta de accesibilidad de Google diseñada para convertir conversaciones habladas en texto.
Hasta ahora, una persona podía utilizar Live Transcribe para leer lo que otra persona estaba diciendo y posteriormente escribir una respuesta.
SL2T modifica esa dinámica.
El usuario puede responder utilizando lengua de señas frente al Pixel 11 y hacer que el teléfono convierta sus movimientos en texto.
Esto permite una conversación más fluida entre una persona que utiliza lengua de señas y otra que no la conoce, reduciendo la necesidad de detener constantemente la interacción para escribir respuestas manualmente.
Traducir lengua de señas es mucho más complejo que transcribir una voz
El desafío tecnológico detrás de SL2T es considerable.
Una lengua de señas no consiste simplemente en sustituir palabras habladas por movimientos de las manos. Las lenguas de señas son lenguas naturales independientes, con su propia gramática, vocabulario y estructuras lingüísticas.
Google estima que existen más de 200 lenguas de señas en todo el mundo, utilizadas por alrededor de 70 millones de personas sordas o con dificultades auditivas.
El sistema debe interpretar simultáneamente numerosos elementos visuales.
No basta con reconocer las manos.
La comunicación puede depender también de:
- La posición de los brazos.
- El movimiento del torso.
- La orientación de las manos.
- La posición de la cabeza.
- Las expresiones faciales.
- El espacio utilizado alrededor del cuerpo.
Esto convierte el problema en algo fundamentalmente diferente al reconocimiento de voz convencional.
SL2T fue entrenado con más de 100.000 horas de datos
Para desarrollar el modelo, Google DeepMind utilizó más de 100.000 horas de datos correspondientes a más de 50 lenguas de señas.
Aproximadamente una cuarta parte del conjunto utilizado durante el entrenamiento corresponde a ASL.
El enfoque multilingüe resulta especialmente importante.
Google asegura que entrenar conjuntamente el sistema utilizando diferentes lenguas, dialectos y niveles de dominio permitió que SL2T aprendiera estructuras compartidas y generalizara mejor que modelos entrenados exclusivamente con una única lengua de señas.
Aunque el entrenamiento incluye decenas de lenguas, eso no significa que todas estén disponibles actualmente para los usuarios.
El lanzamiento comercial comienza únicamente con ASL a inglés. Google ya ha confirmado que pretende incorporar más lenguas posteriormente.
Google abandona las tradicionales “glosas”
Otra diferencia técnica importante está relacionada con la forma en que SL2T realiza la traducción.
Numerosos sistemas anteriores de traducción automática utilizaban un paso intermedio conocido como glosas.
Las glosas funcionan como etiquetas textuales asociadas a determinadas señas. El sistema identifica primero esas representaciones y posteriormente intenta convertirlas en una oración.
El problema es que una lengua de señas contiene información que no siempre puede representarse correctamente mediante una secuencia sencilla de etiquetas.
Expresiones faciales, construcciones espaciales y otros movimientos pueden modificar el significado.
SL2T intenta traducir directamente los movimientos del usuario a texto sin depender de esa representación intermedia.
Google sostiene que este enfoque elimina limitaciones artificiales de vocabulario y permite aprovechar mejor la información visual disponible.
El Pixel 11 no necesita enviar el vídeo completo a Google
La privacidad representa otro de los desafíos importantes de una tecnología que necesita mantener una cámara apuntando directamente hacia una persona.
Google ha diseñado SL2T para evitar enviar el vídeo original completo a sus servidores durante el proceso de traducción.
El Pixel utiliza primero un modelo ejecutado en el propio dispositivo basado en MediaPipe Holistic.
Esta tecnología identifica puntos de referencia sobre el cuerpo del usuario, convirtiendo sus movimientos en información geométrica.
En lugar de transmitir el vídeo original, el sistema envía las coordenadas correspondientes a esos puntos para que SL2T pueda realizar la traducción.
La grabación original puede descartarse inmediatamente.
De esta manera, el modelo encargado de traducir no necesita recibir directamente todos los píxeles capturados por la cámara.
La IA tiene que entender mucho más que las manos
El funcionamiento basado en puntos corporales también explica por qué Google necesita analizar diferentes partes del cuerpo.
Durante una conversación mediante señas, el significado puede depender simultáneamente de movimientos de manos, rostro, cabeza y cuerpo.
MediaPipe Holistic permite representar geométricamente estos elementos y proporcionar al modelo una secuencia de movimientos que posteriormente debe interpretar.
Esta arquitectura también reduce considerablemente la cantidad de información que necesita transmitirse en comparación con enviar continuamente vídeo de alta resolución.
El desafío consiste en conservar suficiente información para interpretar correctamente la lengua sin depender de la grabación original.
Google también ha trabajado en el uso con una sola mano
Un sistema de estas características necesita funcionar fuera de condiciones ideales.
Una persona puede estar sujetando el Pixel con una mano mientras realiza señas con la otra, algo que podría modificar considerablemente los movimientos observados por el modelo.
Google asegura haber trabajado específicamente para mejorar el comportamiento de SL2T cuando el usuario realiza señas con una sola mano.
También se ha prestado atención a las personas zurdas y a diferentes estilos de comunicación.
Otro problema importante consiste en saber cuándo alguien no está realizando señas.
Un modelo demasiado sensible podría interpretar movimientos normales como lenguaje y comenzar a generar texto incorrectamente. Por ello, Google ha trabajado para reducir las traducciones falsas cuando la cámara detecta a una persona que simplemente se está moviendo.
La comunidad sorda participó en el desarrollo
Google afirma que el proyecto no se desarrolló únicamente desde una perspectiva técnica.
Personas sordas y especialistas en lengua de señas participaron en diferentes etapas relacionadas con pruebas, recopilación de datos, evaluación del impacto y desarrollo del sistema.
La compañía también creó un AI Sign Language Advisory Committee, destinado a incorporar perspectivas de la comunidad al desarrollo de esta tecnología.
Este aspecto resulta especialmente relevante porque medir el rendimiento de un modelo mediante pruebas técnicas no garantiza necesariamente que funcione de manera adecuada durante conversaciones reales.
Factores como la velocidad al realizar las señas, los dialectos, el entorno, la iluminación o las diferencias entre usuarios pueden afectar considerablemente al comportamiento del sistema.
SL2T todavía tiene limitaciones
Google presenta SL2T como un avance importante, pero la tecnología todavía no puede considerarse un sustituto universal de intérpretes profesionales ni una solución perfecta para cualquier conversación.
La primera versión se concentra específicamente en ASL a inglés, por lo que su alcance inicial es limitado frente a la enorme diversidad lingüística existente.
También existen situaciones particularmente difíciles para los sistemas automáticos, como determinadas construcciones espaciales, movimientos muy rápidos, contextos ambiguos o expresiones cuyo significado depende de información anterior de la conversación.
El funcionamiento en condiciones reales será una de las pruebas más importantes para determinar hasta qué punto la tecnología puede convertirse en una herramienta cotidiana.
El Pixel 11 será el primero, pero no el único
La exclusividad inicial tampoco será permanente.
Google ha confirmado que SL2T llegará primero al Pixel 11, pero tiene previsto ampliar la tecnología a más dispositivos.
La compañía no ha detallado todavía qué teléfonos recibirán posteriormente la función ni cuáles serán sus requisitos de hardware.
Google también planea añadir más lenguas de señas, algo fundamental para que la herramienta tenga verdadero alcance internacional.
La compañía considera el lanzamiento de ASL a inglés como el comienzo de un proyecto considerablemente más amplio.
El siguiente desafío será que la IA también genere lengua de señas
El proyecto de Google no termina convirtiendo señas en texto.
DeepMind ya trabaja hacia una visión donde los sistemas puedan manejar las lenguas de señas con una capacidad comparable a la que actualmente ofrecen para idiomas hablados y escritos.
Eso incluye investigar tecnologías de generación de lengua de señas, además de sistemas de traducción más avanzados y nuevas capacidades basadas en inteligencia artificial.
A largo plazo, un sistema bidireccional podría no limitarse a comprender a una persona que utiliza señas, sino también convertir respuestas escritas o habladas en representaciones visuales comprensibles para usuarios de diferentes lenguas de señas.
Sin embargo, esa tecnología plantea desafíos técnicos y lingüísticos considerablemente mayores y Google todavía no ha anunciado un producto comercial de estas características.
Google convierte la accesibilidad en una de las funciones más importantes del Pixel 11
La industria del smartphone lleva años utilizando inteligencia artificial para mejorar fotografías, resumir mensajes, generar imágenes o proporcionar asistentes personales. SL2T demuestra que los mismos avances pueden aplicarse a problemas de accesibilidad con un impacto mucho más directo en la vida cotidiana.
Para una persona oyente, el dictado por voz representa simplemente una alternativa cómoda al teclado. Para una persona cuya forma natural de comunicación es una lengua de señas, disponer de una función equivalente puede cambiar significativamente la manera de interactuar con un dispositivo.
El Pixel 11 convierte por primera vez esta tecnología de Google DeepMind en una función disponible para consumidores, comenzando con ASL a inglés dentro de Gboard y Live Transcribe y sin coste adicional.
El verdadero alcance de SL2T dependerá ahora de su precisión durante conversaciones reales, de la rapidez con la que Google consiga llevarlo a otros dispositivos y, especialmente, de su expansión hacia más lenguas.