SL2T: el modelo de Google DeepMind que traduce lengua de signos a texto y llega a Gboard y Live Transcribe

SL2T: el modelo de Google DeepMind que traduce lengua de signos a texto y llega a Gboard y Live Transcribe

Brain Code |

Google DeepMind ha presentado SL2T (sign-language-to-text), un modelo de traducción de lengua de signos a texto diseñado para llevar esta tecnología desde el ámbito de la investigación hasta productos de uso cotidiano. El sistema ya impulsa nuevas funciones de dictado en Gboard y Live Transcribe en Pixel 11, inicialmente para traducir lengua de signos americana (ASL) al inglés.

El modelo aborda un problema distinto al reconocimiento automático del habla. Las lenguas de signos son lenguas naturales independientes, con gramáticas y vocabularios propios, y transmiten significado mediante movimientos simultáneos de manos, brazos, torso, cabeza y rostro. Por eso, su procesamiento requiere combinar visión por computador con traducción automática.

De la lengua de signos al texto en aplicaciones cotidianas

SL2T permite que una persona pueda hacer signos frente a su teléfono en situaciones en las que normalmente tendría que escribir.

Según Google DeepMind, esta capacidad puede utilizarse para:

  • realizar búsquedas en la web;
  • redactar mensajes o documentos;
  • plantear consultas a Gemini o pedirle que ejecute tareas;
  • responder mediante lengua de signos durante una conversación en Live Transcribe.

Los participantes en las pruebas realizadas por Google indicaron que comunicarse mediante ASL les resultaba más rápido, natural y agradable que escribir en inglés.

La primera implementación está disponible en Gboard y Live Transcribe en Pixel 11, con ASL como lengua de entrada e inglés como salida. Google DeepMind señala que prevé ampliar posteriormente la disponibilidad a más dispositivos y lenguas.

Por qué traducir una lengua de signos no equivale a transcribir voz

Uno de los puntos centrales del proyecto es que una lengua de signos no puede tratarse simplemente como una secuencia de palabras expresadas con las manos.

Google DeepMind distingue dos dificultades principales frente a la transcripción del habla.

La primera es lingüística. En la transcripción de voz se transforma una señal sonora en texto dentro del mismo idioma. Las lenguas de signos, en cambio, tienen sus propias gramáticas y léxicos. El proceso requiere, por tanto, una auténtica traducción entre lenguas y no una simple conversión secuencial de signos en palabras.

La segunda dificultad es visual. El significado puede construirse simultáneamente mediante movimientos de distintas partes del cuerpo. Identificar esos movimientos con suficiente precisión y a una alta frecuencia de fotogramas supone una tarea exigente desde el punto de vista de la visión por computador y del procesamiento.

Esta complejidad también explica las limitaciones de aproximaciones anteriores, como los guantes para interpretar lengua de signos. El modelo SL2T busca abordar conjuntamente la percepción detallada del movimiento corporal y la traducción lingüística.

Cómo funciona SL2T

Google DeepMind ha desarrollado SL2T combinando un enfoque centrado en el usuario y culturalmente informado con un fuerte escalado de los datos de entrenamiento.

El modelo se ha entrenado con más de 100.000 horas de datos correspondientes a más de 50 lenguas de signos. Aproximadamente una cuarta parte de esos datos pertenece a ASL.

Según los experimentos de Google DeepMind, entrenar conjuntamente el sistema con distintas lenguas, dialectos y niveles de dominio permite al modelo aprender estructuras compartidas y superar a modelos entrenados para una única lengua.

El vídeo original no se envía al servidor

La arquitectura de SL2T también incorpora una decisión específica relacionada con la privacidad.

En lugar de enviar al servidor la señal de vídeo original, un modelo ejecutado en el propio dispositivo, MediaPipe Holistic, identifica distintos puntos de la persona que está realizando los signos.

El proceso funciona de esta forma:

  1. El dispositivo detecta posiciones o puntos corporales del usuario.
  2. Esas posiciones se convierten en coordenadas geométricas.
  3. Solo las coordenadas se envían al servidor para realizar la traducción.
  4. El vídeo original puede descartarse inmediatamente.

De esta forma, SL2T procesa la lengua de signos como una secuencia de posiciones corporales en lugar de utilizar directamente la grabación de la cámara.

Traducción directa de movimientos a texto

SL2T traduce la secuencia de coordenadas directamente a texto.

El sistema evita una representación intermedia conocida como glosses, utilizada ampliamente en trabajos anteriores sobre traducción de lenguas de signos. Según Google DeepMind, estas representaciones no capturan adecuadamente determinados aspectos ricos y no lineales de estas lenguas, como los marcadores no manuales o las construcciones espaciales.

La traducción directa desde los puntos corporales elimina además los límites artificiales de vocabulario asociados a ese paso intermedio y permite que la calidad de la traducción pueda escalar directamente con los datos.

Resultados de SL2T en FLEURS-ASL

Google DeepMind presenta SL2T como su modelo más capaz hasta la fecha para traducción de lengua de signos según benchmarks como FLEURS-ASL, utilizado para evaluar la traducción de ASL a inglés.

En la prueba sd-test, SL2T alcanza una puntuación zero-shot de 70 BLEURT, superior a las puntuaciones previamente publicadas según la información presentada por Google DeepMind.

Los ejemplos incluidos en el artículo muestran traducciones capaces de convertir expresiones complejas de ASL en texto fluido en inglés. El propio equipo también señala que continúan existiendo errores ocasionales relacionados con:

  • signos poco frecuentes;
  • deletreo manual rápido;
  • construcciones pasivas;
  • determinadas representaciones mediante clasificadores;
  • interpretación del tiempo verbal cuando falta contexto.

Del benchmark al uso real

El equipo señala que obtener buenos resultados en pruebas académicas no garantiza por sí solo que el sistema funcione adecuadamente en situaciones reales.

Por ese motivo, el desarrollo de SL2T también ha trabajado sobre aspectos prácticos como la reducción de la latencia durante la traducción continua, la prevención de alucinaciones cuando la entrada no contiene lengua de signos y el funcionamiento con distintas formas de realizar los signos.

Entre las situaciones consideradas se encuentran específicamente las personas zurdas —que, según el artículo, representan el 10 % de los usuarios de lengua de signos analizados— y el uso de una sola mano cuando la otra está ocupada sosteniendo un teléfono.

Un desarrollo realizado con participación de la comunidad sorda

Google DeepMind destaca que las perspectivas de personas sordas han formado parte de las distintas etapas del proyecto.

El artículo menciona su participación desde la conceptualización inicial, impulsada por Sam Sepah, empleado sordo de Google, hasta la recopilación de datos con colaboradores sordos, los estudios con usuarios y la evaluación del impacto de la tecnología con expertos sordos.

El proyecto también ha creado el AI Sign Language Advisory Committee (AISLAC), que reúne a organizaciones globales de personas sordas y especialistas. El objetivo de este modelo de gobernanza participativa es que las comunidades afectadas por la tecnología puedan influir directamente en las prioridades de desarrollo.

Además, Google DeepMind señala que se ha elaborado conjuntamente un informe de impacto para el lanzamiento de SL2T 1.0 en Gboard y Live Transcribe, en el que se detallan las capacidades actuales de la tecnología y sus limitaciones.

El siguiente paso: ampliar lenguas y capacidades

La llegada de la entrada mediante ASL a los teléfonos representa, según Google DeepMind, solo el comienzo del proyecto.

El equipo trabaja en ampliar la tecnología hacia más lenguas de signos, generación de lengua de signos y nuevas capacidades de IA. Su objetivo declarado es avanzar hacia una mayor paridad de acceso entre las lenguas de signos y las modalidades habladas y escritas.

SL2T puede utilizarse inicialmente en Gboard y Live Transcribe en Pixel 11 sin coste adicional, y Google DeepMind indica que posteriormente llegará a más dispositivos.

Leave a comment