
Varias compañías, como Kintrans ou Signall, tentaron nos últimos anos desenvolver software capaz de interpretar a linguaxe de signos, permitindo así aos seus usuarios comunicarse facilmente con calquera persoa. Pero o certo é que non tiveron gran éxito ata agora.
Con todo, un novo algoritmo desenvolvido polos Google AI Labs, podería ser a clave para materializar ao fin un sistema usable de tradución simultánea entre persoas xordas e oíntes. E bastaría, para iso, con usar un smartphone.
Este novo algoritmo é capaz de seguir o movemento das mans do usuario unha vez que tivo a ocasión de mapealas enfoncándoas coa cámara do seu móbil. "A nosa solución utiliza aprendizaxe automática [3] para calcular os 21 puntos clave en 3D dunha man dentro dun fotograma de vídeo".
Pero este aspecto do algoritmo non foi fácil de desenvolver: os diferentes tamaños de cada man, a velocidade dos seus movementos e o feito de que, durante a conversación, uns dedos poidan obstruir a visión doutros... todos estes aspectos constituíron interesantes retos para os investigadores.
Para reducir os requirimentos de hardware do algoritmo, apostaron por reducir a cantidade de datos que o algoritmo necesitaba analizar, para que así o tempo de resposta fose menor. Así, abandonaron a idea de detectar a posición e o tamaño de toda a man como conxunto, e empezaron por detectar a palma (a parte máis distintiva e regular da mesma).
A continuación, o sistema detecta os cinco elementos que brotan da mesma (os dedos). Para lograr todo isto, fixeron que a IA analizase 30.000 imaxes (cada unha con diferentes poses e condicións de iluminación) e aprendese de todas elas, aínda que iso requiriu que un equipo de humanos etiquetase manualmente os 21 puntos clave en cada unha desas imaxes.
Agora, é capaz de recoñecer o tamaño e ángulos das palmas das mans,** asignándolles coordenadas en base á posición estimada dos dedos e cotobelos**. O algoritmo tamén permite calcular a profundidade dos elementos da imaxe.
No seu blogue corporativo, os investigadores de Google AI Labs explican que a novidade da súa proposta reside en que rompe co enfoque ata agora vixente, baseado en potentes contornas de escritorio, logrando un rendemento en tempo real a pesar de funcionar en teléfonos móbiles.
Desde Google afirman que seguirán traballando en mellorar a súa precisión e anuncian a dispoñibilidade do código fonte [4] do algoritmo para outros investigadores que queiran consultalo.
Ligazóns:
[1] https://voluntariadodixital.xunta.gal/sites/default/files/images/novas/img_nova_10158.png
[2] https://voluntariadodixital.xunta.gal/javascript:history.back()
[3] https://www.xataka.com/robotica-e-ia/machine-learning-y-deep-learning-como-entender-las-claves-del-presente-y-futuro-de-la-inteligencia-artificial
[4] https://github.com/google/mediapipe/blob/master/mediapipe/docs/hand_tracking_mobile_gpu.md