Reconnaissance Automatique des Langues des Signes : Une Approche Hybridée CNN-LSTM Basée sur Mediapipe
Fraisse Sacré Takouchouang, Ho Tuong Vinh
TL;DR
Ce papier aborde la reconnaissance automatique des langues des signes en proposant une approche hybride CNN-LSTM qui exploite Mediapipe pour l’extraction de points clés et modélise les gestes sur des séquences temporelles. Le pipeline end-to-end inclut normalisation $$(x',y',z') = \frac{(x - x_{ref}, y - y_{ref}, z - z_{ref})}{d_{norm}}$$ et lissage via $\hat{x}_t = A \hat{x}_{t-1} + K_t(z_t - H A \hat{x}_{t-1})$, complété par des augmentations de données et une interface Streamlit pour la démonstration en temps réel. Le modèle atteint $92\%$ de précision avec un F1-score de $90.5\%$ sur le jeu de test et se distingue par une inférence rapide (~$45$ ms) par rapport à certaines approches basées sur les Transformers, tout en présentant des confusions pour des gestes visuellement proches. Les résultats suggèrent un fort potentiel d’applications en santé, éducation et services publics grâce à une solution non invasive et accessible, avec des perspectives d’extension du vocabulaire et d’amélioration de la robustesse dans des environnements variés.
Abstract
Sign languages play a crucial role in the communication of deaf communities, but they are often marginalized, limiting access to essential services such as healthcare and education. This study proposes an automatic sign language recognition system based on a hybrid CNN-LSTM architecture, using Mediapipe for gesture keypoint extraction. Developed with Python, TensorFlow and Streamlit, the system provides real-time gesture translation. The results show an average accuracy of 92\%, with very good performance for distinct gestures such as ``Hello'' and ``Thank you''. However, some confusions remain for visually similar gestures, such as ``Call'' and ``Yes''. This work opens up interesting perspectives for applications in various fields such as healthcare, education and public services.
