Table of Contents
Fetching ...

Reconnaissance Automatique des Langues des Signes : Une Approche Hybridée CNN-LSTM Basée sur Mediapipe

Fraisse Sacré Takouchouang, Ho Tuong Vinh

TL;DR

Ce papier aborde la reconnaissance automatique des langues des signes en proposant une approche hybride CNN-LSTM qui exploite Mediapipe pour l’extraction de points clés et modélise les gestes sur des séquences temporelles. Le pipeline end-to-end inclut normalisation $$(x',y',z') = \frac{(x - x_{ref}, y - y_{ref}, z - z_{ref})}{d_{norm}}$$ et lissage via $\hat{x}_t = A \hat{x}_{t-1} + K_t(z_t - H A \hat{x}_{t-1})$, complété par des augmentations de données et une interface Streamlit pour la démonstration en temps réel. Le modèle atteint $92\%$ de précision avec un F1-score de $90.5\%$ sur le jeu de test et se distingue par une inférence rapide (~$45$ ms) par rapport à certaines approches basées sur les Transformers, tout en présentant des confusions pour des gestes visuellement proches. Les résultats suggèrent un fort potentiel d’applications en santé, éducation et services publics grâce à une solution non invasive et accessible, avec des perspectives d’extension du vocabulaire et d’amélioration de la robustesse dans des environnements variés.

Abstract

Sign languages play a crucial role in the communication of deaf communities, but they are often marginalized, limiting access to essential services such as healthcare and education. This study proposes an automatic sign language recognition system based on a hybrid CNN-LSTM architecture, using Mediapipe for gesture keypoint extraction. Developed with Python, TensorFlow and Streamlit, the system provides real-time gesture translation. The results show an average accuracy of 92\%, with very good performance for distinct gestures such as ``Hello'' and ``Thank you''. However, some confusions remain for visually similar gestures, such as ``Call'' and ``Yes''. This work opens up interesting perspectives for applications in various fields such as healthcare, education and public services.

Reconnaissance Automatique des Langues des Signes : Une Approche Hybridée CNN-LSTM Basée sur Mediapipe

TL;DR

Ce papier aborde la reconnaissance automatique des langues des signes en proposant une approche hybride CNN-LSTM qui exploite Mediapipe pour l’extraction de points clés et modélise les gestes sur des séquences temporelles. Le pipeline end-to-end inclut normalisation et lissage via , complété par des augmentations de données et une interface Streamlit pour la démonstration en temps réel. Le modèle atteint de précision avec un F1-score de sur le jeu de test et se distingue par une inférence rapide (~ ms) par rapport à certaines approches basées sur les Transformers, tout en présentant des confusions pour des gestes visuellement proches. Les résultats suggèrent un fort potentiel d’applications en santé, éducation et services publics grâce à une solution non invasive et accessible, avec des perspectives d’extension du vocabulaire et d’amélioration de la robustesse dans des environnements variés.

Abstract

Sign languages play a crucial role in the communication of deaf communities, but they are often marginalized, limiting access to essential services such as healthcare and education. This study proposes an automatic sign language recognition system based on a hybrid CNN-LSTM architecture, using Mediapipe for gesture keypoint extraction. Developed with Python, TensorFlow and Streamlit, the system provides real-time gesture translation. The results show an average accuracy of 92\%, with very good performance for distinct gestures such as ``Hello'' and ``Thank you''. However, some confusions remain for visually similar gestures, such as ``Call'' and ``Yes''. This work opens up interesting perspectives for applications in various fields such as healthcare, education and public services.
Paper Structure (25 sections, 2 equations, 3 figures, 3 tables)

This paper contains 25 sections, 2 equations, 3 figures, 3 tables.

Figures (3)

  • Figure 1: Architecture de notre système de reconnaissance des langues des signes combinant CNN et LSTM avec extraction de points clés via Mediapipe.
  • Figure 2: Matrice de confusion pour la reconnaissance des gestes de la langue des signes. Les valeurs sur la diagonale indiquent les classifications correctes, tandis que les valeurs hors diagonale représentent les confusions entre différents gestes.
  • Figure 3: Courbes de perte et de précision durant l'entraînement. La convergence des courbes d'entraînement et de validation indique un bon équilibre entre ajustement et généralisation.