Présentation
En anglaisRÉSUMÉ
Des progrès importants ont été faits au cours des dernières années en ce qui concerne les taux de reconnaissance de la parole (proches de ceux d’un être humain), mais le niveau de compréhension demeure très faible. Les systèmes sont fondés sur une modélisation statistique de la langue parlée : modèles acoustiques de Markov cachés (Hidden Markov Models, HMM) et modèles n-grammes mémorisant les probabilités conditionnelles de séquences d’unités linguistiques. Les progrès récents proviennent du couplage de ces modèles statistiques à des modèles neuronaux profonds, comportant un grand nombre de couches cachées, entraînés à l’aide d’énorme quantité de données. Les applications concernent la dictée vocale, la transcription de médias (radio, télévision) et surtout la télématique vocale (assistants vocaux).
Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.
Lire l’articleABSTRACT
Important progresses have been made recently in terms of recognition rate (close to those of a human), but the level of understanding of present systems remains very low. Such systems are based on a statistical modeling of speech: Hidden Markov Models (HMM) for acoustics, and n-grams models storing the conditional probabilities of sequences of linguistic units. Recent progress has been obtained by coupling classical HMM with deep neural networks that are made up of a large number of hidden layers and trained by deep learning algorithms using enormous amounts of training data. Applications concern mainly text dictation, transcription of media (radio, television) and mainly vocal telematics.
Auteur(s)
-
Jean-Paul HATON : Professeur à l’Université de Lorraine, LORIA/INRIA – Membre de l’Institut universitaire de France
INTRODUCTION
L’utilisation de la parole comme mode de communication entre un homme et une machine a été largement étudiée au cours des dernières décennies. Nous nous intéressons dans cet article à la reconnaissance automatique de la parole (RAP), c’est-à-dire à l’ensemble des techniques permettant de communiquer oralement avec une machine. La RAP présente un intérêt pratique indéniable, dans certaines conditions d’utilisation (accès à distance, charge de travail importante, handicapés, etc.). Des produits commerciaux existent depuis plus de trente ans, d’abord essentiellement pour la reconnaissance de mots isolés et enchaînés puis maintenant pour des phrases prononcées continûment. La plupart sont fondés sur des algorithmes de programmation dynamique et des modèles stochastiques (sources de Markov). Néanmoins, des problèmes restent à résoudre pour accroître la robustesse de ces systèmes et étendre leurs capacités de dialogue. Les recherches menées actuellement portent ainsi sur la reconnaissance de parole bruitée, le traitement d’énoncés incomplets ou incorrects, la définition de procédures de dialogue, etc.
KEYWORDS
Hidden Markov Models (HMM) | deep neural networks | deep learning
VERSIONS
- Version archivée 1 de août 1998 par Jean-Paul HATON
- Version archivée 2 de nov. 2012 par Jean-Paul HATON
DOI (Digital Object Identifier)
CET ARTICLE SE TROUVE ÉGALEMENT DANS :
Accueil > Ressources documentaires > Technologies de l'information > Technologies logicielles Architectures des systèmes > Intelligence artificielle > Reconnaissance automatique de la parole > Caractéristiques de la communication parlée homme-machine
Cet article fait partie de l’offre
Documents numériques Gestion de contenu
(76 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive
Présentation
1. Caractéristiques de la communication parlée homme-machine
Le traitement automatique de la parole recouvre un vaste ensemble d’activités, souvent complémentaires, que l’on peut classer en cinq grands thèmes :
-
codage et compression de la parole, intervenant en transmission et en restitution de parole ;
-
synthèse de la parole, consistant à produire un signal vocal à partir d’un dictionnaire d’éléments phonétiques et/ou de règles ;
-
reconnaissance de la parole, revenant à faire interpréter par une machine des mots ou des phrases prononcés par un locuteur humain, dans le but de réaliser une action précise ;
-
reconnaissance et vérification du locuteur, problème dual du précédent dans lequel on cherche à authentifier une personne par sa voix ;
-
identification de la langue dans laquelle un locuteur s’exprime.
Dans tous ces domaines, des progrès importants ont été réalisés au cours des dernières années et de nombreuses applications industrielles existent. Nous nous intéressons au problème de la reconnaissance automatique de la parole (RAP). Ce problème est très difficile et complexe, en particulier du fait des caractéristiques du signal de parole.
-
Continuité
Lorsque l’on écoute parler une langue connue, on perçoit une suite de mots, alors que l’analyse du signal vocal ne permet de déceler aucune marque de séparation entre mots successifs. La parole est un semi-continuum ponctué de pauses correspondant à certains types de sons ou de respiration. Le problème de la segmentation en mots est ainsi très délicat. Il se pose à nouveau à l’intérieur d’un mot : un mot est perçu comme une suite de sons élémentaires, ou phonèmes, qu’une fois encore l’analyse du signal acoustique ne permet pas d’isoler nettement.
Le phonème est une unité linguistique permettant de décrire une langue (le français ou l’anglais peuvent être décrits à l’aide d’une trentaine de phonèmes, pas forcément les mêmes). Pour les besoins du traitement automatique, on considère en général un phonème comme étant caractérisé par la simultanéité, dans le temps, d’un ensemble de caractéristiques acoustico-phonétiques.
-
Variabilité...
Cet article fait partie de l’offre
Documents numériques Gestion de contenu
(76 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive
Caractéristiques de la communication parlée homme-machine
BIBLIOGRAPHIE
-
(1) - RABINER (L.), HUANG (B.H.) - Fundamentals of speech recognition. – - Prentice-Hall, Englewood Cliffs (1993).
-
(2) - JUNQUA (J.-C.), HATON (J.-P.) - Robustness in automatic speech recognition. – - Kluwer Academic, Dordrecht (1996).
-
(3) - BOITE (R.), BOURLARD (H.), DUTOIT (T.), HANCQ (J.), LEICH (H.) - Traitement de la parole. – - Presses polytechniques et universitaires romandes, Lausanne (2000).
-
(4) - MINKER (W.), BENNACEF (S.) - Reconnaissance vocale et dialogue homme-machine. – - Eyrolles, Paris (2000).
-
(5) - MARIANI (J.) (éd.) - Reconnaissance de la parole : traitement automatique du langage parlé. – - Hermes – Science – Lavoisier, Paris (2002).
-
(6) - COHEN (M.), GIANGOLA (J.), BALOGH (J.) - Voice...
HTK (HMM ToolKit) : logiciel libre destiné au développement d’applications complètes de reconnaissance de la parole fondées sur MMC http://www.htk.eng.cam.ac.uk/
VISPER (Visual speech processing system) : logiciel libre permettant de visualiser les étapes de reconnaissance par programmation dynamique et par MMC développé par l’Université Technique de Liberec, Tchéquie https://www.ite.tul.cz/speechlabe/index.php/old-projects/visper.html
SNOORI : logiciel libre d’analyse, de visualisation et d’étiquetage de la parole développé au LORIA par Yves Laprie pour les recherches en phonétique, perception et traitement automatique de la parole
Bases de données de parole étiquetée disponibles pour de nombreuses langues par l’intermédiaire des organismes :
LDC, Linguistic Data Consortium http://www.ldc.upenn.edu/
ELRA, European Language Resources Association http://www.elra.info/
Dragon Naturally Speaking de Nuance http://www.nuance.fr/Dragon12
HAUT DE PAGEConstructeurs – Fournisseurs – Distributeurs (liste non exhaustive)
Sociétés...
Cet article fait partie de l’offre
Documents numériques Gestion de contenu
(76 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive