2.1 - Historique
2.2 - Applications
2.3 - Mise en œuvre et évaluation d’un système

3.1 - Méthodes générales
3.2 - Méthodes avec modélisation
3.3 - Tendances actuelles

Figure 6 - Ondelette de Morlet

4.1 - Principe général
4.2 - Normalisation temporelle
4.3 - Modélisation stochastique
4.4 - Modèles neuromimétiques

5 - RECONNAISSANCE ET COMPRÉHENSION DE LA PAROLE CONTINUE

5.1 - Position du problème
5.2 - Approche bayésienne
5.3 - Architecture d’un système de reconnaissance de parole continue
5.4 - Reconnaissance des émotions
5.5 - Compréhension de la parole et systèmes de dialogue

6 - MÉTHODES ROBUSTES POUR LA RECONNAISSANCE

6.1 - Position du problème
6.2 - Méthodes de prétraitement du signal
6.3 - Adaptation de systèmes
6.4 - Méthodes de paramétrisation robustes

7 - RÉSEAUX NEURONAUX PROFONDS

8 - PERSPECTIVES ET CONCLUSION

Bibliographie & annexes

Article de référence | Réf : H3728 v3

Méthodes robustes pour la reconnaissance
Reconnaissance automatique de la parole

Auteur(s) : Jean-Paul HATON

Date de publication : 10 oct. 2018 | Read in English

Pour explorer cet article
Télécharger l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

Présentation

RÉSUMÉ

Des progrès importants ont été faits ces dernières années concernant les taux de reconnaissance de la parole (proches de ceux d’un être humain), mais le niveau de compréhension demeure très faible. Les systèmes sont fondés sur une modélisation statistique de la langue parlée: modèles acoustiques de Markov cachés (Hidden Markov Models, HMM) et modèles n-grammes mémorisant les probabilités conditionnelles de séquences d’unités linguistiques. Les progrès récents proviennent du couplage de ces modèles statistiques à des modèles neuronaux profonds, comportant un grand nombre de couches cachées, entraînés à l’aide d’énorme quantité de données. Les applications concernent la dictée vocale, la transcription de médias (radio, télévision) et surtout la télématique vocale (assistants vocaux).

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l’article

Auteur(s)

Jean-Paul HATON : Professeur à l’Université de Lorraine, LORIA/INRIA – Membre de l’Institut universitaire de France

INTRODUCTION

L’utilisation de la parole comme mode de communication entre un homme et une machine a été largement étudiée au cours des dernières décennies. Nous nous intéressons dans cet article à la reconnaissance automatique de la parole (RAP), c’est-à-dire à l’ensemble des techniques permettant de communiquer oralement avec une machine. La RAP présente un intérêt pratique indéniable, dans certaines conditions d’utilisation (accès à distance, charge de travail importante, handicapés, etc.). Des produits commerciaux existent depuis plus de trente ans, d’abord essentiellement pour la reconnaissance de mots isolés et enchaînés puis maintenant pour des phrases prononcées continûment. La plupart sont fondés sur des algorithmes de programmation dynamique et des modèles stochastiques (sources de Markov). Néanmoins, des problèmes restent à résoudre pour accroître la robustesse de ces systèmes et étendre leurs capacités de dialogue. Les recherches menées actuellement portent ainsi sur la reconnaissance de parole bruitée, le traitement d’énoncés incomplets ou incorrects, la définition de procédures de dialogue, etc.

Cet article est réservé aux abonnés.
Il vous reste 95% à découvrir.

Pour explorer cet article
Téléchargez l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

L'expertise technique et scientifique de référence

La plus importante ressource documentaire technique et scientifique en langue française, avec + de 1 200 auteurs et 100 conseillers scientifiques.

+ de 10 000 articles et 1 000 fiches pratiques opérationnelles, + de 800 articles nouveaux ou mis à jours chaque année.

De la conception au prototypage, jusqu'à l'industrialisation, la référence pour sécuriser le développement de vos projets industriels.

MOTS-CLÉS

modèles de Markov cachés (HMM) réseaux neuronaux profonds apprentissage profond

VERSIONS

Il existe d'autres versions de cet article :

Version archivée 1 de août 1998 par Jean-Paul HATON
Version archivée 2 de nov. 2012 par Jean-Paul HATON

DOI (Digital Object Identifier)

https://doi.org/10.51257/a-v3-h3728

CET ARTICLE SE TROUVE ÉGALEMENT DANS :

Accueil > Ressources documentaires > Technologies de l'information > Technologies logicielles Architectures des systèmes > Intelligence artificielle : concepts et méthodes d'apprentissage > Reconnaissance automatique de la parole > Méthodes robustes pour la reconnaissance

Cet article fait partie de l’offre

Documents numériques Gestion de contenu

(68 articles en ce moment)

Cette offre vous donne accès à :

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques

Des services

Un ensemble d'outils exclusifs en complément des ressources

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses

Doc & Quiz

Des articles interactifs avec des quiz, pour une lecture constructive

ABONNEZ-VOUS

Lecture en cours
Présentation

Page
suivante

Réseaux neuronaux profonds

6. Méthodes robustes pour la reconnaissance

6.1 Position du problème

Les performances des systèmes de reconnaissance actuellement disponibles sont bonnes dans des conditions d’utilisation bien contrôlées. Ces performances sont fortement dépendantes de la complexité et de la difficulté de la tâche envisagée. Ainsi, en moyenne, les taux d’erreur mesurés en laboratoire, en mode indépendant du locuteur, peuvent aller de 0,3 % (pour des suites de chiffres) à 5 % (pour un vocabulaire de 20 000 mots en parole continue), puis à 8 % (pour des lettres épelées), et jusqu’à 55 % pour des conversations téléphoniques spontanées !

Par ailleurs, le taux d’erreur s’accroît de façon spectaculaire lorsque les conditions d’apprentissage et d’utilisation d’un système sont différentes (notamment en ce qui concerne le type et le niveau de bruit).

À titre d’exemple, la figure 15 donne le taux de reconnaissance en parole continue en fonction du rapport signal/bruit (RSB) (avec un bruit blanc gaussien ajouté au signal) d’un système entraîné au préalable avec de la parole non bruitée. Les performances passent de 97 % de reconnaissance en parole très peu bruitée (RSB = 36 dB) à 3 % en milieu très bruité (RSB = 0 dB).

Les systèmes actuels sont donc dans l’ensemble très peu robustes aux variations même si celles-ci peuvent paraître assez faibles à l’oreille. Les sources de variabilité de la parole peuvent être classées en trois catégories, selon leur provenance :

l’environnement du locuteur avec le bruit corrélé à la parole (réverbération, réflexion) ou additif (bruit ambiant, etc.) ;
le locuteur lui-même, selon son état et son mode d’expression : essoufflement, stress, effet Lombard (qui amène un locuteur à modifier sa voix lorsqu’il est placé dans une ambiance très bruitée), rythme d’élocution, fatigue, etc. ;
les conditions d’enregistrement liées au type de microphone, distance au microphone, canal de transmission (distorsion, écho, bruit électronique, etc.).

De nombreuses techniques ont été proposées pour augmenter la robustesse des systèmes, notamment en ce qui concerne leur résistance...

Cet article est réservé aux abonnés.
Il vous reste 92% à découvrir.

Pour explorer cet article
Téléchargez l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

L'expertise technique et scientifique de référence

La plus importante ressource documentaire technique et scientifique en langue française, avec + de 1 200 auteurs et 100 conseillers scientifiques.

+ de 10 000 articles et 1 000 fiches pratiques opérationnelles, + de 800 articles nouveaux ou mis à jours chaque année.

De la conception au prototypage, jusqu'à l'industrialisation, la référence pour sécuriser le développement de vos projets industriels.

Cet article fait partie de l’offre

Documents numériques Gestion de contenu

(68 articles en ce moment)

Cette offre vous donne accès à :

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques

Des services

Un ensemble d'outils exclusifs en complément des ressources

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses

Doc & Quiz

Des articles interactifs avec des quiz, pour une lecture constructive

ABONNEZ-VOUS

Lecture en cours
Méthodes robustes pour la reconnaissance

Page
précédenteReconnaissance et compréhension de la parole continue

Page
suivante

Réseaux neuronaux profonds

BIBLIOGRAPHIE

(1) - RABINER (L.), HUANG (B.H.) - Fundamentals of speech recognition. – - Prentice-Hall, Englewood Cliffs (1993).
(2) - JUNQUA (J.-C.), HATON (J.-P.) - Robustness in automatic speech recognition. – - Kluwer Academic, Dordrecht (1996).
(3) - BOITE (R.), BOURLARD (H.), DUTOIT (T.), HANCQ (J.), LEICH (H.) - Traitement de la parole. – - Presses polytechniques et universitaires romandes, Lausanne (2000).
(4) - MINKER (W.), BENNACEF (S.) - Reconnaissance vocale et dialogue homme-machine. – - Eyrolles, Paris (2000).
(5) - MARIANI (J.) (éd.) - Reconnaissance de la parole : traitement automatique du langage parlé. – - Hermes – Science – Lavoisier, Paris (2002).
(6) - COHEN (M.), GIANGOLA (J.), BALOGH (J.) - Voice...

1 Outils logiciels

HTK (HMM ToolKit) : logiciel libre destiné au développement d’applications complètes de reconnaissance de la parole fondées sur MMC http://www.htk.eng.cam.ac.uk/

VISPER (Visual speech processing system) : logiciel libre permettant de visualiser les étapes de reconnaissance par programmation dynamique et par MMC développé par l’Université Technique de Liberec, Tchéquie https://www.ite.tul.cz/speechlabe/index.php/old-projects/visper.html

SNOORI : logiciel libre d’analyse, de visualisation et d’étiquetage de la parole développé au LORIA par Yves Laprie pour les recherches en phonétique, perception et traitement automatique de la parole

Bases de données de parole étiquetée disponibles pour de nombreuses langues par l’intermédiaire des organismes :

LDC, Linguistic Data Consortium http://www.ldc.upenn.edu/

ELRA, European Language Resources Association http://www.elra.info/

Dragon Naturally Speaking de Nuance http://www.nuance.fr/Dragon12

HAUT DE PAGE

2 Annuaire

Constructeurs – Fournisseurs – Distributeurs (liste non exhaustive)

Sociétés spécialisées...

Cet article est réservé aux abonnés.
Il vous reste 92% à découvrir.

Pour explorer cet article
Téléchargez l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

L'expertise technique et scientifique de référence

La plus importante ressource documentaire technique et scientifique en langue française, avec + de 1 200 auteurs et 100 conseillers scientifiques.

+ de 10 000 articles et 1 000 fiches pratiques opérationnelles, + de 800 articles nouveaux ou mis à jours chaque année.

De la conception au prototypage, jusqu'à l'industrialisation, la référence pour sécuriser le développement de vos projets industriels.

Cet article fait partie de l’offre

Documents numériques Gestion de contenu

(68 articles en ce moment)

Cette offre vous donne accès à :

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques

Des services

Un ensemble d'outils exclusifs en complément des ressources

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses

Doc & Quiz

Des articles interactifs avec des quiz, pour une lecture constructive

ABONNEZ-VOUS

Méthodes robustes pour la reconnaissance Reconnaissance automatique de la parole

RÉSUMÉ

Auteur(s)

INTRODUCTION

Cet article est réservé aux abonnés.Il vous reste 95% à découvrir.

L'expertise technique et scientifique de référence

MOTS-CLÉS

VERSIONS

DOI (Digital Object Identifier)

CET ARTICLE SE TROUVE ÉGALEMENT DANS :

6. Méthodes robustes pour la reconnaissance

Cet article est réservé aux abonnés.Il vous reste 92% à découvrir.

L'expertise technique et scientifique de référence

BIBLIOGRAPHIE

ANNEXES

Cet article est réservé aux abonnés.Il vous reste 92% à découvrir.

L'expertise technique et scientifique de référence

Méthodes robustes pour la reconnaissance
Reconnaissance automatique de la parole

Cet article est réservé aux abonnés.
Il vous reste 95% à découvrir.

Cet article est réservé aux abonnés.
Il vous reste 92% à découvrir.

Cet article est réservé aux abonnés.
Il vous reste 92% à découvrir.