1.1 - Codage et normes

Tableau 1
1.2 - Caractères et glyphes

Tableau 2
1.3 - Échange et restitution de caractères

Tableau 3

2 - CODAGES À MOINS DE 7 MOMENTS

2.1 - Télex (IA2) à 5 moments
2.2 - Codage BCD (6 bits)
2.3 - Codage CDC (6 bits)

Tableau 4 Tableau 5

4 - CODAGES À 8 BITS

4.1 - ISO 8859-n et les ISO Latin

Tableau 8 Tableau 9
4.2 - Autres codages à 8 bits

Figure 1 - Partie de l’Unicode : API Tableau 10 Tableau 11 Tableau 12 Tableau 13

5 - CODAGE 16 OU 32 BITS : UNICODE ET ISO 10646

5.1 - Principes d’Unicode
5.2 - Contenu et principes de codage d’Unicode
5.3 - Définition d’Unicode

Figure 2 - Zones d'Unicode Tableau 14
5.4 - Modèles de codage et de stockage

Tableau 15 Tableau 16
5.5 - Comparaison Unicode et ISO / IEC 10646

Tableau 17
5.6 - Retour sur le concept de glyphe

6 - ÉCHANGE DE CARACTÈRES SUR INTERNET

6.1 - Organismes
6.2 - Codage des caractères avec X400
6.3 - Courrier électronique
6.4 - HTML et XML

Tableau 18
6.5 - Multilinguisme

7 - OUTILS DE TRANSCODAGE

8 - CONCLUSION

Bibliographie & annexes

Article de référence | Réf : H7008 v1

Codages à moins de 7 moments
Codage des caractères

Auteur(s) : Jacques ANDRÉ

Date de publication : 10 nov. 2001

Pour explorer cet article
Télécharger l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

Présentation

Auteur(s)

Jacques ANDRÉ : Directeur de recherche Irisa / Inria-Rennes

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l’article

INTRODUCTION

Un codage de caractère est un ensemble de couples associant à chaque caractère un nom et une valeur numérique. Après avoir explicité le concept de caractère (entité abstraite) et celui de glyphe (forme graphique), on présente les divers standards ou normes d’échange de caractères en fonction de la taille des répertoires. On présente notamment les codages Ascii (7 bits, utilisé pour l’américain), Latin-1 (8 bits, utilisé pour les langues de l’Europe de l’ouest) et le nouveau codage universel Unicode (16 bits, couvrant toutes les langues du monde). On montre enfin l’utilisation de ces normes dans le cadre de l’échange d’information sur le web, en particulier pour le courrier électronique (RFC, MIME) et par le biais d’HTML et de XML.

Cet article est essentiellement consacré aux normes d’échanges de caractères, un second article [H 7 012] devant traiter des problèmes d’impression ou d’affichage de ces caractères (c’est-à-dire de ce que l’on nomme souvent les « fontes »). Dans l’introduction du présent article, nous expliquons la différence entre ces domaines et en précisons les limites. Un troisième article [H 7 014] traitera de saisie et notamment des claviers et enfin un quatrième [H 7 358] de multilinguisme.

Cet article est réservé aux abonnés.
Il vous reste 93% à découvrir.

Pour explorer cet article
Téléchargez l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

L'expertise technique et scientifique de référence

La plus importante ressource documentaire technique et scientifique en langue française, avec + de 1 200 auteurs et 100 conseillers scientifiques.

+ de 10 000 articles et 1 000 fiches pratiques opérationnelles, + de 800 articles nouveaux ou mis à jours chaque année.

De la conception au prototypage, jusqu'à l'industrialisation, la référence pour sécuriser le développement de vos projets industriels.

DOI (Digital Object Identifier)

https://doi.org/10.51257/a-v1-h7008

Cet article fait partie de l’offre

Documents numériques Gestion de contenu

(68 articles en ce moment)

Cette offre vous donne accès à :

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques

Des services

Un ensemble d'outils exclusifs en complément des ressources

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses

Doc & Quiz

Des articles interactifs avec des quiz, pour une lecture constructive

ABONNEZ-VOUS

Lecture en cours
Présentation

Page
suivante

Codage à 7 bits : Ascii ou ISO 646

2. Codages à moins de 7 moments

Certains codages ont été définis, il y a déjà longtemps, avec moins de 7 moments (ou bits) et si nous devons en parler ici c’est moins pour le plaisir de faire de l’histoire que parce que ces codages ne sont pas abandonnés totalement : il faut donc que les outils de conversion 7 soient capables de les traiter. Nous n’en citerons toutefois que trois.

2.1 Télex (IA2) à 5 moments

Nota :

le premier alphabet international IA1 a été le code Morse qui était un code à longueur variable à trois états : trait, point et silence.

Le premier vrai codage binaire aura été l’IA2, utilisé par le télex. Il utilisait une représentation à longueur fixe, 5 bits par code ce qui aurait dû n’autoriser que 32 caractères mais, en utilisant deux états comme pour les machines à écrire, ce nombre était porté à 58.

Nota :

une fois posé le code correspondant (par exemple 29 pour commander le passage en mode alphabétique), ce qui suit est considéré comme un caractère de table haute (donc une lettre), jusqu’à la rencontre d’une commande 30, inversion chiffres, qui fait considérer les caractères suivants comme des chiffres ou signes.

Le tableau 3 montre les codes utilisés. On y note la présence de quelques codes (appel, retour chariot, interligne) que l’on retrouvera dans l’Ascii sous le nom de caractère « de contrôle ».

HAUT DE PAGE

2.2 Codage BCD (6 bits)

Le...

Cet article est réservé aux abonnés.
Il vous reste 94% à découvrir.

Pour explorer cet article
Téléchargez l'extrait gratuit

Vous êtes déjà abonné ?Connectez-vous !

L'expertise technique et scientifique de référence

La plus importante ressource documentaire technique et scientifique en langue française, avec + de 1 200 auteurs et 100 conseillers scientifiques.

+ de 10 000 articles et 1 000 fiches pratiques opérationnelles, + de 800 articles nouveaux ou mis à jours chaque année.

De la conception au prototypage, jusqu'à l'industrialisation, la référence pour sécuriser le développement de vos projets industriels.

Cet article fait partie de l’offre

Documents numériques Gestion de contenu

(68 articles en ce moment)

Cette offre vous donne accès à :

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques

Des services

Un ensemble d'outils exclusifs en complément des ressources

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses

Doc & Quiz

Des articles interactifs avec des quiz, pour une lecture constructive

ABONNEZ-VOUS

Lecture en cours
Codages à moins de 7 moments

Page
précédenteÉchange et restitution de caractères

Page
suivante

Codage à 7 bits : Ascii ou ISO 646

BIBLIOGRAPHIE

(1) - AKIRA (M.) - Writing Systems of the World : Alphabets, Syllabaries, Pictograms, - Charles E Tuttle Co ; ISBN : 0804816549, octobre 1990.
(2) - ANDRÉ (J.) - IsoLatin-1, une norme de codage de caractères européens ? trois caractères français en sont absent ! - Cahier GUTenberg, no 25, p. 65-77. Voir [18], novembre 1996.
(3) - ANDRÉ (J.) - Iso-Latin-9, euro et typographie française. - Document numérique, vol. 2, no 2, p. 231-240 (1998).
(4) - AUMONT (S.), DIRLEWANGER (R.) - Recevoir les accents dans votre messagerie, c’est possible... - Document numérique, vol. 2, no 1, p. 93-101 (1998). http://www.cru.fr/listes/apropos/accents.html
(5) - BEEBE (N.) - Fonts for the Unicode Character Set. - http://www.math.utah.edu/~beebe/fonts/unicode.html
(6) - BIGELOW...