Convertir un texte en binaire / hexadécimal / ASCII
Données
| Texte | Hi |
|---|
Convertir un texte en binaire / hexadécimal / ASCII
Saisissez n’importe quel texte pour le voir en binaire, en hexadécimal et en codes décimaux de caractère. Le binaire et l’hexadécimal suivent la séquence d’octets UTF-8, tandis que le décimal indique le point de code Unicode de chaque caractère — la valeur ASCII bien connue pour un texte anglais simple.
Données
Texte
Résultats
Saisissez une valeur pour afficher les résultats.
Encodages
Texte en binaire / hexadécimal / ASCII
Le texte est stocké sous forme de nombres. Chaque caractère que manipule un ordinateur — une lettre, un chiffre, un signe de ponctuation, un emoji — possède un code numérique, et ce code peut s’écrire en binaire, en hexadécimal ou en décimal. Ce calculateur prend un texte et affiche les trois formes à la fois, pour voir exactement comment les mots à l’écran deviennent les bits sur le disque. Il est utile pour déboguer des problèmes d’encodage, construire des tables de correspondance, comprendre le fonctionnement des codes de caractère, ou simplement par curiosité sur ce qu’est réellement une chaîne en dessous.
Des caractères aux codes
La correspondance entre caractères et nombres est définie par un jeu de caractères. Le plus ancien d’usage courant est l’ASCII, qui attribue les 128 codes de 0 à 127 aux lettres latines non accentuées, aux chiffres, à la ponctuation courante et à quelques codes de contrôle. La majuscule H vaut 72, le i minuscule vaut 105, une espace vaut 32 et le chiffre 0 vaut 48. Le texte moderne utilise Unicode, qui étend la même idée à toutes les écritures et tous les symboles en usage, tout en laissant inchangés les codes ASCII d’origine.
Une fois qu’un caractère a un code, l’écrire dans une autre base relève de l’arithmétique ordinaire. Le nombre 72 vaut 01001000 en binaire et 48 en hexadécimal. Ce calculateur indique le code décimal de chaque caractère, puis le binaire et l’hexadécimal des octets qui l’encodent.
ASCII contre UTF-8
L’ASCII ne couvre que 128 caractères, chacun tenant dans un seul octet. UTF-8 est l’encodage qui permet à toute l’étendue d’Unicode de transiter par des systèmes conçus pour des octets. Sa propriété essentielle est la rétrocompatibilité : chaque caractère ASCII est encodé sur exactement un octet, identique à sa valeur ASCII. Tout ce qui sort de la plage ASCII s’étend sur deux à quatre octets.
C’est pourquoi la sortie binaire et hexadécimale est ici regroupée par octet UTF-8. Une lettre accentuée comme é (point de code 233) est encodée par les deux octets C3 A9 ; un caractère CJK typique occupe trois octets ; un emoji comme 😀 (point de code 128512) en occupe quatre. La sortie décimale, en revanche, indique un point de code par caractère, de sorte qu’un caractère multi-octets apparaît toujours comme un seul nombre décimal même s’il occupe plusieurs octets.
Lire la sortie
Chaque groupe séparé par une espace dans les résultats binaire et hexadécimal est un octet : huit bits ou deux chiffres hexadécimaux. Le regroupement par octet garde visibles les limites entre caractères et facilite l’extraction du code d’un seul caractère dans une longue chaîne. Le nombre de caractères et le nombre d’octets UTF-8 figurent à côté ; dès qu’ils diffèrent, le texte contient des caractères non ASCII qui s’étendent sur plusieurs octets.
Exemple détaillé
Prenons le texte Hi. Les deux caractères sont dans la plage ASCII, donc chacun tient sur un seul octet.
Les codes décimaux sont 72 105, l’hexadécimal est 48 69 et le binaire est 01001000 01101001. Deux caractères, deux octets : le nombre de caractères et le nombre d’octets coïncident car le texte est purement ASCII.
Prenons maintenant un seul emoji, 😀. C’est un caractère, mais il se situe bien au-delà d’ASCII, au point de code 128512 (U+1F600). UTF-8 l’encode par les quatre octets F0 9F 98 80, si bien que la sortie binaire compte quatre groupes de 8 bits, la sortie décimale est l’unique point de code 128512, et le nombre d’octets vaut 4 tandis que le nombre de caractères vaut 1.
Inverser l’encodage
Le processus est sans perte et réversible. Redécoupez le binaire en octets de 8 bits, ou lisez l’hexadécimal deux chiffres à la fois, reconstituez la séquence d’octets UTF-8 et décodez-la. Comme UTF-8 est une norme fixe, tout outil conforme reconstruit le texte d’origine avec précision : aucune information n’est perdue en passant du texte au binaire et inversement.
Calculateurs associés
Pour voir comment un seul nombre s’écrit en décimal, binaire et hexadécimal sans l’étape de l’encodage des caractères, utilisez le Convertisseur de base numérique. Pour visualiser une adresse IPv4 de 32 bits sous ses formes entière, hexadécimale et binaire, voir Convertisseur de représentation IPv4. Et pour mesurer la quantité d’information que porte une chaîne, le Calculateur d'entropie de Shannon estime son entropie.
Questions fréquentes (FAQ)
Comment un texte est-il transformé en binaire ?
Les ordinateurs stockent le texte sous forme de nombres. Chaque caractère reçoit un code : la lettre H vaut 72, le i vaut 105, une espace vaut 32, et ainsi de suite. Ces nombres sont écrits en base 2 (binaire) avec des uns et des zéros.
Pour les caractères de la plage ASCII (les lettres anglaises, les chiffres et la ponctuation courante), chaque caractère tient sur un seul octet et devient donc huit bits. Le mot Hi correspond à 72 et 105, soit en binaire 01001000 et 01101001.
Quelle est la différence entre ASCII et UTF-8 ?
ASCII est le schéma d’origine sur 7 bits qui couvre 128 caractères : les lettres latines non accentuées, les chiffres, la ponctuation et les codes de contrôle. Chaque caractère ASCII tient sur un seul octet.
UTF-8 est un sur-ensemble capable de représenter tous les caractères Unicode tout en restant compatible octet par octet avec ASCII. Les caractères ASCII restent sur un octet, mais les lettres accentuées en occupent généralement deux, la plupart des autres écritures trois et les emojis quatre. Ce calculateur affiche le binaire et l’hexadécimal sous forme d’octets UTF-8 : c’est pourquoi un seul emoji produit quatre groupes de 8 bits plutôt qu’un seul.
Pourquoi les chiffres sont-ils regroupés par espaces ?
Chaque groupe séparé par une espace est un octet : huit bits dans la sortie binaire, deux chiffres dans la sortie hexadécimale. Le regroupement par octet rend visibles les limites entre les caractères et facilite la lecture du code d’un seul caractère au sein d’une longue chaîne.
La sortie décimale est regroupée par caractère et non par octet : un caractère multi-octets apparaît donc comme un point de code unique même s’il occupe plusieurs octets.
Peut-on reconvertir le binaire en texte ?
Oui. L’encodage est réversible : découpez le binaire en octets de 8 bits, convertissez chaque octet en son nombre, reconstituez la séquence d’octets UTF-8 et décodez-la en caractères. Il en va de même pour la forme hexadécimale. Comme UTF-8 est une norme bien définie, tout outil capable de lire l’UTF-8 reconstruira exactement le texte d’origine.
Recommandations
Convertisseur de représentation IPv4
Saisissez une adresse IPv4 en notation décimale pointée pour la voir sous forme d'entier 32 bits, de valeur hexadécimale et de binaire pointé. Utile pour lire des captures de paquets, construire des listes de contrôle d'accès et comprendre comment les adresses sont stockées.