Text in Binär / Hex / ASCII umwandeln
Eingaben
| Text | Hi |
|---|
Text in Binär / Hex / ASCII umwandeln
Geben Sie beliebigen Text ein, um ihn als Binärzahl, Hexadezimalwert und dezimale Zeichencodes zu sehen. Binär und Hex folgen der UTF-8-Bytefolge, die Dezimalspalte listet den Unicode-Codepunkt jedes Zeichens auf – bei reinem englischem Text der bekannte ASCII-Wert.
Eingaben
Text
Ergebnisse
Geben Sie einen Wert ein, um die Ergebnisse zu sehen.
Kodierungen
Text in Binär / Hex / ASCII
Text wird als Zahlen gespeichert. Jedes Zeichen, mit dem ein Computer umgeht – ein Buchstabe, eine Ziffer, ein Satzzeichen, ein Emoji – hat einen numerischen Code, und dieser Code lässt sich binär, hexadezimal oder dezimal schreiben. Dieser Rechner nimmt einen Text und zeigt alle drei Formen gleichzeitig, sodass sichtbar wird, wie die Wörter auf dem Bildschirm zu den Bits auf der Festplatte werden. Das hilft beim Aufspüren von Kodierungsfehlern, beim Erstellen von Nachschlagetabellen, beim Verstehen von Zeichencodes oder einfach aus Neugier, was eine Zeichenkette darunter wirklich ist.
Von Zeichen zu Codes
Die Zuordnung von Zeichen zu Zahlen wird durch einen Zeichensatz festgelegt. Der älteste gebräuchliche ist ASCII, der den 128 Codes 0 bis 127 die unakzentuierten lateinischen Buchstaben, die Ziffern, gängige Satzzeichen und einige Steuerzeichen zuweist. Der Großbuchstabe H ist 72, das kleine i ist 105, ein Leerzeichen ist 32 und die Ziffer 0 ist 48. Moderner Text nutzt Unicode, das dieselbe Idee auf jede Schrift und jedes Symbol ausweitet und die ursprünglichen ASCII-Codes unverändert lässt.
Sobald ein Zeichen einen Code hat, ist das Schreiben in einer anderen Basis schlichte Arithmetik. Die Zahl 72 ist 01001000 binär und 48 hexadezimal. Dieser Rechner listet den Dezimalcode jedes Zeichens auf und dann das Binär und Hexadezimal der Bytes, die es kodieren.
ASCII gegenüber UTF-8
ASCII umfasst nur 128 Zeichen, die jeweils in ein einzelnes Byte passen. UTF-8 ist die Kodierung, die den vollen Umfang von Unicode durch Systeme transportiert, die für Bytes gebaut wurden. Seine zentrale Eigenschaft ist die Abwärtskompatibilität: Jedes ASCII-Zeichen wird als genau ein Byte kodiert, identisch zu seinem ASCII-Wert. Alles außerhalb des ASCII-Bereichs dehnt sich auf zwei bis vier Bytes aus.
Deshalb ist die Binär- und Hexadezimalausgabe hier nach UTF-8-Bytes gruppiert. Ein Akzentbuchstabe wie é (Codepunkt 233) wird als die zwei Bytes C3 A9 kodiert; ein typisches CJK-Zeichen belegt drei Bytes; ein Emoji wie 😀 (Codepunkt 128512) belegt vier. Die Dezimalausgabe dagegen listet einen Codepunkt pro Zeichen, sodass ein Mehrbyte-Zeichen weiterhin als einzelne Dezimalzahl erscheint, obwohl es mehrere Bytes belegt.
Die Ausgabe lesen
Jede durch Leerzeichen getrennte Gruppe in der Binär- und Hexadezimalausgabe ist ein Byte: acht Bit oder zwei Hexziffern. Die Gruppierung nach Bytes hält die Zeichengrenzen sichtbar und erleichtert es, den Code eines einzelnen Zeichens aus einer langen Folge herauszulesen. Die Zeichenanzahl und die UTF-8-Byteanzahl stehen daneben; sobald sie sich unterscheiden, enthält der Text Nicht-ASCII-Zeichen, die sich auf mehrere Bytes ausdehnen.
Durchgerechnetes Beispiel
Nehmen wir den Text Hi. Beide Zeichen liegen im ASCII-Bereich, also ist jedes ein einzelnes Byte.
Die Dezimalcodes sind 72 105, das Hexadezimal ist 48 69 und das Binär ist 01001000 01101001. Zwei Zeichen, zwei Bytes – Zeichenanzahl und Byteanzahl stimmen überein, weil der Text reines ASCII ist.
Nehmen wir nun ein einzelnes Emoji, 😀. Es ist ein Zeichen, liegt aber weit außerhalb von ASCII, bei Codepunkt 128512 (U+1F600). UTF-8 kodiert es als die vier Bytes F0 9F 98 80, sodass die Binärausgabe vier 8-Bit-Gruppen umfasst, die Dezimalausgabe der einzelne Codepunkt 128512 ist und die Byteanzahl 4 beträgt, während die Zeichenanzahl 1 ist.
Die Kodierung umkehren
Der Vorgang ist verlustfrei und umkehrbar. Teilen Sie das Binär zurück in 8-Bit-Bytes oder lesen Sie das Hexadezimal in Zweiergruppen, setzen Sie die UTF-8-Bytefolge zusammen und dekodieren Sie sie. Da UTF-8 ein fester Standard ist, rekonstruiert jedes konforme Werkzeug den ursprünglichen Text präzise – beim Hin und Zurück zwischen Text und Binär geht keine Information verloren.
Verwandte Rechner
Um zu sehen, wie eine einzelne Zahl in Dezimal, Binär und Hexadezimal geschrieben wird, ohne den Schritt der Zeichenkodierung, nutzen Sie den Zahlenbasis-Konverter. Um eine 32-Bit-IPv4-Adresse in ihren Integer-, Hex- und Binärformen zu betrachten, siehe IPv4-Adressdarstellung-Umrechner. Und um zu messen, wie viel Information eine Zeichenkette trägt, schätzt der Shannon-Entropie berechnen ihre Entropie.
Häufig gestellte Fragen (FAQ)
Wie wird Text in Binär umgewandelt?
Computer speichern Text als Zahlen. Jedes Zeichen erhält einen Code: der Buchstabe H ist 72, i ist 105, ein Leerzeichen ist 32 und so weiter. Diese Zahlen werden im Zweiersystem (binär) aus Einsen und Nullen geschrieben.
Für Zeichen im ASCII-Bereich (die einfachen englischen Buchstaben, Ziffern und gängige Satzzeichen) ist jedes Zeichen ein einzelnes Byte und wird damit zu acht Bit. Das Wort Hi besteht aus 72 und 105, binär also 01001000 und 01101001.
Was ist der Unterschied zwischen ASCII und UTF-8?
ASCII ist das ursprüngliche 7-Bit-Schema mit 128 Zeichen: die unakzentuierten lateinischen Buchstaben, Ziffern, Satzzeichen und Steuerzeichen. Jedes ASCII-Zeichen passt in ein einzelnes Byte.
UTF-8 ist eine Obermenge, die jedes Unicode-Zeichen darstellen kann und zugleich byteweise mit ASCII kompatibel bleibt. ASCII-Zeichen sind weiterhin ein Byte, Akzentbuchstaben meist zwei Bytes, die meisten anderen Schriften drei und Emoji vier. Dieser Rechner zeigt Binär und Hexadezimal als UTF-8-Bytes; deshalb erzeugt ein einzelnes Emoji vier 8-Bit-Gruppen statt einer.
Warum sind die Ziffern durch Leerzeichen gruppiert?
Jede durch Leerzeichen getrennte Gruppe ist ein Byte: acht Bit in der Binärausgabe, zwei Ziffern in der Hexausgabe. Die Gruppierung nach Bytes macht die Grenzen zwischen den Zeichen sichtbar und erleichtert es, den Code eines einzelnen Zeichens aus einer langen Folge abzulesen.
Die Dezimalausgabe ist nach Zeichen statt nach Bytes gruppiert, sodass ein Mehrbyte-Zeichen als ein einzelner Codepunkt erscheint, obwohl es mehrere Bytes belegt.
Lässt sich der Binärcode wieder in Text zurückwandeln?
Ja. Die Kodierung ist umkehrbar: Teilen Sie den Binärcode in 8-Bit-Bytes, wandeln Sie jedes Byte in seine Zahl um, setzen Sie die UTF-8-Bytefolge wieder zusammen und dekodieren Sie sie zu Zeichen. Dasselbe gilt für die Hexform. Da UTF-8 ein klar definierter Standard ist, rekonstruiert jedes UTF-8-fähige Werkzeug exakt den ursprünglichen Text.
Weitere Empfehlungen
IPv4-Adressdarstellung-Umrechner
Geben Sie eine IPv4-Adresse in punktierter Dezimalschreibweise ein, um sie als 32-Bit-Ganzzahl, Hexadezimalwert und punktierte Binärdarstellung zu sehen. Nützlich zum Lesen von Paketmitschnitten, Erstellen von Zugriffslisten und Verstehen, wie Adressen gespeichert werden.