Unicode-Dekodierer
Zwischen Unicode-Escapes und Text konvertieren. Unterstützt \uXXXX, \UXXXXXXXX, &#XXXX;-Entities und Codepunkt-Suche. Die gesamte Verarbeitung erfolgt in Ihrem Browser.
Ergebnis erscheint hier...
Zeicheninformationen
| Zeichen | Codepunkt | UTF-8-Bytes | HTML-Entity | CSS-Escape | JS-Escape |
|---|
Verwendung des Unicode-Dekodierers
Modus wählen
Wählen Sie den Modus Dekodieren (Escape zu Text) oder Kodieren (Text zu Escape).
Eingabe eingeben
Fügen Sie Unicode-Escapes oder Klartext ein, je nach Modus.
Umwandeln
Klicken Sie auf Umwandeln und überprüfen Sie das Ergebnis und die Zeichendetails.
Was ist Unicode-Kodierung?
Unicode-Kodierung ermöglicht es Zeichen aus jeder Sprache oder jedem Symbolsystem in verschiedenen Formaten darzustellen. Häufige Kodierungsformate sind \uXXXX (JavaScript/JSON), &#NNNNN; (HTML-Entities) und U+XXXX (Unicode-Codepunkte). Diese Kodierungen stellen sicher, dass Text sicher zwischen verschiedenen Systemen übertragen und angezeigt werden kann.
Kodierungsformate
JavaScript-Kodierung
Verwendet in JSON und JavaScript-Zeichenketten
HTML-Entities (&#XXXX;)
Verwendet in HTML zur Darstellung von Sonderzeichen
CSS-Escapes (\XXXXXX)
Verwendet in CSS-Inhalten und -Bezeichnern
Kaputten Text reparieren (Mojibake)
Kaputter Text (Mojibake) entsteht, wenn Bytes einer Zeichenkodierung mit einer anderen interpretiert werden. Häufigster Fall: UTF-8-Bytes werden als Windows-1252 oder Latin-1 gelesen, aus „café“ wird „café“. Wechseln Sie in den Reparaturmodus und fügen Sie den beschädigten Text ein — der Decoder behandelt jedes Zeichen als rohes Byte und dekodiert es erneut als UTF-8.
Häufige Beispiele für kaputten Text
| Kaputt | Repariert | Ursache |
|---|---|---|
| café | café | UTF-8 → Latin-1 |
| å¼ ä¸‰ | 张三 | UTF-8 → Latin-1 |
| “hi†| “hi” | UTF-8 → double-encoded |
| ü ö ñ | ü ö ñ | UTF-8 → Windows-1252 |
| �� | � � | Bytes bereits verloren (U+FFFD) |
Um Mojibake in eigenen Anwendungen zu vermeiden, deklarieren Sie die Kodierung immer explizit: HTML mit <meta charset="UTF-8">, Header Content-Type: text/html; charset=utf-8 und durchgängig UTF-8 in Datenbanken und Verbindungen.
UTF-8 vs UTF-16 vs UTF-32 im Vergleich
| UTF-8 | UTF-16 | UTF-32 | |
|---|---|---|---|
| Kodierungseinheit | 8 bit | 16 bit | 32 bit |
| A (U+0041) | 41 | 00 41 | 00 00 00 41 |
| é (U+00E9) | C3 A9 | 00 E9 | 00 00 00 E9 |
| 中 (U+4E2D) | E4 B8 AD | 4E 2D | 00 00 4E 2D |
| 🎉 (U+1F389) | F0 9F 8E 89 | D8 3C DF 89 | 00 01 F3 89 |
| Am besten geeignet für | Web, JSON, APIs — ASCII-kompatibel und kompakt | Text im Speicher von Java, JavaScript, C# | Direkter Zugriff auf Codepoints, selten |
Häufige Unicode-Codepoints
Schnellreferenz häufig gesuchter Zeichen: Satzzeichen, Währungssymbole, akzentuierte Buchstaben und mathematische Zeichen mit ihren U+XXXX-Codepoints.
Satzzeichen und Symbole
| “U+201C | ”U+201D | ‘U+2018 | ’U+2019 |
| –U+2013 | —U+2014 | …U+2026 | U+A0 |
| ©U+A9 | ®U+AE | ™U+2122 | °U+B0 |
Währungssymbole
| €U+20AC | £U+A3 | ¥U+A5 | ₹U+20B9 |
| ¢U+A2 | ₽U+20BD | ₩U+20A9 | ฿U+E3F |
Akzentuierte Buchstaben
| éU+E9 | èU+E8 | êU+EA | üU+FC |
| öU+F6 | ñU+F1 | åU+E5 | øU+F8 |
| çU+E7 | ßU+DF | ąU+105 | žU+17E |
Mathematik und Pfeile
| ±U+B1 | ×U+D7 | ÷U+F7 | ≈U+2248 |
| ≠U+2260 | ≤U+2264 | ≥U+2265 | →U+2192 |
| ∞U+221E | ∑U+2211 | √U+221A | µU+B5 |
Häufig gestellte Fragen
Dieses Tool unterstützt \uXXXX (BMP), \UXXXXXXXX (vollständiger Unicode), &#DDDD; (dezimale HTML-Entity), &#xHHHH; (hexadezimale HTML-Entity) und U+XXXX (Codepunkt-Notation) für die Dekodierung.
UTF-8 kodiert jeden Unicode-Codepunkt mit 1 bis 4 Bytes. ASCII-Zeichen (U+0000 bis U+007F) verwenden 1 Byte, lateinische und andere häufige Zeichen 2 Bytes, die meisten CJK-Zeichen 3 Bytes und Emoji sowie seltene Zeichen 4 Bytes.
\uXXXX verwendet 4 Hexadezimalziffern und kann Zeichen in der Basic Multilingual Plane (U+0000 bis U+FFFF) darstellen. \UXXXXXXXX verwendet 8 Hexadezimalziffern und kann jedes Unicode-Zeichen darstellen, einschließlich solcher außerhalb der BMP.
Das sind Anzeichen von Mojibake: UTF-8-Bytes wurden als Windows-1252/Latin-1 dekodiert. „é“ bedeutet, dass die beiden UTF-8-Bytes von „é“ (0xC3 0xA9) als zwei separate Zeichen angezeigt wurden. Nutzen Sie den Reparaturmodus. „�“ ist U+FFFD — diese Bytes sind endgültig verloren.
UTF-8 kodiert Zeichen in 1–4 Bytes und ist vollständig ASCII-kompatibel — der Standard für Web, JSON und APIs. UTF-16 nutzt 2 oder 4 Bytes (Ersatzpaare jenseits von U+FFFF) und wird intern von JavaScript, Java und Windows verwendet. Für Webtexte ist UTF-8 kompakter und sicherer.
Ein Codepunkt ist eine Nummer, die im Unicode-Standard einem Zeichen zugewiesen wird (U+00E9 für é); eine Codeeinheit ist die Speichereinheit, die eine Kodierung verwendet. UTF-8-Codeeinheiten sind 8-Bit-Bytes - U+00E9 benötigt zwei - während UTF-16-Codeeinheiten 16 Bit umfassen und Zeichen oberhalb von U+FFFF zwei davon benötigen (ein Surrogatpaar). JavaScript-Strings sind UTF-16, daher ist 'hello'.length gleich 5, aber die .length eines Emoji ist 2.
Dasselbe sichtbare Zeichen kann mehrere Bytefolgen haben: é als ein vorkomponiertes Zeichen (NFC) oder e plus ein kombinierender Akzent (NFD). NFC komponiert, NFD dekomponiert, und NFKC/NFKD falten zusätzlich Kompatibilitätszeichen (Fullwidth-Formen, Ligaturen). Benutzereingaben ohne vorherige Normalisierung zu vergleichen oder zu hashen ist eine klassische Quelle für doppelte Konten und fehlgeschlagene Lookups - fi-Ligatur vs. f+i.
Das Byte Order Mark ist U+FEFF, kodiert am Anfang eines Streams (EF BB BF in UTF-8), um die Kodierung zu signalisieren. Editoren verstecken es normalerweise, aber nachgelagert wird es zu einem unsichtbaren ersten Zeichen: Ein CSV-Header erhält einen Phantom-Schlüssel, das JSON-Parsing scheitert am unerwarteten Token, und PHP-Sessions geben es vor den Headern aus. UTF-8 benötigt kein BOM, da es keine Byte-Reihenfolge-Mehrdeutigkeit gibt - ohne BOM speichern.
Ähnliche Tools
Hex-Decoder
Umwandlung zwischen Hexadezimal und Text mit konfigurierbaren Trennzeichen und Präfix-Optionen
HTML-Entity-Decoder
HTML-Entitäten kodieren und dekodieren — Umwandlung zwischen Sonderzeichen und Entity-Referenzen
Base64/URL-Decoder
Base64 decodieren und codieren, URL-kodierte Zeichenfolgen parsen, Base64-Bilder voranzeigen und JWT-Header oder Payload-Segmente decodieren
Autoritative Referenzen
Primärquellen hinter diesem Tool – offizielle Standards und Spezifikationen, keine zweihändigen Zusammenfassungen.
Unicode Consortium - Home
Die Homepage des Unicode Consortiums — der Standard, der jedem Zeichen seinen Codepunkt zuweist.
Unicode - Wikipedia
Der Unicode-Standard: Ebenen, Blöcke und Normalisierungsformen.
UTF-8 - Wikipedia
Wie UTF-8 Codepunkte als Bytes kodiert — die dominante Webkodierung, erklärt.