Unicode-Dekodierer

Zwischen Unicode-Escapes und Text konvertieren. Unterstützt \uXXXX, \UXXXXXXXX, &#XXXX;-Entities und Codepunkt-Suche. Die gesamte Verarbeitung erfolgt in Ihrem Browser.

Kodieren & Dekodieren Zeicheninformationen Clientseitige Verarbeitung
Ergebnis erscheint hier...

Verwendung des Unicode-Dekodierers

1

Modus wählen

Wählen Sie den Modus Dekodieren (Escape zu Text) oder Kodieren (Text zu Escape).

2

Eingabe eingeben

Fügen Sie Unicode-Escapes oder Klartext ein, je nach Modus.

3

Umwandeln

Klicken Sie auf Umwandeln und überprüfen Sie das Ergebnis und die Zeichendetails.

Was ist Unicode-Kodierung?

Unicode-Kodierung ermöglicht es Zeichen aus jeder Sprache oder jedem Symbolsystem in verschiedenen Formaten darzustellen. Häufige Kodierungsformate sind \uXXXX (JavaScript/JSON), &#NNNNN; (HTML-Entities) und U+XXXX (Unicode-Codepunkte). Diese Kodierungen stellen sicher, dass Text sicher zwischen verschiedenen Systemen übertragen und angezeigt werden kann.

Kodierungsformate

JavaScript-Kodierung

Verwendet in JSON und JavaScript-Zeichenketten

HTML-Entities (&#XXXX;)

Verwendet in HTML zur Darstellung von Sonderzeichen

CSS-Escapes (\XXXXXX)

Verwendet in CSS-Inhalten und -Bezeichnern

Kaputten Text reparieren (Mojibake)

Kaputter Text (Mojibake) entsteht, wenn Bytes einer Zeichenkodierung mit einer anderen interpretiert werden. Häufigster Fall: UTF-8-Bytes werden als Windows-1252 oder Latin-1 gelesen, aus „café“ wird „café“. Wechseln Sie in den Reparaturmodus und fügen Sie den beschädigten Text ein — der Decoder behandelt jedes Zeichen als rohes Byte und dekodiert es erneut als UTF-8.

Häufige Beispiele für kaputten Text

Kaputt Repariert Ursache
café café UTF-8 → Latin-1
å¼ ä¸‰ 张三 UTF-8 → Latin-1
“hi†“hi” UTF-8 → double-encoded
ü ö ñ ü ö ñ UTF-8 → Windows-1252
�� � � Bytes bereits verloren (U+FFFD)

Um Mojibake in eigenen Anwendungen zu vermeiden, deklarieren Sie die Kodierung immer explizit: HTML mit <meta charset="UTF-8">, Header Content-Type: text/html; charset=utf-8 und durchgängig UTF-8 in Datenbanken und Verbindungen.

UTF-8 vs UTF-16 vs UTF-32 im Vergleich

UTF-8 UTF-16 UTF-32
Kodierungseinheit 8 bit 16 bit 32 bit
A (U+0041) 41 00 41 00 00 00 41
é (U+00E9) C3 A9 00 E9 00 00 00 E9
中 (U+4E2D) E4 B8 AD 4E 2D 00 00 4E 2D
🎉 (U+1F389) F0 9F 8E 89 D8 3C DF 89 00 01 F3 89
Am besten geeignet für Web, JSON, APIs — ASCII-kompatibel und kompakt Text im Speicher von Java, JavaScript, C# Direkter Zugriff auf Codepoints, selten

Häufige Unicode-Codepoints

Schnellreferenz häufig gesuchter Zeichen: Satzzeichen, Währungssymbole, akzentuierte Buchstaben und mathematische Zeichen mit ihren U+XXXX-Codepoints.

Satzzeichen und Symbole

“U+201C ”U+201D ‘U+2018 ’U+2019
–U+2013 —U+2014 …U+2026  U+A0
©U+A9 ®U+AE ™U+2122 °U+B0

Währungssymbole

€U+20AC £U+A3 ¥U+A5 ₹U+20B9
¢U+A2 ₽U+20BD ₩U+20A9 ฿U+E3F

Akzentuierte Buchstaben

éU+E9 èU+E8 êU+EA üU+FC
öU+F6 ñU+F1 åU+E5 øU+F8
çU+E7 ßU+DF ąU+105 žU+17E

Mathematik und Pfeile

±U+B1 ×U+D7 ÷U+F7 ≈U+2248
≠U+2260 ≤U+2264 ≥U+2265 →U+2192
∞U+221E ∑U+2211 √U+221A µU+B5

Häufig gestellte Fragen

Welche Unicode-Escape-Formate werden unterstützt?

Dieses Tool unterstützt \uXXXX (BMP), \UXXXXXXXX (vollständiger Unicode), &#DDDD; (dezimale HTML-Entity), &#xHHHH; (hexadezimale HTML-Entity) und U+XXXX (Codepunkt-Notation) für die Dekodierung.

Wie funktioniert die UTF-8-Kodierung?

UTF-8 kodiert jeden Unicode-Codepunkt mit 1 bis 4 Bytes. ASCII-Zeichen (U+0000 bis U+007F) verwenden 1 Byte, lateinische und andere häufige Zeichen 2 Bytes, die meisten CJK-Zeichen 3 Bytes und Emoji sowie seltene Zeichen 4 Bytes.

Was ist der Unterschied zwischen \u und \U?

\uXXXX verwendet 4 Hexadezimalziffern und kann Zeichen in der Basic Multilingual Plane (U+0000 bis U+FFFF) darstellen. \UXXXXXXXX verwendet 8 Hexadezimalziffern und kann jedes Unicode-Zeichen darstellen, einschließlich solcher außerhalb der BMP.

Warum zeigt mein Text Zeichen wie „é“ oder „�“ und wie repariere ich das?

Das sind Anzeichen von Mojibake: UTF-8-Bytes wurden als Windows-1252/Latin-1 dekodiert. „é“ bedeutet, dass die beiden UTF-8-Bytes von „é“ (0xC3 0xA9) als zwei separate Zeichen angezeigt wurden. Nutzen Sie den Reparaturmodus. „�“ ist U+FFFD — diese Bytes sind endgültig verloren.

Was ist der Unterschied zwischen UTF-8 und UTF-16?

UTF-8 kodiert Zeichen in 1–4 Bytes und ist vollständig ASCII-kompatibel — der Standard für Web, JSON und APIs. UTF-16 nutzt 2 oder 4 Bytes (Ersatzpaare jenseits von U+FFFF) und wird intern von JavaScript, Java und Windows verwendet. Für Webtexte ist UTF-8 kompakter und sicherer.

Was ist der Unterschied zwischen einem Codepunkt und einer Codeeinheit?

Ein Codepunkt ist eine Nummer, die im Unicode-Standard einem Zeichen zugewiesen wird (U+00E9 für é); eine Codeeinheit ist die Speichereinheit, die eine Kodierung verwendet. UTF-8-Codeeinheiten sind 8-Bit-Bytes - U+00E9 benötigt zwei - während UTF-16-Codeeinheiten 16 Bit umfassen und Zeichen oberhalb von U+FFFF zwei davon benötigen (ein Surrogatpaar). JavaScript-Strings sind UTF-16, daher ist 'hello'.length gleich 5, aber die .length eines Emoji ist 2.

Was sind Unicode-Normalisierungsformen und wann sind sie relevant?

Dasselbe sichtbare Zeichen kann mehrere Bytefolgen haben: é als ein vorkomponiertes Zeichen (NFC) oder e plus ein kombinierender Akzent (NFD). NFC komponiert, NFD dekomponiert, und NFKC/NFKD falten zusätzlich Kompatibilitätszeichen (Fullwidth-Formen, Ligaturen). Benutzereingaben ohne vorherige Normalisierung zu vergleichen oder zu hashen ist eine klassische Quelle für doppelte Konten und fehlgeschlagene Lookups - fi-Ligatur vs. f+i.

Was ist ein BOM und warum verursacht es Probleme in meinen Dateien?

Das Byte Order Mark ist U+FEFF, kodiert am Anfang eines Streams (EF BB BF in UTF-8), um die Kodierung zu signalisieren. Editoren verstecken es normalerweise, aber nachgelagert wird es zu einem unsichtbaren ersten Zeichen: Ein CSV-Header erhält einen Phantom-Schlüssel, das JSON-Parsing scheitert am unerwarteten Token, und PHP-Sessions geben es vor den Headern aus. UTF-8 benötigt kein BOM, da es keine Byte-Reihenfolge-Mehrdeutigkeit gibt - ohne BOM speichern.

{-- * External Resources Component(#18 Phase 3b 内容佐证工程) * 工具页「权威引用」区块:RFC / W3C / WHATWG / ECMA / IANA / 官方规范站 / Wikipedia。 * * - 接受 :slug 属性 → 经 config/tool-sources.php 家族矩阵渲染该工具的权威引用 * - slug 未命中映射时不渲染(无权威来源的工具静默跳过) * - 链接 title 保持英文(引用源专名);description 经 * common.resources.descriptions.{key} 本地化,lang 未命中回退英文(线上不裸奔) * - 链接保持 dofollow(rel="noopener noreferrer") * * @param string|null $slug --}}