Décodeur Unicode
Convertissez entre les échappements Unicode et le texte. Prend en charge \uXXXX, \UXXXXXXXX, les entités &#XXXX; et la recherche de points de code. Tout le traitement est effectué dans votre navigateur.
Le résultat apparaîtra ici...
Informations sur le caractère
| Caractère | Point de code | Octets UTF-8 | Entité HTML | Échappement CSS | Échappement JS |
|---|
Comment utiliser le décodeur Unicode
Choisissez le mode
Sélectionnez le mode Décoder (échappement vers texte) ou Encoder (texte vers échappement).
Entrez les données
Collez des échappements Unicode ou du texte brut selon le mode.
Convertissez
Cliquez sur Convertir et consultez le résultat et les détails des caractères.
Qu'est-ce que l'encodage Unicode ?
L'encodage Unicode permet aux caractères de n'importe quel système linguistique ou symbolique d'être représentés dans différents formats. Les formats d'encodage courants incluent \uXXXX (JavaScript/JSON), &#NNNNN; (entités HTML) et U+XXXX (points de code Unicode). Ces encodages garantissent que le texte peut être transmis et affiché en toute sécurité entre différents systèmes.
Formats d'encodage
Encodage JavaScript
Utilisé dans les chaînes JSON et JavaScript
Entités HTML (&#XXXX;)
Utilisé en HTML pour représenter les caractères spéciaux
Échappements CSS (\XXXXXX)
Utilisé dans le contenu et les identifiants CSS
Réparer le texte corrompu (mojibake)
Le texte corrompu (mojibake) apparaît quand des octets d'un encodage sont interprétés avec un autre. Cas le plus fréquent : des octets UTF-8 lus comme du Windows-1252 ou Latin-1, « café » devient « café ». Passez en mode Réparer, collez le texte abîmé : le décodeur traitera chaque caractère comme un octet brut et le redécodera en UTF-8.
Exemples courants de texte corrompu
| Corrompu | Réparé | Cause |
|---|---|---|
| café | café | UTF-8 → Latin-1 |
| å¼ ä¸‰ | 张三 | UTF-8 → Latin-1 |
| “hi†| “hi” | UTF-8 → double-encoded |
| ü ö ñ | ü ö ñ | UTF-8 → Windows-1252 |
| �� | � � | octets déjà perdus (U+FFFD) |
Pour éviter le mojibake dans vos applications, déclarez toujours l'encodage : HTML avec <meta charset="UTF-8">, en-tête Content-Type: text/html; charset=utf-8, et UTF-8 partout en base de données et connexions.
Comparaison UTF-8, UTF-16 et UTF-32
| UTF-8 | UTF-16 | UTF-32 | |
|---|---|---|---|
| Unité d'encodage | 8 bit | 16 bit | 32 bit |
| A (U+0041) | 41 | 00 41 | 00 00 00 41 |
| é (U+00E9) | C3 A9 | 00 E9 | 00 00 00 E9 |
| 中 (U+4E2D) | E4 B8 AD | 4E 2D | 00 00 4E 2D |
| 🎉 (U+1F389) | F0 9F 8E 89 | D8 3C DF 89 | 00 01 F3 89 |
| Idéal pour | Web, JSON, API : compatible ASCII et compact | Texte en mémoire en Java, JavaScript, C# | Accès direct aux points de code, rare |
Points de code Unicode courants
Référence rapide des caractères souvent recherchés : ponctuation, monnaies, lettres accentuées et signes mathématiques, avec leurs codes U+XXXX.
Ponctuation et symboles
| “U+201C | ”U+201D | ‘U+2018 | ’U+2019 |
| –U+2013 | —U+2014 | …U+2026 | U+A0 |
| ©U+A9 | ®U+AE | ™U+2122 | °U+B0 |
Symboles monétaires
| €U+20AC | £U+A3 | ¥U+A5 | ₹U+20B9 |
| ¢U+A2 | ₽U+20BD | ₩U+20A9 | ฿U+E3F |
Lettres accentuées
| éU+E9 | èU+E8 | êU+EA | üU+FC |
| öU+F6 | ñU+F1 | åU+E5 | øU+F8 |
| çU+E7 | ßU+DF | ąU+105 | žU+17E |
Maths et flèches
| ±U+B1 | ×U+D7 | ÷U+F7 | ≈U+2248 |
| ≠U+2260 | ≤U+2264 | ≥U+2265 | →U+2192 |
| ∞U+221E | ∑U+2211 | √U+221A | µU+B5 |
Questions fréquentes
Cet outil prend en charge \uXXXX (BMP), \UXXXXXXXX (Unicode complet), &#DDDD; (entité HTML décimale), &#xHHHH; (entité HTML hexadécimale) et U+XXXX (notation de point de code) pour le décodage.
UTF-8 encode chaque point de code Unicode en utilisant 1 à 4 octets. Les caractères ASCII (U+0000 à U+007F) utilisent 1 octet, les caractères latins et courants utilisent 2 octets, la plupart des caractères CJC utilisent 3 octets, et les emoji et caractères rares utilisent 4 octets.
\uXXXX utilise 4 chiffres hexadécimaux et peut représenter les caractères du plan multilingue de base (U+0000 à U+FFFF). \UXXXXXXXX utilise 8 chiffres hexadécimaux et peut représenter n'importe quel caractère Unicode, y compris ceux au-delà du BMP.
Ce sont des signes de mojibake : des octets UTF-8 décodés comme du Windows-1252/Latin-1. « é » signifie que les deux octets UTF-8 de « é » (0xC3 0xA9) ont été affichés comme deux caractères séparés. Utilisez le mode Réparer. « � » est U+FFFD : ces octets sont définitivement perdus.
UTF-8 encode les caractères sur 1 à 4 octets et est compatible ASCII : c'est le standard du web, de JSON et des API. UTF-16 utilise 2 ou 4 octets (paires de substitution au-delà de U+FFFF) et sert de représentation interne à JavaScript, Java et Windows. Pour le web, UTF-8 est plus compact et plus sûr.
Un point de code est un numéro attribué à un caractère dans la norme Unicode (U+00E9 pour le e accent aigu) ; une unité de code est l'unité de stockage qu'utilise un encodage. Les unités de code UTF-8 sont des octets de 8 bits - U+00E9 en occupe deux - tandis que les unités de code UTF-16 sont sur 16 bits, et les caractères au-delà de U+FFFF en nécessitent deux (une paire de substitution). Les chaînes JavaScript sont en UTF-16, donc 'hello'.length vaut 5 mais le .length d'un émoji vaut 2.
Un même caractère visible peut avoir plusieurs séquences d'octets : le e accent aigu comme un seul caractère précomposé (NFC) ou e plus un accent combinant (NFD). NFC compose, NFD décompose, et NFKC/NFKD réduisent en outre les caractères de compatibilité (formes pleine largeur, ligatures). Comparer ou hacher une saisie utilisateur sans normaliser au préalable est une source classique de comptes en double et d'échecs de recherche - ligature fi vs f+i.
Le marqueur d'ordre des octets (BOM) est U+FEFF encodé au début d'un flux (EF BB BF en UTF-8) pour signaler l'encodage. Les éditeurs de texte le masquent généralement, mais en aval il devient un premier caractère invisible : un en-tête CSV gagne une clé fantôme, l'analyse JSON échoue sur ce jeton parasite, et les sessions PHP l'émettent avant les en-têtes. UTF-8 n'a pas besoin de BOM puisqu'il ne présente aucune ambiguïté d'ordre des octets - enregistrez sans BOM.
Outils connexes
Décodeur Hex
Convertir entre hexadécimal et texte avec options de délimiteur et préfixe configurables
Décodeur d'entités HTML
Encodez et décodez les entités HTML — convertissez entre caractères spéciaux et références d'entités
Décodeur Base64/URL
Décodez et encodez en Base64, analysez les chaînes encodées URL, prévisualisez les images Base64 et décodez les segments d'en-tête ou de charge utile JWT
Références faisant autorité
Les sources primaires à l'origine de cet outil - normes et spécifications officielles, et non des résumés de seconde main.
Unicode Consortium - Home
La page d'accueil du Consortium Unicode — la norme qui attribue à chaque caractère son point de code.
Unicode - Wikipedia
La norme Unicode : plans, blocs et formes de normalisation.
UTF-8 - Wikipedia
Comment UTF-8 encode les points de code en octets — le format d'encodage dominant du web, expliqué.