Décodeur Unicode

Convertissez entre les échappements Unicode et le texte. Prend en charge \uXXXX, \UXXXXXXXX, les entités &#XXXX; et la recherche de points de code. Tout le traitement est effectué dans votre navigateur.

Encodage et décodage Informations sur les caractères Traitement côté client
Le résultat apparaîtra ici...

Comment utiliser le décodeur Unicode

1

Choisissez le mode

Sélectionnez le mode Décoder (échappement vers texte) ou Encoder (texte vers échappement).

2

Entrez les données

Collez des échappements Unicode ou du texte brut selon le mode.

3

Convertissez

Cliquez sur Convertir et consultez le résultat et les détails des caractères.

Qu'est-ce que l'encodage Unicode ?

L'encodage Unicode permet aux caractères de n'importe quel système linguistique ou symbolique d'être représentés dans différents formats. Les formats d'encodage courants incluent \uXXXX (JavaScript/JSON), &#NNNNN; (entités HTML) et U+XXXX (points de code Unicode). Ces encodages garantissent que le texte peut être transmis et affiché en toute sécurité entre différents systèmes.

Formats d'encodage

Encodage JavaScript

Utilisé dans les chaînes JSON et JavaScript

Entités HTML (&#XXXX;)

Utilisé en HTML pour représenter les caractères spéciaux

Échappements CSS (\XXXXXX)

Utilisé dans le contenu et les identifiants CSS

Réparer le texte corrompu (mojibake)

Le texte corrompu (mojibake) apparaît quand des octets d'un encodage sont interprétés avec un autre. Cas le plus fréquent : des octets UTF-8 lus comme du Windows-1252 ou Latin-1, « café » devient « café ». Passez en mode Réparer, collez le texte abîmé : le décodeur traitera chaque caractère comme un octet brut et le redécodera en UTF-8.

Exemples courants de texte corrompu

Corrompu Réparé Cause
café café UTF-8 → Latin-1
å¼ ä¸‰ 张三 UTF-8 → Latin-1
“hi†“hi” UTF-8 → double-encoded
ü ö ñ ü ö ñ UTF-8 → Windows-1252
�� � � octets déjà perdus (U+FFFD)

Pour éviter le mojibake dans vos applications, déclarez toujours l'encodage : HTML avec <meta charset="UTF-8">, en-tête Content-Type: text/html; charset=utf-8, et UTF-8 partout en base de données et connexions.

Comparaison UTF-8, UTF-16 et UTF-32

UTF-8 UTF-16 UTF-32
Unité d'encodage 8 bit 16 bit 32 bit
A (U+0041) 41 00 41 00 00 00 41
é (U+00E9) C3 A9 00 E9 00 00 00 E9
中 (U+4E2D) E4 B8 AD 4E 2D 00 00 4E 2D
🎉 (U+1F389) F0 9F 8E 89 D8 3C DF 89 00 01 F3 89
Idéal pour Web, JSON, API : compatible ASCII et compact Texte en mémoire en Java, JavaScript, C# Accès direct aux points de code, rare

Points de code Unicode courants

Référence rapide des caractères souvent recherchés : ponctuation, monnaies, lettres accentuées et signes mathématiques, avec leurs codes U+XXXX.

Ponctuation et symboles

“U+201C ”U+201D ‘U+2018 ’U+2019
–U+2013 —U+2014 …U+2026  U+A0
©U+A9 ®U+AE ™U+2122 °U+B0

Symboles monétaires

€U+20AC £U+A3 ¥U+A5 ₹U+20B9
¢U+A2 ₽U+20BD ₩U+20A9 ฿U+E3F

Lettres accentuées

éU+E9 èU+E8 êU+EA üU+FC
öU+F6 ñU+F1 åU+E5 øU+F8
çU+E7 ßU+DF ąU+105 žU+17E

Maths et flèches

±U+B1 ×U+D7 ÷U+F7 ≈U+2248
≠U+2260 ≤U+2264 ≥U+2265 →U+2192
∞U+221E ∑U+2211 √U+221A µU+B5

Questions fréquentes

Quels formats d'échappement Unicode sont pris en charge ?

Cet outil prend en charge \uXXXX (BMP), \UXXXXXXXX (Unicode complet), &#DDDD; (entité HTML décimale), &#xHHHH; (entité HTML hexadécimale) et U+XXXX (notation de point de code) pour le décodage.

Comment fonctionne l'encodage UTF-8 ?

UTF-8 encode chaque point de code Unicode en utilisant 1 à 4 octets. Les caractères ASCII (U+0000 à U+007F) utilisent 1 octet, les caractères latins et courants utilisent 2 octets, la plupart des caractères CJC utilisent 3 octets, et les emoji et caractères rares utilisent 4 octets.

Quelle est la différence entre \u et \U ?

\uXXXX utilise 4 chiffres hexadécimaux et peut représenter les caractères du plan multilingue de base (U+0000 à U+FFFF). \UXXXXXXXX utilise 8 chiffres hexadécimaux et peut représenter n'importe quel caractère Unicode, y compris ceux au-delà du BMP.

Pourquoi mon texte affiche des caractères comme « é » ou « � » et comment le réparer ?

Ce sont des signes de mojibake : des octets UTF-8 décodés comme du Windows-1252/Latin-1. « é » signifie que les deux octets UTF-8 de « é » (0xC3 0xA9) ont été affichés comme deux caractères séparés. Utilisez le mode Réparer. « � » est U+FFFD : ces octets sont définitivement perdus.

Quelle est la différence entre UTF-8 et UTF-16 ?

UTF-8 encode les caractères sur 1 à 4 octets et est compatible ASCII : c'est le standard du web, de JSON et des API. UTF-16 utilise 2 ou 4 octets (paires de substitution au-delà de U+FFFF) et sert de représentation interne à JavaScript, Java et Windows. Pour le web, UTF-8 est plus compact et plus sûr.

Quelle est la différence entre un point de code et une unité de code ?

Un point de code est un numéro attribué à un caractère dans la norme Unicode (U+00E9 pour le e accent aigu) ; une unité de code est l'unité de stockage qu'utilise un encodage. Les unités de code UTF-8 sont des octets de 8 bits - U+00E9 en occupe deux - tandis que les unités de code UTF-16 sont sur 16 bits, et les caractères au-delà de U+FFFF en nécessitent deux (une paire de substitution). Les chaînes JavaScript sont en UTF-16, donc 'hello'.length vaut 5 mais le .length d'un émoji vaut 2.

Que sont les formes de normalisation Unicode et quand sont-elles importantes ?

Un même caractère visible peut avoir plusieurs séquences d'octets : le e accent aigu comme un seul caractère précomposé (NFC) ou e plus un accent combinant (NFD). NFC compose, NFD décompose, et NFKC/NFKD réduisent en outre les caractères de compatibilité (formes pleine largeur, ligatures). Comparer ou hacher une saisie utilisateur sans normaliser au préalable est une source classique de comptes en double et d'échecs de recherche - ligature fi vs f+i.

Qu'est-ce qu'un BOM et pourquoi casse-t-il mes fichiers ?

Le marqueur d'ordre des octets (BOM) est U+FEFF encodé au début d'un flux (EF BB BF en UTF-8) pour signaler l'encodage. Les éditeurs de texte le masquent généralement, mais en aval il devient un premier caractère invisible : un en-tête CSV gagne une clé fantôme, l'analyse JSON échoue sur ce jeton parasite, et les sessions PHP l'émettent avant les en-têtes. UTF-8 n'a pas besoin de BOM puisqu'il ne présente aucune ambiguïté d'ordre des octets - enregistrez sans BOM.

{-- * External Resources Component(#18 Phase 3b 内容佐证工程) * 工具页「权威引用」区块:RFC / W3C / WHATWG / ECMA / IANA / 官方规范站 / Wikipedia。 * * - 接受 :slug 属性 → 经 config/tool-sources.php 家族矩阵渲染该工具的权威引用 * - slug 未命中映射时不渲染(无权威来源的工具静默跳过) * - 链接 title 保持英文(引用源专名);description 经 * common.resources.descriptions.{key} 本地化,lang 未命中回退英文(线上不裸奔) * - 链接保持 dofollow(rel="noopener noreferrer") * * @param string|null $slug --}}