Decodificador de Unicode
Converta entre escapes Unicode e texto. Suporta \uXXXX, \UXXXXXXXX, entidades &#XXXX; e consulta de pontos de código. Todo o processamento é feito no seu navegador.
O resultado aparecerá aqui...
Informações do Caractere
| Caractere | Ponto de Código | Bytes UTF-8 | Entidade HTML | Escape CSS | Escape JS |
|---|
Como Usar o Decodificador de Unicode
Escolha o Modo
Selecione o modo Decodificar (escape para texto) ou Codificar (texto para escape).
Insira os Dados
Cole escapes Unicode ou texto simples dependendo do modo.
Converta
Clique em Converter e revise o resultado e os detalhes dos caracteres.
O que é Codificação Unicode?
A codificação Unicode permite que caracteres de qualquer idioma ou sistema de símbolos sejam representados em diferentes formatos. Formatos de codificação comuns incluem \uXXXX (JavaScript/JSON), &#NNNNN; (entidades HTML) e U+XXXX (pontos de código Unicode). Essas codificações garantem que o texto possa ser transmitido e exibido com segurança em diferentes sistemas.
Formatos de Codificação
Codificação JavaScript
Usado em strings JSON e JavaScript
Entidades HTML (&#XXXX;)
Usado em HTML para representar caracteres especiais
Escapes CSS (\XXXXXX)
Usado em conteúdo CSS e identificadores
Corrigir texto corrompido (mojibake)
O texto corrompido (mojibake) aparece quando os bytes de uma codificação são interpretados com outra. Caso mais comum: bytes UTF-8 lidos como Windows-1252 ou Latin-1, e «café» vira «café». Mude para o modo Corrigir, cole o texto danificado: o descodificador tratará cada carácter como um byte bruto e recodificará como UTF-8.
Exemplos comuns de texto corrompido
| Corrompido | Reparado | Causa |
|---|---|---|
| café | café | UTF-8 → Latin-1 |
| å¼ ä¸‰ | 张三 | UTF-8 → Latin-1 |
| “hi†| “hi” | UTF-8 → double-encoded |
| ü ö ñ | ü ö ñ | UTF-8 → Windows-1252 |
| �� | � � | bytes já perdidos (U+FFFD) |
Para evitar mojibake nas suas aplicações, declare sempre a codificação: HTML com <meta charset="UTF-8">, cabeçalho Content-Type: text/html; charset=utf-8 e UTF-8 em bases de dados e ligações.
Comparação UTF-8, UTF-16 e UTF-32
| UTF-8 | UTF-16 | UTF-32 | |
|---|---|---|---|
| Unidade de codificação | 8 bit | 16 bit | 32 bit |
| A (U+0041) | 41 | 00 41 | 00 00 00 41 |
| é (U+00E9) | C3 A9 | 00 E9 | 00 00 00 E9 |
| 中 (U+4E2D) | E4 B8 AD | 4E 2D | 00 00 4E 2D |
| 🎉 (U+1F389) | F0 9F 8E 89 | D8 3C DF 89 | 00 01 F3 89 |
| Ideal para | Web, JSON, APIs: compatível com ASCII e compacto | Texto em memória de Java, JavaScript, C# | Acesso direto a code points, raro |
Code points Unicode comuns
Referência rápida de caracteres muito procurados: pontuação, moedas, letras acentuadas e sinais matemáticos com os códigos U+XXXX.
Pontuação e símbolos
| “U+201C | ”U+201D | ‘U+2018 | ’U+2019 |
| –U+2013 | —U+2014 | …U+2026 | U+A0 |
| ©U+A9 | ®U+AE | ™U+2122 | °U+B0 |
Simbólos monetários
| €U+20AC | £U+A3 | ¥U+A5 | ₹U+20B9 |
| ¢U+A2 | ₽U+20BD | ₩U+20A9 | ฿U+E3F |
Letras acentuadas
| éU+E9 | èU+E8 | êU+EA | üU+FC |
| öU+F6 | ñU+F1 | åU+E5 | øU+F8 |
| çU+E7 | ßU+DF | ąU+105 | žU+17E |
Matemática e setas
| ±U+B1 | ×U+D7 | ÷U+F7 | ≈U+2248 |
| ≠U+2260 | ≤U+2264 | ≥U+2265 | →U+2192 |
| ∞U+221E | ∑U+2211 | √U+221A | µU+B5 |
Perguntas Frequentes
Esta ferramenta suporta \uXXXX (BMP), \UXXXXXXXX (Unicode completo), &#DDDD; (entidade HTML decimal), &#xHHHH; (entidade HTML hexadecimal) e U+XXXX (notação de ponto de código) para decodificação.
UTF-8 codifica cada ponto de código Unicode usando 1 a 4 bytes. Caracteres ASCII (U+0000 a U+007F) usam 1 byte, caracteres latinos e outros comuns usam 2 bytes, a maioria dos caracteres CJK usa 3 bytes e emojis e caracteres raros usam 4 bytes.
\uXXXX usa 4 dígitos hexadecimais e pode representar caracteres no Plano Multilíngue Básico (U+0000 a U+FFFF). \UXXXXXXXX usa 8 dígitos hexadecimais e pode representar qualquer caractere Unicode, incluindo aqueles além do BMP.
São sinais de mojibake: bytes UTF-8 descodificados como Windows-1252/Latin-1. «Ã©» significa que os dois bytes UTF-8 de «é» (0xC3 0xA9) foram mostrados como caracteres separados. Use o modo Corrigir. «ï¿½» é U+FFFD: esses bytes estão perdidos para sempre.
O UTF-8 codifica caracteres em 1–4 bytes e é compatível com ASCII — é o padrão da web, JSON e APIs. O UTF-16 usa 2 ou 4 bytes (pares substitutos além de U+FFFF) e é usado internamente por JavaScript, Java e Windows. Para texto web, UTF-8 é mais compacto e seguro.
Um ponto de código é um número atribuído a um caractere na norma Unicode (U+00E9 para o e com acento agudo); uma unidade de código é a unidade de armazenamento que uma codificação utiliza. As unidades de código de UTF-8 são bytes de 8 bits - U+00E9 ocupa duas - enquanto as unidades de código de UTF-16 têm 16 bits, e os caracteres para além de U+FFFF precisam de duas delas (um par surrogate). As strings de JavaScript são UTF-16, pelo que 'hello'.length é 5, mas o .length de um emoji é 2.
O mesmo caractere visível pode ter várias sequências de bytes: o e com acento agudo como um único caractere pré-composto (NFC) ou como e mais um acento combinante (NFD). NFC compõe, NFD decompõe, e NFKC/NFKD adicionalmente dobram os caracteres de compatibilidade (formas full-width, ligaduras). Comparar ou fazer hash de dados introduzidos pelo utilizador sem normalizar primeiro é uma fonte clássica de contas duplicadas e de pesquisas falhadas - a ligadura fi vs f+i.
A marca de ordem de bytes (byte order mark, BOM) é U+FEFF codificado no início de um fluxo (EF BB BF em UTF-8) para sinalizar a codificação. Os editores normalmente escondem-na, mas a jusante torna-se um primeiro caractere invisível: um cabeçalho CSV ganha uma chave fantasma, a análise de JSON falha no token intruso, e as sessões PHP emitem-na antes dos cabeçalhos. UTF-8 não precisa de BOM, pois não tem ambiguidade de ordem de bytes - guarde sem ele.
Ferramentas Relacionadas
Decodificador Hex
Converta entre hexadecimal e texto com opções configuráveis de delimitador e prefixo
Decodificador de Entidades HTML
Codifique e decodifique entidades HTML — converta entre caracteres especiais e referências de entidade
Decodificador Base64/URL
Decodifique e codifique Base64, analise strings codificadas por URL, visualize imagens Base64 e decodifique segmentos de cabeçalho ou payload de JWT
Referências de Autoridade
As fontes primárias por trás desta ferramenta - normas e especificações oficiais, não resumos de segunda mão.
Unicode Consortium - Home
A página inicial do Unicode Consortium — a norma que atribui a cada caractere o seu ponto de código.
Unicode - Wikipedia
A norma Unicode: planos, blocos e formas de normalização.
UTF-8 - Wikipedia
Como o UTF-8 codifica pontos de código em bytes — a codificação dominante na web, explicada.