Decodificador de Unicode

Converta entre escapes Unicode e texto. Suporta \uXXXX, \UXXXXXXXX, entidades &#XXXX; e consulta de pontos de código. Todo o processamento é feito no seu navegador.

Codificar e Decodificar Informações do Caractere Processamento no Cliente
O resultado aparecerá aqui...

Como Usar o Decodificador de Unicode

1

Escolha o Modo

Selecione o modo Decodificar (escape para texto) ou Codificar (texto para escape).

2

Insira os Dados

Cole escapes Unicode ou texto simples dependendo do modo.

3

Converta

Clique em Converter e revise o resultado e os detalhes dos caracteres.

O que é Codificação Unicode?

A codificação Unicode permite que caracteres de qualquer idioma ou sistema de símbolos sejam representados em diferentes formatos. Formatos de codificação comuns incluem \uXXXX (JavaScript/JSON), &#NNNNN; (entidades HTML) e U+XXXX (pontos de código Unicode). Essas codificações garantem que o texto possa ser transmitido e exibido com segurança em diferentes sistemas.

Formatos de Codificação

Codificação JavaScript

Usado em strings JSON e JavaScript

Entidades HTML (&#XXXX;)

Usado em HTML para representar caracteres especiais

Escapes CSS (\XXXXXX)

Usado em conteúdo CSS e identificadores

Corrigir texto corrompido (mojibake)

O texto corrompido (mojibake) aparece quando os bytes de uma codificação são interpretados com outra. Caso mais comum: bytes UTF-8 lidos como Windows-1252 ou Latin-1, e «café» vira «café». Mude para o modo Corrigir, cole o texto danificado: o descodificador tratará cada carácter como um byte bruto e recodificará como UTF-8.

Exemplos comuns de texto corrompido

Corrompido Reparado Causa
café café UTF-8 → Latin-1
å¼ ä¸‰ 张三 UTF-8 → Latin-1
“hi†“hi” UTF-8 → double-encoded
ü ö ñ ü ö ñ UTF-8 → Windows-1252
�� � � bytes já perdidos (U+FFFD)

Para evitar mojibake nas suas aplicações, declare sempre a codificação: HTML com <meta charset="UTF-8">, cabeçalho Content-Type: text/html; charset=utf-8 e UTF-8 em bases de dados e ligações.

Comparação UTF-8, UTF-16 e UTF-32

UTF-8 UTF-16 UTF-32
Unidade de codificação 8 bit 16 bit 32 bit
A (U+0041) 41 00 41 00 00 00 41
é (U+00E9) C3 A9 00 E9 00 00 00 E9
中 (U+4E2D) E4 B8 AD 4E 2D 00 00 4E 2D
🎉 (U+1F389) F0 9F 8E 89 D8 3C DF 89 00 01 F3 89
Ideal para Web, JSON, APIs: compatível com ASCII e compacto Texto em memória de Java, JavaScript, C# Acesso direto a code points, raro

Code points Unicode comuns

Referência rápida de caracteres muito procurados: pontuação, moedas, letras acentuadas e sinais matemáticos com os códigos U+XXXX.

Pontuação e símbolos

“U+201C ”U+201D ‘U+2018 ’U+2019
–U+2013 —U+2014 …U+2026  U+A0
©U+A9 ®U+AE ™U+2122 °U+B0

Simbólos monetários

€U+20AC £U+A3 ¥U+A5 ₹U+20B9
¢U+A2 ₽U+20BD ₩U+20A9 ฿U+E3F

Letras acentuadas

éU+E9 èU+E8 êU+EA üU+FC
öU+F6 ñU+F1 åU+E5 øU+F8
çU+E7 ßU+DF ąU+105 žU+17E

Matemática e setas

±U+B1 ×U+D7 ÷U+F7 ≈U+2248
≠U+2260 ≤U+2264 ≥U+2265 →U+2192
∞U+221E ∑U+2211 √U+221A µU+B5

Perguntas Frequentes

Quais formatos de escape Unicode são suportados?

Esta ferramenta suporta \uXXXX (BMP), \UXXXXXXXX (Unicode completo), &#DDDD; (entidade HTML decimal), &#xHHHH; (entidade HTML hexadecimal) e U+XXXX (notação de ponto de código) para decodificação.

Como funciona a codificação UTF-8?

UTF-8 codifica cada ponto de código Unicode usando 1 a 4 bytes. Caracteres ASCII (U+0000 a U+007F) usam 1 byte, caracteres latinos e outros comuns usam 2 bytes, a maioria dos caracteres CJK usa 3 bytes e emojis e caracteres raros usam 4 bytes.

Qual a diferença entre \u e \U?

\uXXXX usa 4 dígitos hexadecimais e pode representar caracteres no Plano Multilíngue Básico (U+0000 a U+FFFF). \UXXXXXXXX usa 8 dígitos hexadecimais e pode representar qualquer caractere Unicode, incluindo aqueles além do BMP.

Porque é que o meu texto mostra caracteres como «Ã©» ou «ï¿½» e como os corrijo?

São sinais de mojibake: bytes UTF-8 descodificados como Windows-1252/Latin-1. «Ã©» significa que os dois bytes UTF-8 de «é» (0xC3 0xA9) foram mostrados como caracteres separados. Use o modo Corrigir. «ï¿½» é U+FFFD: esses bytes estão perdidos para sempre.

Qual é a diferença entre UTF-8 e UTF-16?

O UTF-8 codifica caracteres em 1–4 bytes e é compatível com ASCII — é o padrão da web, JSON e APIs. O UTF-16 usa 2 ou 4 bytes (pares substitutos além de U+FFFF) e é usado internamente por JavaScript, Java e Windows. Para texto web, UTF-8 é mais compacto e seguro.

Qual é a diferença entre um ponto de código e uma unidade de código?

Um ponto de código é um número atribuído a um caractere na norma Unicode (U+00E9 para o e com acento agudo); uma unidade de código é a unidade de armazenamento que uma codificação utiliza. As unidades de código de UTF-8 são bytes de 8 bits - U+00E9 ocupa duas - enquanto as unidades de código de UTF-16 têm 16 bits, e os caracteres para além de U+FFFF precisam de duas delas (um par surrogate). As strings de JavaScript são UTF-16, pelo que 'hello'.length é 5, mas o .length de um emoji é 2.

O que são as formas de normalização Unicode e quando é que são importantes?

O mesmo caractere visível pode ter várias sequências de bytes: o e com acento agudo como um único caractere pré-composto (NFC) ou como e mais um acento combinante (NFD). NFC compõe, NFD decompõe, e NFKC/NFKD adicionalmente dobram os caracteres de compatibilidade (formas full-width, ligaduras). Comparar ou fazer hash de dados introduzidos pelo utilizador sem normalizar primeiro é uma fonte clássica de contas duplicadas e de pesquisas falhadas - a ligadura fi vs f+i.

O que é um BOM e porque é que estraga os meus ficheiros?

A marca de ordem de bytes (byte order mark, BOM) é U+FEFF codificado no início de um fluxo (EF BB BF em UTF-8) para sinalizar a codificação. Os editores normalmente escondem-na, mas a jusante torna-se um primeiro caractere invisível: um cabeçalho CSV ganha uma chave fantasma, a análise de JSON falha no token intruso, e as sessões PHP emitem-na antes dos cabeçalhos. UTF-8 não precisa de BOM, pois não tem ambiguidade de ordem de bytes - guarde sem ele.

{-- * External Resources Component(#18 Phase 3b 内容佐证工程) * 工具页「权威引用」区块:RFC / W3C / WHATWG / ECMA / IANA / 官方规范站 / Wikipedia。 * * - 接受 :slug 属性 → 经 config/tool-sources.php 家族矩阵渲染该工具的权威引用 * - slug 未命中映射时不渲染(无权威来源的工具静默跳过) * - 链接 title 保持英文(引用源专名);description 经 * common.resources.descriptions.{key} 本地化,lang 未命中回退英文(线上不裸奔) * - 链接保持 dofollow(rel="noopener noreferrer") * * @param string|null $slug --}}