Como limpar caracteres de largura total e caracteres invisíveis
O que faz buscas, PROCV e remoção de duplicadas falharem: letras de largura total, espaço de largura total, NBSP, espaço de largura zero, BOM e hangul NFD.
Se o PROCV do Excel não encontra um valor que claramente existe, se o link de uma hashtag copiada não funciona ou se o hangul de um nome de arquivo aparece desmontado como ㅎㅏㄴㄱㅡㄹ, a causa provavelmente é uma diferença de caracteres invisível. Mesmo que na tela pareçam as mesmas letras, o computador compara códigos de caracteres.
Caracteres mais comuns
- Letras, números e símbolos de largura total: são
ABC123!@, do intervalo Unicode U+FF01 a U+FF5E. São digitados no modo de largura total dos teclados de chinês, japonês e coreano e têm códigos diferentes do ASCII de meia largura (U+0021 a U+007E). Números de largura total podem não ser reconhecidos como números em planilhas, e um e-mail com@de largura total dá erro de formato. - Espaço de largura total (U+3000): espaço com a largura de um caractere, usado em documentos em chinês, japonês e coreano.
- NBSP (U+00A0): o espaço não separável. É o
do HTML e aparece muito em textos copiados de páginas da web. A função ARRUMAR (TRIM) do Excel apaga só espaços comuns, então o NBSP permanece. - Espaço de largura zero (U+200B): tem largura 0 e é totalmente invisível. Entra em textos copiados de editores web ou mensageiros e interrompe hashtags e URLs.
- BOM (U+FEFF): a marca de ordem de bytes colocada no início de um arquivo. Ao copiar de um arquivo UTF-8 com BOM, aberto no Bloco de Notas por exemplo, ela se esconde antes do primeiro valor da primeira linha e faz só a comparação do primeiro valor falhar.
Hangul decomposto (NFC e NFD)
O Unicode permite escrever a sílaba coreana 한 tanto com um único código (U+D55C, NFC) quanto com três letras jamo, ᄒ (U+1112), ᅡ (U+1161) e ᆫ (U+11AB) (NFD). As duas formas aparecem como a mesma sílaba, mas são textos diferentes. Nomes de arquivo criados no macOS e alguns textos trazidos do macOS podem conter hangul em NFD, e em ambientes que não conseguem compor o NFD as letras aparecem desmontadas. Mesmo com exibição normal, comparados com hangul em NFC eles são valores diferentes, e buscas e remoção de duplicadas falham. O mesmo acontece com letras latinas acentuadas: um é pode ser um único caractere ou e + acento combinante.
Pipeline de limpeza
- Limpar caracteres invisíveis e aspas — com as opções padrão, junta as letras decompostas com a normalização NFC, apaga caracteres de largura zero e BOM e troca NBSP e outros espaços especiais por espaço comum. As aspas curvas também viram retas.
- Largura total ↔ meia largura — com a direção 'Largura total → meia largura', converte os caracteres de U+FF01 a U+FF5E para ASCII. Com 'Converter também os espaços' ativado, o espaço de largura total também vira espaço comum.
- Remover espaços nas pontas — apaga os espaços convertidos que estiverem nas pontas das linhas.
KIM minsu@example.com 合計:1,200円
A entrada acima (há um espaço de largura total escondido depois de KIM e um espaço de largura zero depois de minsu) fica assim:
KIM minsu@example.com 合計:1,200円
Pontos de atenção
- Largura total → meia largura não altera hangul, ideogramas nem kana, mas converte também a pontuação de largura total dentro de frases em japonês ou chinês (
!?:,). Em textos que precisam manter a aparência, aplique só às partes com letras e números. - O símbolo do won
₩(U+FFE6) e o do iene¥(U+FFE5) estão fora do intervalo de conversão (U+FF01 a U+FF5E) e não mudam. - A opção 'Katakana de meia largura → largura total' só é aplicada quando a direção é 'Meia largura → largura total'.
- A normalização NFC apenas junta letras decompostas na forma composta; ela não transforma caracteres de compatibilidade como
①㎏Ⅳem1kgIV. Esses caracteres permanecem como estão. - A direção contrária, 'Meia largura → largura total', serve para preencher formulários que exigem largura total, como os japoneses. Nesse caso os espaços comuns também viram espaços de largura total; se não precisar disso, desative 'Converter também os espaços'.
- Apagar a junção de largura zero (U+200D) desmonta emojis combinados como 👨👩👧 em emojis separados. Se o texto precisar manter os emojis, desative 'Remover caracteres de largura zero e BOM'.
De onde eles vêm
- Sites japoneses e chineses, documentos antigos de órgãos públicos coreanos e valores digitados no modo de largura total de teclados asiáticos costumam trazer letras e números de largura total.
- Ao copiar páginas da web, vem junto o NBSP escrito como
. Ele aparece muito no fim de frases e entre nome e sobrenome. - Textos copiados de pré-visualizações de links em mensageiros e redes sociais ou de editores podem trazer espaços de largura zero.
A função TIRAR (CLEAN) do Excel apaga os caracteres de controle de código 0 a 31, e não trata NBSP, espaço de largura zero nem caracteres de largura total. Valores que a planilha não resolve podem ser limpos nesta ferramenta e colados de volta.
Como descobrir os caracteres ocultos
Para ver quais linhas têm problema antes de limpar, use Filtrar linhas com 'Manter só as linhas que contêm' e 'Expressão regular' e digite no texto a procurar [ !-~]. Ficam só as linhas que contêm esses caracteres, e você identifica os dados causadores. Depois de conferir, desative ou exclua esta etapa.
Checklist
- Se uma comparação falhar, suspeite primeiro de caracteres invisíveis.
- Coloque a limpeza de caracteres invisíveis e aspas antes da conversão de largura.
- Em textos em japonês ou chinês, use a conversão de largura só em partes.
Última atualização: 2026-09-23