Text/Clean

Como limpar caracteres de largura total e caracteres invisíveis

O que faz buscas, PROCV e remoção de duplicadas falharem: letras de largura total, espaço de largura total, NBSP, espaço de largura zero, BOM e hangul NFD.

Se o PROCV do Excel não encontra um valor que claramente existe, se o link de uma hashtag copiada não funciona ou se o hangul de um nome de arquivo aparece desmontado como ㅎㅏㄴㄱㅡㄹ, a causa provavelmente é uma diferença de caracteres invisível. Mesmo que na tela pareçam as mesmas letras, o computador compara códigos de caracteres.

Caracteres mais comuns

  • Letras, números e símbolos de largura total: são ABC123!@, do intervalo Unicode U+FF01 a U+FF5E. São digitados no modo de largura total dos teclados de chinês, japonês e coreano e têm códigos diferentes do ASCII de meia largura (U+0021 a U+007E). Números de largura total podem não ser reconhecidos como números em planilhas, e um e-mail com de largura total dá erro de formato.
  • Espaço de largura total (U+3000): espaço com a largura de um caractere, usado em documentos em chinês, japonês e coreano.
  • NBSP (U+00A0): o espaço não separável. É o   do HTML e aparece muito em textos copiados de páginas da web. A função ARRUMAR (TRIM) do Excel apaga só espaços comuns, então o NBSP permanece.
  • Espaço de largura zero (U+200B): tem largura 0 e é totalmente invisível. Entra em textos copiados de editores web ou mensageiros e interrompe hashtags e URLs.
  • BOM (U+FEFF): a marca de ordem de bytes colocada no início de um arquivo. Ao copiar de um arquivo UTF-8 com BOM, aberto no Bloco de Notas por exemplo, ela se esconde antes do primeiro valor da primeira linha e faz só a comparação do primeiro valor falhar.

Hangul decomposto (NFC e NFD)

O Unicode permite escrever a sílaba coreana tanto com um único código (U+D55C, NFC) quanto com três letras jamo, (U+1112), (U+1161) e (U+11AB) (NFD). As duas formas aparecem como a mesma sílaba, mas são textos diferentes. Nomes de arquivo criados no macOS e alguns textos trazidos do macOS podem conter hangul em NFD, e em ambientes que não conseguem compor o NFD as letras aparecem desmontadas. Mesmo com exibição normal, comparados com hangul em NFC eles são valores diferentes, e buscas e remoção de duplicadas falham. O mesmo acontece com letras latinas acentuadas: um é pode ser um único caractere ou e + acento combinante.

Pipeline de limpeza

  1. Limpar caracteres invisíveis e aspas — com as opções padrão, junta as letras decompostas com a normalização NFC, apaga caracteres de largura zero e BOM e troca NBSP e outros espaços especiais por espaço comum. As aspas curvas também viram retas.
  2. Largura total ↔ meia largura — com a direção 'Largura total → meia largura', converte os caracteres de U+FF01 a U+FF5E para ASCII. Com 'Converter também os espaços' ativado, o espaço de largura total também vira espaço comum.
  3. Remover espaços nas pontas — apaga os espaços convertidos que estiverem nas pontas das linhas.
KIM minsu​@example.com
合計:1,200円

A entrada acima (há um espaço de largura total escondido depois de KIM e um espaço de largura zero depois de minsu) fica assim:

KIM minsu@example.com
合計:1,200円

Pontos de atenção

  • Largura total → meia largura não altera hangul, ideogramas nem kana, mas converte também a pontuação de largura total dentro de frases em japonês ou chinês ( ). Em textos que precisam manter a aparência, aplique só às partes com letras e números.
  • O símbolo do won (U+FFE6) e o do iene (U+FFE5) estão fora do intervalo de conversão (U+FF01 a U+FF5E) e não mudam.
  • A opção 'Katakana de meia largura → largura total' só é aplicada quando a direção é 'Meia largura → largura total'.
  • A normalização NFC apenas junta letras decompostas na forma composta; ela não transforma caracteres de compatibilidade como em 1 kg IV. Esses caracteres permanecem como estão.
  • A direção contrária, 'Meia largura → largura total', serve para preencher formulários que exigem largura total, como os japoneses. Nesse caso os espaços comuns também viram espaços de largura total; se não precisar disso, desative 'Converter também os espaços'.
  • Apagar a junção de largura zero (U+200D) desmonta emojis combinados como 👨‍👩‍👧 em emojis separados. Se o texto precisar manter os emojis, desative 'Remover caracteres de largura zero e BOM'.

De onde eles vêm

  • Sites japoneses e chineses, documentos antigos de órgãos públicos coreanos e valores digitados no modo de largura total de teclados asiáticos costumam trazer letras e números de largura total.
  • Ao copiar páginas da web, vem junto o NBSP escrito como  . Ele aparece muito no fim de frases e entre nome e sobrenome.
  • Textos copiados de pré-visualizações de links em mensageiros e redes sociais ou de editores podem trazer espaços de largura zero.

A função TIRAR (CLEAN) do Excel apaga os caracteres de controle de código 0 a 31, e não trata NBSP, espaço de largura zero nem caracteres de largura total. Valores que a planilha não resolve podem ser limpos nesta ferramenta e colados de volta.

Como descobrir os caracteres ocultos

Para ver quais linhas têm problema antes de limpar, use Filtrar linhas com 'Manter só as linhas que contêm' e 'Expressão regular' e digite no texto a procurar [ ​ !-~]. Ficam só as linhas que contêm esses caracteres, e você identifica os dados causadores. Depois de conferir, desative ou exclua esta etapa.

Checklist

  • Se uma comparação falhar, suspeite primeiro de caracteres invisíveis.
  • Coloque a limpeza de caracteres invisíveis e aspas antes da conversão de largura.
  • Em textos em japonês ou chinês, use a conversão de largura só em partes.

Última atualização: 2026-09-23