Text/Clean

Remover tags HTML

Apaga as tags HTML e recupera como texto a estrutura de parágrafos e quebras e entidades como &.

Exemplo

  • Opções aplicadas
  • Opções padrão
Entrada
<h2>Notice</h2><p>Price: 5&nbsp;&euro; &amp; free shipping</p><script>track()</script><ul><li>Fast</li><li>Safe</li></ul>
Resultado
Notice

Price: 5€ & free shipping

Fast

Safe

Símbolos nos exemplos: ⇥ tabulação · · espaço no fim da linha · ⍽ NBSP · □ espaço de largura total · ◌ caractere de largura zero

Abrir esta operação na ferramenta

O que faz

Apaga tags como <p> e <a href=…> de conteúdo copiado de um código HTML ou da visualização HTML de um editor, deixando só o texto.

Ordem de processamento

  1. Apaga os comentários <!-- --> e os elementos <script>, <style>, <noscript> e <template> junto com o conteúdo. Se só as tags fossem apagadas, o código JavaScript ficaria no texto como se fosse conteúdo.
  2. Com 'Tags de bloco e <br> viram quebra de linha' ativado, <br> e os limites de elementos de bloco como p, div, h1 a h6, li e tr viram quebras de linha, e o fim das células de tabela (</td>, </th>) vira tabulação. Assim, uma tabela copiada vira texto separado por tabulações, bom para colar no Excel.
  3. Apaga todas as tags restantes.
  4. Com 'Decodificar entidades' ativado, converte em caracteres reais as entidades nomeadas como &amp; &lt; &nbsp; &hellip; e as numéricas como &#39; &#x27;. Entidades nomeadas desconhecidas ficam como estão.
  5. Reduz as linhas vazias seguidas a no máximo uma.

Limitações

Como não interpreta CSS como um navegador, o texto de elementos ocultos na tela também permanece. HTML malformado com > dentro do valor de um atributo pode deixar alguns fragmentos.

&nbsp; vira o caractere NBSP; colocando Limpar caracteres invisíveis e aspas depois, ele vira espaço comum. A receita pronta 'HTML → texto puro' usa essa combinação.