Text/Clean

Quitar etiquetas HTML

Elimina las etiquetas HTML y recupera como texto la estructura de párrafos y saltos de línea y entidades como &.

Ejemplo

  • Opciones aplicadas
  • Opciones predeterminadas
Entrada
<h2>Notice</h2><p>Price: 5&nbsp;&euro; &amp; free shipping</p><script>track()</script><ul><li>Fast</li><li>Safe</li></ul>
Resultado
Notice

Price: 5€ & free shipping

Fast

Safe

Símbolos de los ejemplos: ⇥ tabulación · · espacio al final de línea · ⍽ NBSP · □ espacio de ancho completo · ◌ carácter de ancho cero

Abrir esta operación en la herramienta

Qué hace

Elimina etiquetas como <p> o <a href=…> del contenido copiado de un código HTML o de la vista HTML de un editor y deja solo el texto.

Orden de procesamiento

  1. Elimina, con su contenido, los comentarios <!-- --> y los elementos <script>, <style>, <noscript> y <template>. Si solo se quitaran las etiquetas, el código JavaScript quedaría como si fuera texto.
  2. Si está activada «Etiquetas de bloque y <br> → salto de línea», convierte en salto de línea los <br> y los límites de elementos de bloque como p, div, h1~h6, li o tr, y en tabulación el final de las celdas de tabla (</td>, </th>). Así, al copiar una tabla, obtienes texto separado por tabulaciones listo para pegar en Excel.
  3. Elimina todas las demás etiquetas.
  4. Si está activada «Interpretar entidades», convierte en caracteres reales las entidades con nombre como &amp; &lt; &nbsp; &hellip; y las numéricas como &#39; &#x27;. Las entidades con nombre desconocidas se dejan tal cual.
  5. Reduce las líneas vacías consecutivas a una como máximo.

Limitaciones

No interpreta el CSS como un navegador, así que también queda el texto de los elementos ocultos en pantalla. En HTML irregular con > dentro del valor de un atributo pueden quedar algunos fragmentos.

&nbsp; se convierte en el carácter NBSP, así que colocando Limpiar caracteres invisibles y comillas después se transforma en un espacio normal. La receta incluida «HTML → texto plano» es precisamente esa combinación.