Text/Clean

删除 HTML 标签

删除 HTML 标签,并把段落·换行结构和 & 等实体还原为文本。

示例

  • 使用的选项
  • 默认选项
输入
<h2>Notice</h2><p>Price: 5&nbsp;&euro; &amp; free shipping</p><script>track()</script><ul><li>Fast</li><li>Safe</li></ul>
结果
Notice

Price: 5€ & free shipping

Fast

Safe

示例中的符号:⇥ 制表符 · · 行尾空格 · ⍽ NBSP · □ 全角空格 · ◌ 零宽字符

在工具中打开此操作

它做什么

从 HTML 源码或编辑器的 HTML 视图中复制的内容里删除 <p><a href=…> 这样的标签,只保留文字。

处理顺序

  1. 连同内容一起删除注释 <!-- --> 以及 <script><style><noscript><template> 元素。如果只删标签,JavaScript 代码就会像正文一样残留下来。
  2. 如果开启了“块级标签·<br> 转为换行”,会把 <br> 以及 pdivh1~h6litr 等块级元素的边界转为换行,把表格单元格的结尾(</td></th>)转为制表符。因此复制表格后会得到适合粘贴到 Excel 的制表符分隔文本。
  3. 删除其余所有标签。
  4. 如果开启了“解析实体”,会把 &amp; &lt; &nbsp; &hellip; 这样的命名实体以及 &#39; &#x27; 这样的数字实体转换为实际字符。不认识的命名实体保持原样。
  5. 把连续的空行缩减为最多一行。

局限

它不像浏览器那样解析 CSS,所以在屏幕上被隐藏的元素里的文字也会保留。标签属性值中含有 > 的不规范 HTML 可能会残留部分片段。

&nbsp; 会被转换为 NBSP 字符,所以在后面放 整理不可见字符·引号 就能整理成普通空格。内置配方“HTML → 纯文本”就是这个组合。