Text/Clean

HTMLタグを削除

HTMLタグを削除し、段落・改行の構造と & のようなエンティティをテキストとして復元します。

  • 使用したオプション
  • 既定のオプション
入力
<h2>Notice</h2><p>Price: 5&nbsp;&euro; &amp; free shipping</p><script>track()</script><ul><li>Fast</li><li>Safe</li></ul>
結果
Notice

Price: 5€ & free shipping

Fast

Safe

例の表示記号: ⇥ タブ · · 行末の空白 · ⍽ NBSP · □ 全角スペース · ◌ ゼロ幅文字

この処理をツールで開く

何をするか

HTMLソースやエディターのHTML表示からコピーした内容から、<p><a href=…> のようなタグを削除して文字だけを残します。

処理の順序

  1. コメント <!-- --> と、<script><style><noscript><template> 要素を中身ごと削除します。タグだけを消すと、JavaScript のコードが本文のように残ってしまうためです。
  2. 「ブロックタグ・<br> を改行に」がオンなら、<br> と、pdivh1h6litr のようなブロック要素の境界を改行に、表のセルの終わり(</td></th>)をタブに変えます。そのため表をコピーすると、Excel に貼り付けやすいタブ区切りのテキストになります。
  3. 残りのタグをすべて削除します。
  4. 「エンティティを解釈」がオンなら、&amp; &lt; &nbsp; &hellip; のような名前付きエンティティと、&#39; &#x27; のような数値エンティティを実際の文字に変換します。知らない名前付きエンティティはそのまま残します。
  5. 連続する空行を最大1行に減らします。

限界

ブラウザのように CSS を解釈しないので、画面上で非表示の要素の文字も残ります。タグの属性値の中に > が含まれる異常なHTMLでは、一部の断片が残ることがあります。

&nbsp; は NBSP 文字に変わるので、後ろに 見えない文字・引用符の整理 を置くと通常の空白に整理されます。標準レシピ「HTML → プレーンテキスト」がこの組み合わせです。