Text/Clean

HTML 태그 제거

HTML 태그를 지우고 문단·줄바꿈 구조와 & 같은 엔티티를 텍스트로 되살립니다.

예시

  • 적용 옵션
  • 기본 옵션
입력
<h2>Notice</h2><p>Price: 5&nbsp;&euro; &amp; free shipping</p><script>track()</script><ul><li>Fast</li><li>Safe</li></ul>
결과
Notice

Price: 5€ & free shipping

Fast

Safe

예시 표시 기호: ⇥ 탭 · · 줄 끝 공백 · ⍽ NBSP · □ 전각 공백 · ◌ 제로폭 문자

도구에서 이 작업 열기

무엇을 하나요

HTML 소스나 에디터의 HTML 보기에서 복사한 내용에서 <p>, <a href=…> 같은 태그를 지우고 글자만 남깁니다.

처리 순서

  1. 주석 <!-- --><script>, <style>, <noscript>, <template> 요소를 내용째 지웁니다. 태그만 지우면 자바스크립트 코드가 본문처럼 남기 때문입니다.
  2. '블록 태그를 줄바꿈으로'가 켜져 있으면 <br>p, div, h1~h6, li, tr 같은 블록 요소 경계를 줄바꿈으로, 표의 셀 끝(</td>, </th>)을 탭으로 바꿉니다. 그래서 표를 복사하면 엑셀에 붙여넣기 좋은 탭 구분 텍스트가 됩니다.
  3. 나머지 태그를 모두 지웁니다.
  4. '엔티티 해석'이 켜져 있으면 &amp; &lt; &nbsp; &hellip; 같은 이름 엔티티와 &#39; &#x27; 같은 숫자 엔티티를 실제 문자로 바꿉니다. 모르는 이름 엔티티는 그대로 둡니다.
  5. 연속된 빈 줄을 최대 한 줄로 줄입니다.

한계

브라우저처럼 CSS를 해석하지 않으므로 화면에서 숨겨진 요소의 글자도 남습니다. 태그 속성 값 안에 > 가 들어 있는 비정상적인 HTML은 일부 조각이 남을 수 있습니다.

&nbsp; 는 NBSP 문자로 바뀌므로 뒤에 보이지 않는 문자·따옴표 정리 를 두면 일반 공백으로 정리됩니다. 기본 레시피 'HTML → 순수 텍스트'가 이 조합입니다.