Webseiten und HTML-Quelltext in reinen Text umwandeln
HTML-Tags entfernen und Absätze erhalten: script und style löschen, Entitäten wie & auflösen, Tabellen zu Tabs – und der Unterschied zum Kopieren im Browser.
Manchmal haben Sie nur den HTML-Quelltext zur Hand – aus der HTML-Ansicht eines Blog-Editors, einer E-Mail-Vorlage oder einer CMS-Exportdatei – und brauchen nur den reinen Fließtext. Wer Tags von Hand löscht, lässt leicht Entitäten wie & oder Skriptcode stehen.
Die Grund-Pipeline
Das eingebaute Rezept arbeitet in dieser Reihenfolge.
- HTML-Tags entfernen – entfernt Tags, macht Blockgrenzen zu Zeilenumbrüchen und Entitäten zu Zeichen.
- Unsichtbare Zeichen und Anführungszeichen bereinigen – bereinigt das aus
entstandene NBSP (U+00A0) und typografische Anführungszeichen zu normalen Zeichen. - Leerzeichen am Zeilenrand entfernen – entfernt Leerzeichen am Zeilenanfang, die durch die Einrückung im Quelltext übrig bleiben.
- Leerzeilen entfernen – gleicht mit „Mehrere Leerzeilen zu einer“ den Abstand zwischen Absätzen auf eine Zeile an.
- Mehrfache Leerzeichen und Tabs zusammenfassen – fasst mehrfache Leerzeichen innerhalb einer Zeile zu einem zusammen.
- HTML-Tags entfernen
- Unsichtbare Zeichen und Anführungszeichen bereinigen
- Leerzeichen am Zeilenrand entfernen
- Leerzeilen entfernen
- Mehrfache Leerzeichen und Tabs zusammenfassen
Was das Entfernen der Tags erledigt
- Kommentare und ausführbarer Code: Kommentare
<!-- -->und die Elemente<script>,<style>,<noscript>,<template>werden samt Inhalt entfernt. Würden nur die Tags gelöscht, bliebe JavaScript- oder CSS-Code wie Fließtext stehen. - Block-Tags und Zeilenumbrüche: Ist „Block-Tags und <br> als Zeilenumbruch“ aktiv, wird an
<br>und an den Grenzen von Blockelementen wiep,div,h1bish6,li,trumbrochen. Da sowohl öffnende als auch schließende Tags zu Umbrüchen werden, entstehen Leerzeilen; drei oder mehr aufeinanderfolgende werden auf zwei reduziert. - Tabellen: Zellenden (
</td>,</th>) werden zu Tabulatoren. Fügen Sie das Ergebnis in eine Tabellenkalkulation ein, werden die Spalten getrennt. - Entitäten: Ist „Entitäten wie & auflösen“ aktiv, werden gängige benannte Entitäten wie
&<>" …und numerische Entitäten wie''in echte Zeichen umgewandelt. Benannte Entitäten, die das Tool nicht kennt, bleiben wie im Original.
<h2>Hinweis</h2> <p>Wartungsplan dieser Woche.<br>Fragen bitte ins Q&A-Forum.</p> <ul><li>Mo: Server</li><li>Mi: DB</li></ul> <script>track();</script>
Aus diesem Quelltext wird Folgendes.
Hinweis Wartungsplan dieser Woche. Fragen bitte ins Q&A-Forum. Mo: Server Mi: DB
Stören Sie die Leerzeilen zwischen den Listeneinträgen, wählen Sie statt „Zu einer“ die Option „Alle Leerzeilen entfernen“. Dann verschwinden allerdings auch die Leerzeilen zwischen den Absätzen.
Wenn die Tabellenstruktur erhalten bleiben soll
Im letzten Schritt des Rezepts, dem Zusammenfassen mehrfacher Leerzeichen und Tabs, ist „Tabulatoren ebenfalls zusammenfassen“ standardmäßig aktiv, sodass die Tabs der Tabelle zu Leerzeichen werden. Auch „Leerzeichen am Zeilenrand entfernen“ löscht Tabs am Zeilenanfang und -ende. Um Tabellen als tabulatorgetrennte Daten zu nutzen, schalten Sie beim Zusammenfassen „Tabulatoren ebenfalls zusammenfassen“ aus und deaktivieren den Schritt zum Entfernen der Randleerzeichen.
Unterschied zum Kopieren im Browser
Eine Webseite im Browser zu markieren und zu kopieren liefert ein anderes Ergebnis, als den HTML-Quelltext mit diesem Tool zu bereinigen.
- Dieses Tool wertet kein CSS aus. Auch der Text von Elementen, die mit
display:noneausgeblendet sind, bleibt im Ergebnis. - Alternativtexte von Bildern (
alt) und Linkadressen (href) verschwinden mit den Tags. Brauchen Sie die Linkadressen, sichern Sie sie vor dem Entfernen der Tags aus dem Quelltext. - Wurden lange Sätze im HTML-Quelltext über mehrere Zeilen verteilt, bleiben diese Umbrüche erhalten. Dann hilft es, PDF-Zeilenumbrüche reparieren anzuhängen, das die Zeilen innerhalb eines Absatzes verbindet.
- An den Grenzen von Nicht-Block-Elementen wie
<span>wird weder ein Umbruch noch ein Leerzeichen eingefügt; Elemente, die im Quelltext ohne Leerzeichen aneinanderstanden, erscheinen daher zusammengeschrieben.
Versteckte Zeichen in E-Mail-Vorlagen
Newsletter-HTML enthält manchmal Dutzende unsichtbarer Zeichen wie ‌ oder ​, um den Vorschautext im Posteingang zu steuern. Das Entfernen der Tags wandelt diese Entitäten in Nullbreiten-Nichtverbinder (U+200C) und Nullbreitenleerzeichen (U+200B) um, und der zweite Schritt des Rezepts löscht sie. Schalten Sie den Schritt „Unsichtbare Zeichen und Anführungszeichen bereinigen“ aus, bleiben diese Zeichen im Ergebnis – ein scheinbar einwandfreier Text weicht dann beim Suchen oder Vergleichen ab.
Möchten Sie vor die Listeneinträge wieder Aufzählungszeichen setzen, hängen Sie „Zeichen vor und hinter jede Zeile setzen“ an das Rezept an und geben unter „Voranstellen“ - ein. Da das Zeichen allerdings vor jede Zeile gesetzt wird, passt es nicht zu Ergebnissen, in denen Überschriften und Absätze gemischt sind.
Achtung
- Als Tag wird entfernt, was mit
<und einem folgenden lateinischen Buchstaben beginnt und mit>schließt. Bei seltenen Quelltexten mit>in Attributwerten können Reste übrig bleiben. - Entitäten werden erst nach dem Entfernen der Tags aufgelöst, daher wird
<b>im Quelltext nicht als Tag behandelt, sondern bleibt als Text<b>stehen. Das ist so beabsichtigt.
Checkliste
- Fügen Sie den gesamten Quelltext ein und wenden Sie zuerst das Rezept an.
- Wenn Sie Tabellen weiterverwenden, schalten Sie die Schritte aus, die Tabs löschen.
- Brauchen Sie Linkadressen, sichern Sie sie vor dem Entfernen der Tags.
Zuletzt aktualisiert: 2026-09-23