Text/Clean

Zerrissene Zeilenumbrüche in aus PDFs kopiertem Text reparieren

Warum PDF-Text mitten im Satz umbricht und wie Sie Umbrüche reparieren, Worttrennungen zusammenführen sowie Seitenzahlen und Kopfzeilen entfernen – mit Beispiel.

Wenn Sie einen Absatz aus einem PDF-Bericht oder einem Fachartikel kopieren und in eine E-Mail oder ein Dokument einfügen, steht an jedem Zeilenende, das auf dem Bildschirm zu sehen war, ein Zeilenumbruch – der Satz zerfällt in Stücke. Die Umbrüche von Hand zu löschen, dauert schon bei wenigen Seiten lange. Diese Anleitung erklärt die Ursache und die richtige Reihenfolge der Bereinigung.

Warum brechen die Zeilen um?

PDF ist ein Format, das Zeichen über Koordinaten auf der Seite platziert. Anders als in einem Word-Dokument wird eine Einheit „Absatz“ oft gar nicht gespeichert, daher gibt der PDF-Betrachter beim Kopieren jede Bildschirmzeile als eigene Zeile aus. Die Folge: Jede Zeile innerhalb eines Absatzes endet mit einem Zeilenumbruch. In englischen Dokumenten kommt hinzu, dass Wörter am Zeilenende mit Bindestrich getrennt werden, sodass ein Wort wie infor- und mation in zwei Stücke zerfällt.

Die Grund-Pipeline

Das eingebaute Rezept besteht aus den folgenden vier Schritten.

  1. Unsichtbare Zeichen und Anführungszeichen bereinigen – bereinigt zuerst NBSP, Nullbreitenzeichen und typografische Anführungszeichen, die aus dem PDF mitkommen.
  2. PDF-Zeilenumbrüche reparieren – lässt Leerzeilen als Absatzgrenzen stehen und verbindet die Zeilen innerhalb eines Absatzes.
  3. Mehrfache Leerzeichen und Tabs zusammenfassen – fasst mehrfache Leerzeichen, die durch den Blocksatz entstanden sind, zu einem zusammen.
  4. Leerzeichen am Zeilenrand entfernen – entfernt übrig gebliebene Leerzeichen am Zeilenanfang und -ende.
RezeptePDF-Zeilenumbrüche reparieren
  1. Unsichtbare Zeichen und Anführungszeichen bereinigen
  2. PDF-Zeilenumbrüche reparieren
  3. Mehrfache Leerzeichen und Tabs zusammenfassen
  4. Leerzeichen am Zeilenrand entfernen
Tool mit diesem Rezept öffnen

Die PDF-Reparatur verbindet koreanische und lateinische Zeilen mit einem Leerzeichen und Schriftzeichen ohne Wortzwischenraum, etwa chinesische Zeichen oder Kana, ohne Leerzeichen. Zeilen, die mit einem Aufzählungszeichen oder einer Nummer wie -, , 1. beginnen, bleiben eigene Zeilen, damit Listen nicht zu einem Block verschmelzen.

Dieser Bericht wurde auf Grundlage
der Umfrageergebnisse aus dem zwei-
ten Halbjahr 2025 erstellt.

- Befragte: 1.204
- Zeitraum: November

Aus dieser Eingabe wird Folgendes.

Dieser Bericht wurde auf Grundlage der Umfrageergebnisse aus dem zweiten Halbjahr 2025 erstellt.

- Befragte: 1.204
- Zeitraum: November

Bei koreanischem Text kann auch dort ein Leerzeichen entstehen, wo ursprünglich keines stand (etwa zwischen 작성 und 되었습니다, wenn der Umbruch mitten in einem zusammengeschriebenen Ausdruck lag). Das Tool kann nicht wissen, ob ein Zeilenumbruch ursprünglich an der Stelle eines Leerzeichens stand – lesen Sie das Ergebnis deshalb einmal durch.

Mit Bindestrich getrennte Wörter

Ist „Silbentrennung am Zeilenende rückgängig machen“ aktiv, werden die beiden Stücke nur zusammengefügt, wenn die vorherige Zeile mit einem lateinischen Buchstaben und - endet und die nächste Zeile mit einem Kleinbuchstaben beginnt. Beginnt die nächste Zeile mit einem Großbuchstaben oder einer Ziffer, wird nicht zusammengefügt, sodass Schreibweisen wie COVID- / 19 mit einem Leerzeichen verbunden werden. Landet ein Kompositum, das ohnehin einen Bindestrich enthält (long- / term), am Zeilenende, kann daraus longterm werden – prüfen Sie das im Ergebnis. Im Deutschen gilt dasselbe etwa für E- / mail oder Nord- / rhein: Hier geht der ursprüngliche Bindestrich verloren.

Wenn Seitenzahlen und Kopfzeilen dazwischenstehen

Kopieren Sie mehrere Seiten auf einmal, schieben sich Seitenzahlen, Dokumenttitel oder Datumsangaben aus Kopf- und Fußzeilen zwischen den Fließtext. Stehen diese Zeilen innerhalb eines Absatzes, werden sie mit dem Text verbunden. Deshalb muss der Zeilenfilter vor der PDF-Reparatur stehen.

  1. Fügen Sie ganz vorn in der Pipeline Zeilenfilter ein und stellen Sie die Aktion auf „Passende Zeilen löschen“.
  2. Aktivieren Sie „Regulärer Ausdruck“ und geben Sie als Suchbegriff ^\d+$ ein – so verschwinden Zeilen, die nur aus Ziffern bestehen (Seitenzahlen).
  3. Stehen vor und hinter der Seitenzahl Leerzeichen, verwenden Sie ^\s*\d+\s*$, beim Format - 12 - den Ausdruck ^\s*-\s*\d+\s*-\s*$.
  4. Wiederkehrende Kopfzeilen löschen Sie, indem Sie den regulären Ausdruck ausschalten und den Wortlaut (zum Beispiel den Dokumenttitel) unverändert eingeben. Sie können mehrere Filterschritte anlegen.

Kommt der Wortlaut der Kopfzeile auch in einem Satz des Fließtextes vor, wird diese Zeile ebenfalls gelöscht. Wählen Sie als Suchbegriff daher einen Teil, der nur in der Kopfzeile vorkommt.

Vorsicht bei zweispaltigen PDFs

Bei PDFs, deren Seiten wie in Fachzeitschriften in zwei Spalten geteilt sind, werden je nach Betrachter die Zeilen der linken und rechten Spalte abwechselnd durcheinander kopiert. Dann ist schon die Reihenfolge der Zeilen falsch, und keine Umbruchbereinigung kann das beheben. Markieren Sie im Betrachter jede Spalte einzeln, kopieren Sie sie separat und fügen Sie sie dann ein.

Wenn Absätze ohne Leerzeile aufeinanderfolgen

Bei PDFs ohne Leerzeilen zwischen den Absätzen können alle Zeilen zu einem einzigen Absatz verschmelzen. Ist „Kurze Zeile + Satzzeichen als Absatzende werten“ aktiv, wird eine Zeile, die mit Punkt o. Ä. endet und deutlich kürzer ist als die längste Zeile des Absatzes, als Absatzende betrachtet und dort getrennt. Da es sich um eine Schätzung handelt, kann falsch getrennt werden, wenn zufällig ein kurzer Satz am Zeilenende steht.

Tabellen, Fußnoten und Bildunterschriften

Tabellen im PDF werden beim Kopieren oft nur durch Leerzeichen getrennt oder Zelle für Zelle in eigenen Zeilen ausgegeben. Bereinigt man solche Teile zusammen mit dem Fließtext, werden die Zellwerte wie ein Satz aneinandergereiht; kopieren Sie Tabellen daher besser getrennt vom Text. Fußnotenziffern werden in derselben Größe wie der Text kopiert und hängen dann wie in Ergebnis.3 am Wort. Das Tool kann Fußnotenziffern nicht von Zahlen im Text unterscheiden – löschen Sie sie bei Bedarf von Hand. Stehen Bildunterschriften ohne Leerzeile zwischen dem Fließtext, können sie mit dem vorherigen oder folgenden Absatz verschmelzen.

Häufige Einstellungen als Rezept

Haben Sie die Pipeline angepasst, etwa um einen Seitenzahlfilter ergänzt, speichern Sie sie unter einem Namen als Rezept. Wenn Sie mehrfach PDFs gleichen Aufbaus bereinigen, etwa Berichte derselben Institution, müssen Sie die Schritte dann nicht neu zusammenstellen. Rezepte werden nur in diesem Browser gespeichert, und der eingefügte Text wird nicht an einen Server gesendet.

Checkliste

  • Filter für Seitenzahlen und Kopfzeilen stehen vor dem Reparaturschritt.
  • Zweispaltige Dokumente werden spaltenweise kopiert.
  • Bindestrich-Komposita und Leerzeichen in koreanischem Text prüfen Sie im Ergebnis mit dem Auge.

Zuletzt aktualisiert: 2026-09-23