Как исправить разорванные переносы строк в тексте, скопированном из PDF
Почему текст из PDF обрывается посреди предложения и как восстановить переносы, склеить слова с дефисом и убрать номера страниц и колонтитулы — пошагово, с примером.
Если скопировать абзац из PDF-отчёта или научной статьи и вставить его в письмо или документ, в конце каждой строки, видимой на экране, появится перенос, и предложение распадётся на куски. Удалять переносы вручную долго даже для нескольких страниц. В этом руководстве объясняются причина и порядок очистки.
Почему строки обрываются
PDF — формат, который размещает символы по координатам на странице. В отличие от документа Word, единица «абзац» часто вообще не хранится, поэтому программа просмотра PDF при копировании выдаёт каждую строку экрана как отдельную строку. В результате каждая строка внутри абзаца заканчивается переносом. В английских документах к этому добавляется перенос слов через дефис в конце строки, и слово распадается на две части вроде infor- и mation.
Базовый конвейер
Встроенный рецепт состоит из четырёх шагов.
- Очистка невидимых символов и кавычек — сначала убирает NBSP, символы нулевой ширины и типографские кавычки, которые приходят из PDF.
- Восстановление переносов из PDF — оставляет пустые строки как границы абзацев и склеивает строки внутри одного абзаца.
- Сжатие повторных пробелов и табуляций — сжимает до одного пробела лишние пробелы, возникшие из-за выравнивания по ширине.
- Удаление пробелов по краям — удаляет оставшиеся пробелы в начале и конце строк.
- Очистка невидимых символов и кавычек
- Восстановление переносов из PDF
- Сжатие повторных пробелов и табуляций
- Удаление пробелов по краям
Восстановление переносов соединяет строки на корейском, латинице и кириллице через один пробел, а символы, которые пишутся без пробелов (иероглифы, кана), — без пробела. Строки, начинающиеся с маркера или номера вроде -, •, 1., остаются отдельными строками, поэтому списки не сливаются в один блок.
Этот отчёт подготовлен по результатам опроса за второе полугодие 2025 года. - Число респондентов: 1204 - Период: ноябрь
Такой ввод превращается в следующее.
Этот отчёт подготовлен по результатам опроса за второе полугодие 2025 года. - Число респондентов: 1204 - Период: ноябрь
В корейском тексте пробел может появиться и там, где его изначально не было (например, между 작성 и 되었습니다, если строка оборвалась посреди слитно написанного выражения). Инструмент не может знать, стоял ли на месте переноса пробел, поэтому просмотрите результат.
Слова, разорванные дефисом
Если включено «Склеивать слова, перенесённые через дефис», части слова соединяются только тогда, когда предыдущая строка заканчивается латинской буквой и -, а следующая начинается со строчной буквы. Если следующая строка начинается с заглавной буквы или цифры, склейки нет, и написания вроде COVID- / 19 соединяются через пробел. Если в конце строки оказалось составное слово, в котором дефис был изначально (long- / term), может получиться longterm — проверьте результат. Русские слова, перенесённые через дефис (например, полу- / годие), не склеиваются: они соединятся через пробел, и такие места нужно поправить вручную.
Если между строками попали номера страниц и колонтитулы
Если скопировать сразу несколько страниц, между строками текста окажутся номера страниц, название документа, даты и другие колонтитулы. Если такие строки стоят внутри абзаца, они склеятся с текстом, поэтому фильтр строк нужно поставить перед восстановлением переносов.
- Добавьте в самое начало конвейера Фильтр строк и выберите действие «Удалить строки с совпадением».
- Включите «Регулярное выражение» и введите в поле поиска
^\d+$— строки из одних цифр (номера страниц) исчезнут. - Если вокруг номера есть пробелы, используйте
^\s*\d+\s*$, для формата- 12 -—^\s*-\s*\d+\s*-\s*$. - Повторяющийся колонтитул удаляйте, выключив регулярное выражение и введя его текст (например, название документа) как есть. Шагов фильтра может быть несколько.
Если текст колонтитула встречается и в предложении основного текста, эта строка тоже будет удалена, поэтому выбирайте для поиска фрагмент, который есть только в колонтитуле.
Осторожно с PDF в две колонки
В PDF, где страница разделена на две колонки, как в научных журналах, некоторые программы просмотра копируют строки левой и правой колонок вперемешку. В этом случае неверен сам порядок строк, и никакая очистка переносов его не исправит. Выделите в программе просмотра каждую колонку отдельно, скопируйте её и только потом вставьте.
Если абзацы идут без пустых строк
В PDF без пустых строк между абзацами все строки могут слиться в один абзац. Если включено «Считать короткую строку со знаком препинания концом абзаца», строка, которая заканчивается точкой или похожим знаком и заметно короче самой длинной строки абзаца, считается концом абзаца, и текст делится в этом месте. Это предположение, поэтому если короткое предложение случайно окажется в конце строки, разбиение может быть ошибочным.
Таблицы, сноски и подписи к рисункам
Таблицы из PDF при копировании часто разделены только пробелами или выводятся по одной ячейке на строку. Если очищать их вместе с основным текстом, значения ячеек сольются в одно «предложение», поэтому таблицы лучше копировать и обрабатывать отдельно. Номера сносок копируются того же размера, что и текст, и прилипают к слову, как в результат.3. Инструмент не может отличить номер сноски от числа в тексте, так что удаляйте их вручную там, где нужно. Подписи к рисункам, стоящие между абзацами без пустых строк, могут слиться с соседними абзацами.
Частые настройки — в рецепт
Если вы доработали конвейер, например добавили фильтр номеров страниц, сохраните его как рецепт под понятным названием. Когда придётся несколько раз очищать PDF одинакового формата, скажем отчёты одной организации, не придётся собирать шаги заново. Рецепты хранятся только в этом браузере, а вставленный текст не отправляется на сервер.
Чек-лист
- Фильтры номеров страниц и колонтитулов стоят перед шагом восстановления.
- Документы в две колонки копируются по колонкам.
- Составные слова с дефисом, переносы кириллических слов и пробелы в корейском тексте проверяются в результате глазами.
Последнее обновление: 2026-09-23