如何整理从 PDF 复制的文本中错乱的换行
解释从PDF复制时句子为何在中间断行,并配合输入与结果示例,分步说明修复换行、合并连字符单词、删除页码和页眉的方法,也介绍双栏文档的注意事项。
从 PDF 报告或论文中复制段落,粘贴到邮件或文档里时,屏幕上看到的每一行末尾都会带一个换行,句子被切成碎片。手动逐个删除,哪怕只有几页也要花很长时间。本文说明其原因和整理顺序。
为什么会断行
PDF 是把文字排在页面坐标上的格式。它往往不像 Word 文档那样单独保存“段落”这一单位,所以 PDF 阅读器在复制时会把屏幕上的一行原样输出为一行。结果是段落内每一行的末尾都带上了换行。英文文档还会因为在行尾用连字符拆分单词的排版方式,出现 infor- 和 mation 这样一个单词被分成两半的情况。
基本流水线
内置配方由以下四个步骤组成。
- 整理不可见字符·引号 — 先整理从 PDF 带过来的 NBSP、零宽字符和弯引号。
- 修复 PDF 复制的换行 — 把空行作为段落边界保留,把同一段落内的行接起来。
- 整理连续空格·制表符 — 把两端对齐造成的多个空格缩减为一个。
- 删除首尾空格 — 删除行首行尾残留的空格。
修复 PDF 复制的换行时,韩文和英文的行之间用一个空格连接,而汉字、假名这类不使用空格的文字之间直接拼接,不加空格。以 -、•、1. 这类项目符号或编号开头的行会保留为新行,所以列表不会被揉成一团。
本报告根据2025年下半年的 问卷调查结果 编写而成。 - 受访人数:1,204人 - 调查期间:11月
上面的输入会被整理成下面这样。
本报告根据2025年下半年的问卷调查结果编写而成。 - 受访人数:1,204人 - 调查期间:11月
中文、日文这类不用空格的文字会直接相连。但韩文会以一个空格连接,因此在韩文中原本不空格的位置(例如 작성 + 되었습니다)也可能被插入空格。工具无法判断换行处原本是不是空格的位置,所以请把结果通读一遍。
被连字符拆开的单词
开启“还原行尾连字符拆开的单词”后,只有当上一行以英文字母加 - 结尾、且下一行以小写字母开头时,才会把两半合并。如果下一行以大写字母或数字开头则不合并,所以 COVID- / 19 这样的写法会以空格相连。原本就带连字符的复合词(long- / term)恰好落在行尾时,可能会被合成 longterm,请在结果中确认。
混有页码和页眉时
一次复制多页时,页码、文档标题、日期等页眉页脚会夹在正文中间。这些行如果位于段落之内,就会和正文一起被接起来,所以必须把行过滤放在修复 PDF 换行之前。
- 在流水线最前面添加 行过滤,把动作设为“删除包含的行”。
- 开启“正则表达式”,在查找内容中填入
^\d+$,只有数字的行(页码)就会被删除。 - 如果页码前后有空格,请用
^\s*\d+\s*$;如果是- 12 -的格式,请用^\s*-\s*\d+\s*-\s*$。 - 反复出现的页眉,可以关闭正则表达式,直接填入那段文字(例如文档标题)来删除。过滤步骤可以放多个。
如果正文句子里也包含页眉文字,那一行也会被一起删除,所以请选择页眉独有的部分作为查找内容。
双栏排版的 PDF 要小心
像学术期刊那样一页分成两栏的 PDF,在某些阅读器中复制时,左栏和右栏的行会交替混在一起。这种情况下是行的顺序本身出了错,任何换行整理都无法纠正。请在阅读器中逐栏拖选、分别复制后再粘贴。
段落之间没有空行时
段落之间没有空行的 PDF,所有行都可能被合并成一个段落。开启“短行+标点视为段落结尾”后,会把以句号等结尾、并且明显短于该段最长一行的行视为段落结尾,在此处断行。这是一种推测,如果短句恰好落在行尾,就可能被错误地拆开。
表格·脚注·图片说明
PDF 中的表格复制出来后,单元格往往只用空格分隔,或者每个单元格单独成行。如果把这部分和正文一起整理,单元格的值会像一句话一样连在一起,所以表格最好与正文分开复制处理。脚注编号会以与正文字号相同的数字被复制下来,有时会像 结果如此。3 这样紧贴在词语后面。工具无法区分脚注编号和正文数字,请只在需要的地方手动删除。图片说明(图注)如果没有空行、夹在正文中间,可能会与前后段落合并。
常用设置保存为配方
如果你修改了流水线,比如加入了页码过滤,请起个名字保存为配方。整理同一机构的报告这类格式相同的 PDF 时,就不必重新搭建步骤。配方只保存在这个浏览器中,粘贴的文本不会发送到服务器。
检查清单
- 页码·页眉过滤放在修复步骤之前。
- 双栏排版的文档按栏分别复制。
- 连字符复合词和韩文空格要亲眼检查结果。
最后更新: 2026-09-23