修复 PDF 复制的换行
把段落内的强制换行接起来,恢复原来的段落。
示例
- 使用的选项
- 默认选项
输入
Plain text copied from a PDF keeps every visual line break, so sentences are cut in the middle and long words are hy- phenated at the end of a line. A blank line still marks a new para- graph, which is kept as it is.
结果
Plain text copied from a PDF keeps every visual line break, so sentences are cut in the middle and long words are hyphenated at the end of a line. A blank line still marks a new paragraph, which is kept as it is.
示例中的符号:⇥ 制表符 · · 行尾空格 · ⍽ NBSP · □ 全角空格 · ◌ 零宽字符
在工具中打开此操作它做什么
PDF 是把文字按坐标排在页面上的格式,“段落”的概念很弱。所以复制时,屏幕上看到的每一行都会带一个换行,句子被从中间截断。这个操作会把这些行重新接起来,恢复段落。
处理规则
- 空行被视为段落边界,原样保留。
- 同一段落内的行会被连接。韩文和英文用一个空格连接,汉字、假名这类不用空格分词的文字之间则直接拼接,不加空格。
- 以
-、•、1.这类项目符号或编号开头的行保留为新行。
选项
- 还原行尾连字符拆开的单词:英文排版中会出现
infor-/mation这样在行尾用连字符拆开的单词,此选项会把它们合并为information。只有下一行以小写字母开头时才会合并,所以well-Known这类专有写法会被保留。 - 短行+标点视为段落结尾:在段落之间没有空行的 PDF 中,把以句号等结尾、并且明显短于该段最长一行的行视为段落的最后一行,保留其后的换行。
局限
双栏排版的论文复制出来时,行的顺序本身就可能是乱的,这个操作无法解决。如果页眉或页码夹在正文中间,请先用 行过滤 删除。完整流程整理在 PDF 换行指南中。