PDFコピーの改行を復元
段落内の強制改行をつないで、元の段落に戻します。
例
- 使用したオプション
- 既定のオプション
入力
Plain text copied from a PDF keeps every visual line break, so sentences are cut in the middle and long words are hy- phenated at the end of a line. A blank line still marks a new para- graph, which is kept as it is.
結果
Plain text copied from a PDF keeps every visual line break, so sentences are cut in the middle and long words are hyphenated at the end of a line. A blank line still marks a new paragraph, which is kept as it is.
例の表示記号: ⇥ タブ · · 行末の空白 · ⍽ NBSP · □ 全角スペース · ◌ ゼロ幅文字
この処理をツールで開く何をするか
PDFは文字をページ上の座標に配置する形式なので、段落という概念が希薄です。そのためコピーすると、画面に見えていた行ごとに改行が入り、文が途中で切れてしまいます。この処理はそれらの行を再びつなげて段落を復元します。
処理のルール
- 空行は段落の境界とみなしてそのまま残します。
- 同じ段落内の行はつなげます。韓国語・英語の行は空白1文字でつなぎ、漢字・かなのように分かち書きをしない文字どうしは空白なしでつなげます。
-、•、1.のように箇条書き記号や番号で始まる行は、新しい行として残します。
オプション
- 行末のハイフンで分かれた単語を復元: 英語の組版で
infor-/mationのように行末でハイフンによって分かれた単語をinformationにまとめます。次の行が小文字で始まる場合だけまとめるので、well-Knownのような固有の表記は保たれます。 - 短い行+句読点は段落の終わりと判断: 空行なしで段落が続くPDFで、ピリオドなどで終わり、かつその段落でいちばん長い行より明らかに短い行を段落の最後の行とみなし、改行を残します。
限界
2段組の論文は、コピーの順序そのものが入り乱れることがあり、この処理では解決できません。ヘッダーやページ番号が本文の間に挟まっている場合は、先に 行フィルター で削除してください。全体の流れはPDFの改行ガイドにまとめてあります。