Comment réparer les sauts de ligne d'un texte copié depuis un PDF
Pourquoi un texte copié d'un PDF se coupe au milieu des phrases, et comment réparer sauts de ligne, mots coupés, numéros de page et en-têtes.
Quand vous copiez un paragraphe d'un rapport ou d'un article PDF pour le coller dans un e-mail ou un document, chaque fin de ligne visible à l'écran devient un saut de ligne et les phrases sont hachées. Les effacer un par un prend beaucoup de temps, même sur quelques pages. Ce guide explique la cause et l'ordre de nettoyage.
Pourquoi les lignes se coupent
Le PDF est un format qui place les caractères par coordonnées sur la page. Souvent, il ne stocke pas d'unité « paragraphe » comme le fait un document Word ; au moment de la copie, le lecteur PDF exporte donc chaque ligne de l'écran comme une ligne. Résultat : toutes les lignes d'un paragraphe se terminent par un saut de ligne. Dans les documents en anglais, la composition coupe en plus les mots en fin de ligne avec un trait d'union, si bien qu'un mot peut se retrouver en deux morceaux, comme infor- et mation.
Pipeline de base
La recette intégrée comporte les quatre étapes ci-dessous.
- Nettoyer caractères invisibles et guillemets — nettoie d'abord les NBSP, caractères de largeur nulle et guillemets courbes qui accompagnent le PDF.
- Réparer les sauts de ligne d'un PDF — garde les lignes vides comme limites de paragraphe et recolle les lignes d'un même paragraphe.
- Réduire les espaces et tabulations répétés — réduit à un seul espace les espaces multiples créés par la justification.
- Supprimer les espaces en bordure — efface les espaces restés en bordure des lignes.
- Nettoyer caractères invisibles et guillemets
- Réparer les sauts de ligne d'un PDF
- Réduire les espaces et tabulations répétés
- Supprimer les espaces en bordure
La réparation des sauts de ligne de PDF relie par un espace les lignes en alphabet latin ou en hangul coréen, et colle sans espace les caractères d'écritures qui ne séparent pas les mots, comme les sinogrammes et les kana japonais. Les lignes qui commencent par une puce ou un numéro, comme -, • ou 1., restent des lignes distinctes : les listes ne sont pas écrasées en un seul bloc.
Ce rapport a été rédigé à partir des résultats de l'enquête du second semestre 2025. - Répondants : 1 204 - Période : novembre
L'entrée ci-dessus devient :
Ce rapport a été rédigé à partir des résultats de l'enquête du second semestre 2025. - Répondants : 1 204 - Période : novembre
En coréen, un espace peut apparaître là où il n'y en avait pas (par exemple 작성 + 되었습니다 devient 작성 되었습니다), et il en va de même pour tout saut de ligne tombé au milieu d'un mot. L'outil ne peut pas savoir si le saut de ligne remplaçait un espace : relisez le résultat.
Mots coupés par un trait d'union
Avec « Recoller les mots coupés par un trait d'union en fin de ligne » activé, les deux morceaux ne sont réunis que si la ligne précédente se termine par une lettre latine et -, et si la ligne suivante commence par une minuscule. Si la ligne suivante commence par une majuscule ou un chiffre, il n'y a pas de fusion : une graphie comme COVID- / 19 reste reliée par un espace. Un mot composé qui avait déjà un trait d'union (long- / term) peut devenir longterm s'il tombe en fin de ligne ; vérifiez dans le résultat.
Quand numéros de page et en-têtes s'en mêlent
En copiant plusieurs pages d'un coup, numéros de page, titre du document, dates et autres en-têtes et pieds de page s'intercalent dans le texte. Si ces lignes sont à l'intérieur d'un paragraphe, elles sont recollées avec le texte ; il faut donc placer le filtre de lignes avant la réparation des sauts de ligne de PDF.
- Ajoutez Filtrer les lignes en tête du pipeline et réglez l'action sur « Supprimer les lignes contenant ».
- Activez « Expression régulière » et saisissez
^\d+$comme texte recherché : les lignes ne contenant que des chiffres (numéros de page) sont supprimées. - S'il y a des espaces autour du numéro, utilisez
^\s*\d+\s*$; pour le format- 12 -, utilisez^\s*-\s*\d+\s*-\s*$. - Pour un en-tête répété, désactivez l'expression régulière et saisissez le texte tel quel (par exemple le titre du document). Vous pouvez avoir plusieurs étapes de filtre.
Si le texte de l'en-tête figure aussi dans une phrase du corps, cette ligne sera supprimée elle aussi : choisissez comme texte recherché une partie propre à l'en-tête.
Attention aux PDF sur deux colonnes
Dans les PDF dont la page est divisée en deux colonnes, comme dans les revues scientifiques, certains lecteurs copient les lignes de la colonne de gauche et de droite en alternance. C'est alors l'ordre même des lignes qui est faux, et aucun nettoyage des sauts de ligne ne peut le corriger. Sélectionnez et copiez une colonne à la fois dans le lecteur, puis collez.
Paragraphes sans ligne vide entre eux
Dans un PDF sans ligne vide entre les paragraphes, toutes les lignes risquent d'être fusionnées en un seul paragraphe. Avec « Ligne courte + ponctuation = fin de paragraphe » activé, une ligne qui se termine par un point ou une ponctuation similaire et qui est nettement plus courte que la plus longue ligne du paragraphe est considérée comme sa fin, et le saut de ligne est conservé. C'est une estimation : une phrase courte qui tombe par hasard en fin de ligne peut provoquer une coupure indue.
Tableaux, notes de bas de page et légendes
Les tableaux d'un PDF, une fois copiés, ressortent souvent avec des cellules séparées uniquement par des espaces ou une cellule par ligne. Si vous les nettoyez avec le texte, les valeurs des cellules se retrouvent reliées comme une phrase ; mieux vaut copier et traiter les tableaux à part. Les appels de note sont copiés comme des chiffres de même taille que le texte et peuvent se coller aux mots, comme dans résultat.3. L'outil ne peut pas distinguer un appel de note d'un nombre du texte : effacez-les à la main là où c'est nécessaire. Une légende de figure insérée entre deux paragraphes sans ligne vide peut être fusionnée avec eux.
Enregistrez vos réglages en recette
Si vous avez modifié le pipeline, par exemple en ajoutant le filtre des numéros de page, donnez-lui un nom et enregistrez-le comme recette. Pour nettoyer plusieurs fois des PDF de même format, comme les rapports d'un même organisme, vous n'aurez pas à reconstruire les étapes. La recette est enregistrée uniquement dans ce navigateur, et le texte collé n'est envoyé à aucun serveur.
Check-list
- Le filtre des numéros de page et en-têtes se place avant l'étape de réparation.
- Les documents sur deux colonnes se copient colonne par colonne.
- Les mots composés à trait d'union et l'espacement (surtout en coréen) se vérifient à l'œil dans le résultat.
Dernière mise à jour: 2026-09-23