Cet outil extrait le texte d'un PDF et vous le remet sous forme de document modifiable. Il utilise PDF.js pour lire les objets texte que le fichier contient déjà — chaque caractère avec sa position sur la page — puis les regroupe en lignes en comparant leurs coordonnées verticales. Le résultat est écrit soit en .doc compatible Word, soit en .txt brut.
Il vaut mieux fixer les attentes avec précision, car « PDF vers Word » promet plus qu'aucun convertisseur ne peut tenir. Un PDF décrit où se pose chaque glyphe sur une page ; il ne consigne pas qu'une suite de texte était un titre, une liste à puces, une cellule de tableau ou une mise en page à deux colonnes. Reconstituer cette structure relève de la devinette, et cet outil s'en abstient. Vous obtenez le texte, dans l'ordre de lecture, sous forme de paragraphes — un point de départ propre pour réécrire plutôt qu'une réplique fidèle.
Le texte est extrait et le document assemblé dans votre navigateur. Rien n'est téléversé, contrairement aux services de conversion qui exigent que vous leur confiiez le fichier.
.doc qu'ouvrent Word, Google Docs et LibreOffice. Texte brut produit un .txt sans aucune mise en forme.| Élément | Résultat |
|---|---|
| Corps de texte | Extrait fidèlement, dans l'ordre de lecture |
| Sauts de paragraphe | Reconstitués à partir des positions de ligne |
| Sauts de page | Préservés |
| Titres et styles | Perdus — tout devient du corps de texte |
| Tableaux | Aplatis en lignes de texte |
| Images et graphiques | Non inclus |
| Colonnes | Lues dans l'ordre interne du fichier, parfois entremêlées |
Un document numérisé contient des photographies de pages, pas des objets texte. Cet outil n'a rien à extraire et signalera qu'aucun texte n'a été trouvé. Utilisez plutôt l'outil OCR, qui reconnaît visuellement les caractères et produit un fichier texte exploitable.
Vous pouvez faire la différence dans n'importe quel lecteur PDF : essayez de sélectionner une phrase à la souris. Si un curseur de texte apparaît et que des mots se surlignent, ce convertisseur fonctionnera. Si vous n'obtenez qu'une sélection rectangulaire sur toute la page, c'est une numérisation.
Parce qu'un PDF stocke des positions de glyphes, pas une structure de document. Rien n'indique qu'un élément était un titre, un tableau ou une liste : aucun convertisseur ne peut donc le restituer de façon fiable. Cet outil extrait le texte fidèlement et vous laisse la mise en forme.
Votre fichier est presque certainement une numérisation — des images de pages sans couche de texte. Utilisez l'outil OCR, qui reconnaît visuellement les caractères.
Non. Les cellules d'un tableau ne sont que du texte positionné dans un PDF : elles ressortent en lignes ordinaires. Les tableaux complexes doivent généralement être refaits à la main.
Le .doc conserve les sauts de paragraphe et de page et s'ouvre dans Word, Google Docs et LibreOffice. Le .txt est du texte pur sans aucune structure — utile pour alimenter un autre logiciel.
Non. Seule la couche de texte est extraite. Si vous voulez les pages sous forme d'images, utilisez PDF vers JPG.
Non. PDF.js lit le texte dans votre navigateur et le fichier de sortie est assemblé localement avant téléchargement.