Text being extracted from a PDF into a Word documentDOCX

PDF en Word : extrayez un texte éditable sans envoyer votre fichier

Extrait le texte d’un PDF vers un .docx que vous pouvez modifier. Fonctionne entièrement dans votre navigateur. Il ne reproduit pas la mise en page d’origine, et il vous le dit avant le téléchargement.

🔒 100 % dans le navigateur📝 Extraction de texte🔍 Détecte les numérisations Sans inscription
🔒

Votre PDF n’est jamais envoyé

L’analyse et l’écriture du .docx se font toutes deux dans votre navigateur. Aucune copie serveur à supprimer, aucun délai de conservation auquel se fier.

🔍

Numérisations détectées d’emblée

Une numérisation n’a aucun texte à extraire sans OCR. Nous vérifions au dépôt et vous le disons, au lieu de produire un fichier Word vide sans explication.

👁️

Voyez-le avant de télécharger

Contrairement à tous les autres outils PDF en Word que nous avons examinés, l’aperçu montre exactement ce qui a été récupéré, avec le nombre de titres et de listes qui ont été inférés plutôt que lus.

📄

Mode texte brut

L’inférence de structure peut se tromper. Un clic la désactive entièrement et vous donne un texte propre et continu, sans titres promus à tort.

Pourquoi convertir PDF en Word est plus difficile qu’il n’y paraît

Convertir Word en PDF est un problème de rendu : prendre une mise en page décrite et la dessiner. PDF en Word est l’inverse, et l’inverse n’est pas symétrique. Faire le chemin en sens contraire est un problème de reconstruction, et reconstruire est bien plus difficile que dessiner.

Un PDF stocke des glyphes, pas des phrases

Un fichier PDF n’enregistre ni paragraphes ni titres. Il enregistre des instructions pour dessiner des caractères individuels à des coordonnées précises — convertir un PDF en Word revient donc à rétroconcevoir la structure à partir de données de position.

Un fichier Word dit « ceci est un Titre 1 contenant le texte Rapport trimestriel ». Un PDF dit « prends la police F2 en corps 22, va en x=72 y=782, affiche les glyphes R-a-p-p-o-r-t ». Rien dans le fichier ne le marque comme un titre. Il faut le déduire du fait qu’il est plus grand que tout ce qui l’entoure.

Pourquoi les paragraphes doivent être rétroconçus

Le texte arrive en fragments positionnés par coordonnées, souvent coupés en plein mot et fréquemment sans les espaces entre les mots. Retrouver une prose lisible signifie regrouper les fragments en lignes selon leur position verticale, insérer des espaces là où les écarts horizontaux le suggèrent, puis décider quels retours à la ligne sont des retours automatiques et lesquels sont des fins de paragraphe.

Chacune de ces étapes est une heuristique. Les nôtres sont documentées et testées, mais restent des suppositions, et cette page indique quelles parties du résultat sont des suppositions au lieu de tout présenter comme des faits.

Le problème des documents numérisés

Un PDF numérisé contient des images de texte, pas du texte. Sans OCR, aucune analyse ne fera réapparaître les mots.

C’est la déception la plus courante avec n’importe quel convertisseur PDF en Word, et la raison pour laquelle tant de gens concluent que ces outils ne fonctionnent tout simplement pas. Vous déposez un contrat numérisé par un collègue, et vous récupérez un fichier Word qui ne contient rien — généralement sans la moindre explication.

Ce que fait l’OCR et pourquoi cet outil n’en a pas

La reconnaissance optique de caractères regarde l’image et détermine quelles formes correspondent à quelles lettres. C’est une technologie réellement différente de la lecture d’une couche de texte, elle est comparativement lente, et une version dans le navigateur imposerait d’expédier un modèle de reconnaissance à chaque visiteur.

Nous faisons donc la meilleure chose suivante : détecter la situation et la dire clairement, dans la première chose que vous voyez après avoir déposé le fichier. La détection tient compte du fait qu’une page numérisée est rarement complètement vide — les scanners impriment des numéros de page et une OCR partielle laisse des résidus — si bien qu’une page ne contenant qu’une poignée de caractères est traitée comme une numérisation plutôt que comme du texte.

Ce que cet outil PDF en Word fait réellement

C’est un extracteur de texte, pas un convertisseur de mise en page. Il récupère les mots d’un PDF dans un fichier Word éditable. Il ne reproduit pas la conception d’origine des pages.

Extraction de texte ou conversion de mise en page

Les deux choses que l’on entend par « PDF en Word » sont très différentes. La conversion de mise en page tente de reconstruire le document : les tableaux en tableaux, les colonnes en colonnes, les images à leur place. Cela exige soit un moteur commercial, soit une lourde machinerie côté serveur, et les bonnes implémentations sont toutes côté serveur.

L’extraction de texte récupère les mots, l’ordre de lecture et autant de structure élémentaire qu’il est possible d’inférer avec confiance. Pour un grand nombre de tâches réelles — citer une clause, réutiliser un paragraphe, sortir des chiffres d’un rapport — c’est tout le travail.

À qui cet outil s’adresse — et à qui il ne s’adresse pas

Utilisez-le si vous voulez extraire le texte d’un PDF pour le modifier, le citer ou le réutiliser, et que vous préférez que votre document ne soit pas envoyé sur le serveur d’un inconnu.

Ne l’utilisez pas si le fichier Word doit ressembler au PDF, si le document est riche en tableaux, ou s’il s’agit d’une numérisation. Ces cas sont traités plus bas, avec ce qu’il faut utiliser à la place.

Extraire le texte d’un PDF en 3 étapes

1

Déposez votre PDF

Faites glisser un PDF dans la zone ci-dessus, ou cliquez pour le sélectionner. Il est lu directement du disque vers votre navigateur — sans étape d’envoi, un gros document démarre donc immédiatement au lieu d’attendre votre connexion.

2

Vérifiez l’aperçu d’extraction

Dès que le fichier est lu, vous voyez ce qui a réellement été récupéré, combien de titres et d’éléments de liste ont été inférés, et si des pages semblent numérisées ou multicolonnes. C’est volontairement placé avant le téléchargement, pour que vous puissiez renoncer sans perdre de temps sur un fichier qui n’allait de toute façon pas fonctionner.

3

Téléchargez votre DOCX

Exportez un fichier Word standard qui s’ouvre dans Word, Google Docs, LibreOffice ou Pages. Si les titres inférés semblent erronés, activez le mode texte brut et exportez à nouveau — cela prend une seconde et ignore toute interprétation.

Ce que l’extraction PDF en Word récupère — et ce qu’elle ne récupère pas

Chaque outil PDF en Word trace cette limite quelque part. La plupart ne vous montrent simplement jamais où.

Extrait de manière fiable

Le corps du texte. L’ordre de lecture, pour les documents à colonne unique. Le gras et l’italique, déduits des noms des polices embarquées. Le texte visible des hyperliens.

Pour un rapport, un courrier ou un article ordinaire, c’est en pratique l’intégralité du contenu.

Inféré — et parfois erroné

Les niveaux de titre, les limites de paragraphe et les listes à puces ou numérotées. Ils sont dérivés de la géométrie plutôt que lus dans le fichier, et l’aperçu les étiquette comme inférés précisément pour cette raison.

Comment les niveaux de titre sont devinés à partir de la taille de police

Nous prenons la hauteur de glyphe la plus fréquente du document comme corps de texte, puis promouvons tout ce qui est nettement plus grand : 1,6× ou plus devient Titre 1, 1,35× devient Titre 2, 1,15× devient Titre 3.

La taille la plus fréquente plutôt que la moyenne, délibérément — une moyenne est tirée vers le haut par un grand titre, qui ne serait alors plus reconnu comme titre du tout. La référence est aussi calculée sur l’ensemble du document, afin qu’une page de titre entièrement composée en grand corps ne fausse pas toutes les pages suivantes.

Les documents qui signalent leurs titres par la graisse ou la couleur plutôt que par la taille ne les verront pas détectés. C’est une vraie limite, et le mode texte brut existe pour cela.

Non pris en charge

Les tableaux ressortent en texte libre plutôt qu’en tableaux. Les images ne sont pas transférées. Les en-têtes, pieds de page et numéros de page sont extraits comme du texte ordinaire, là où ils se trouvaient. La mise en page précise, le positionnement, les polices et les tailles ne sont pas reproduits du tout.

Tableaux, images et pages numérisées

Les pages multicolonnes sont détectées et signalées plutôt qu’entrelacées en silence, car l’ordre de lecture entre colonnes est réellement ambigu — un article scientifique sur deux colonnes peut se lire colonne par colonne ou de gauche à droite, et le fichier ne dit pas lequel.

Les pages numérisées ne produisent rien, et sont signalées comme telles avant l’export.

Les capacités d’extraction en un coup d’œil

ÉlémentÉtatRemarques
Corps du texteFiableRécupéré depuis la couche de texte
Ordre de lecture (colonne unique)FiableRegroupé par position de ligne
Gras et italiqueFiableDéduits des noms des polices embarquées
Texte des hyperliensFiableLe texte visible, pas la cible
Niveaux de titreInféréD’après la taille de police relative ; peut être erroné
Limites de paragrapheInféréD’après les écarts verticaux entre lignes
Listes à puces et numérotéesInféréD’après les marqueurs de tête et le retrait
Ordre de lecture multicolonneInféréDétecté et signalé, pas réordonné
TableauxNon pris en chargeRestitués en texte libre
ImagesNon pris en chargeNon transférées dans le fichier Word
En-têtes et pieds de pageNon pris en chargeApparaissent comme du texte ordinaire
Mise en page et policesNon pris en chargeNon reproduites
Pages numériséesNon pris en chargeNécessite l’OCR ; détecté et signalé

À quoi sert l’extraction PDF en Word

Les usages réalistes de l’extraction PDF en Word partagent tous la même forme : vous voulez les mots, pas la mise en page.

Citer des contrats et des rapports

Recopier à la main une clause exacte depuis un PDF invite les erreurs de transcription précisément dans le type de document où les erreurs comptent. L’extraction vous donne la formulation mot pour mot — et pour un contrat, le fait qu’il n’ait jamais quitté votre machine n’est pas un détail.

Réutiliser le texte d’articles scientifiques

Les PDF universitaires sont le cas d’école de cet outil, et aussi le cas d’école de ses limites : le texte ressort proprement, mais les articles sur deux colonnes seront signalés, car l’ordre de lecture y est réellement ambigu. Extrayez, puis réordonnez à la main.

Sortir des données de factures

Les lignes de facture vivent dans des tableaux, qui ressortent en texte libre plutôt qu’en grille. C’est tout de même plus rapide que de tout retaper, et les chiffres arrivent exactement tels qu’imprimés.

Recycler d’anciens documents

Retransformer une vieille brochure ou un ancien manuel PDF en copie éditable concerne généralement les mots, pas la mise en page — la mise en page est de toute façon en train d’être remplacée.

Pourquoi la confidentialité compte ici

Les documents dont on veut le plus extraire le texte — contrats, courriers médicaux, relevés financiers — sont ceux qu’on devrait le moins vouloir envoyer. Le traitement local supprime la question au lieu d’y répondre.

Quand utiliser plutôt un convertisseur côté serveur

Si vous avez besoin de…UtilisezPourquoi
Tableaux conservés en tableauxAdobe, Smallpdf ou Word lui-mêmeExige une reconstruction de la mise en page
Un fichier Word qui ressemble au PDFUn convertisseur commercialNous ne reproduisons pas la mise en page
Le texte d’un document numériséUn outil OCRAucune couche de texte à lire
Les images transféréesUn convertisseur commercialNon extraites ici
Juste les mots, en toute confidentialitéCet outilRien n’est envoyé
Modifier et citer du texteCet outilTexte et structure élémentaire suffisent

Après PDF en Word : modifier, reconvertir et partager

PDF en Word est rarement la dernière étape. Une fois le texte dans Word et vos modifications faites, le reconvertir est la suite naturelle — notre convertisseur Word en PDF fonctionne lui aussi entièrement dans votre navigateur, si bien que l’aller-retour ne touche jamais un serveur.

Si votre matière première est répartie sur plusieurs PDF, fusionnez-les d’abord et extrayez une seule fois, plutôt que d’extraire plusieurs fois et de recoudre les résultats dans Word.

Tout ici suit la même règle : vos fichiers restent sur votre machine. Le reste de la série se trouve sur notre page outils PDF gratuits, et les outils d’image sur tous nos outils de navigateur gratuits.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Un fichier Word note que quelque chose est un titre. Un PDF note seulement que des caractères ont été dessinés à des coordonnées — voilà pourquoi la structure doit être devinée.

Trois étapes, sans compte et sans envoi

Step one: drop a PDF onto the page.pdf
1

Déposez un PDF. Il est lu localement, dans votre navigateur.

Step two: compare the original page with what was extractedOriginalExtracted
2

Vérifiez ce qui a réellement été récupéré avant de télécharger.

Step three: download the editable Word documentDOCX
3

Exportez un .docx standard, modifiable partout.

Ce que cet extracteur récupère, devine et ne sait pas faire

La plupart des convertisseurs se présentent comme si le résultat allait ressembler à l’original. Celui-ci n’y ressemblera pas, et prétendre le contraire ne ferait que vous faire perdre du temps. Voici le détail réel.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
Un PDF numérisé contient des images de texte, pas du texte. Nous le détectons au dépôt et vous le disons, plutôt que de vous remettre un document vide.

PDF en Word — questions fréquentes

Oui, sans plafond. L’extraction s’exécute sur votre propre matériel : il n’y a donc aucun coût par fichier à répercuter. Pas de quota quotidien, pas de filigrane, pas d’offre payante.

Non. Le PDF est lu dans la mémoire du navigateur et le .docx y est écrit également. Ouvrez les outils de développement et observez l’onglet Réseau pendant l’extraction — rien n’est envoyé.

Parce qu’une numérisation contient une image du texte plutôt que du texte, et que la lire exige de l’OCR, dont cet outil de navigateur ne dispose pas. Nous détectons les numérisations au dépôt du fichier et vous le disons avant l’export, pour que vous ne restiez pas dans le doute. Utilisez un outil OCR pour ces documents.

Non, et nous préférons le dire clairement plutôt que vous le laisser découvrir après téléchargement. Ici, PDF en Word signifie le texte, pas la mise en page. C’est un extracteur de texte : vous obtenez les mots, l’ordre de lecture, le gras et l’italique, ainsi que des titres et des listes inférés. La mise en page, les polices, les tableaux et les images ne sont pas reproduits.

Non. Les cellules ressortent en texte libre dans l’ordre de lecture, pas en tableau Word. Reconstruire la structure d’un tableau à partir de coordonnées de glyphes est assez peu fiable pour qu’un texte réorganisable soit plus utile qu’un tableau subtilement faux.

Oui. L’extraction porte sur l’ensemble du document, et vous pouvez restreindre l’export à une plage de pages avant de construire le fichier Word.

Adobe exécute PDF en Word sur ses serveurs avec un moteur commercial et reproduit la mise en page bien mieux que nous. Il exige aussi l’envoi de votre document. Si la mise en page compte, utilisez Adobe. Si ce sont les mots et la confidentialité qui comptent, utilisez cet outil.

Le modifier dans Word, Google Docs, LibreOffice ou Pages — c’est un .docx standard. Une fois terminé, reconvertissez-le en PDF avec notre outil Word en PDF, qui fonctionne lui aussi dans votre navigateur.

T

Équipe technique TinyImagePro

Nous concevons des outils de fichiers qui fonctionnent dans le navigateur et n’envoient jamais vos données. Cet extracteur PDF en Word utilise pdf.js pour lire la couche de texte, une passe d’inférence développée sur mesure pour reconstruire paragraphes et titres à partir des coordonnées des glyphes, et la bibliothèque docx pour écrire le fichier Word — le tout sur votre machine.

À propos de TinyImagePro