Text being extracted from a PDF into a Word documentDOCX

PDF a Word: extrae texto editable sin subir tu archivo

Saca el texto de un PDF a un .docx que puedes editar. Funciona íntegramente en tu navegador. No reproduce la maquetación original, y te lo dice antes de descargar.

🔒 100% en el navegador📝 Extracción de texto🔍 Detecta escaneos Sin registro
🔒

Tu PDF nunca se sube

El análisis y la escritura del .docx ocurren en tu navegador. No hay copia en un servidor que borrar ni plazo de conservación en el que confiar.

🔍

Los archivos escaneados se detectan de entrada

Un escaneo no tiene texto que extraer sin OCR. Lo comprobamos al soltar el archivo y te lo decimos, en lugar de producir un archivo de Word en blanco sin explicación.

👁️

Míralo antes de descargar

A diferencia de todas las demás herramientas de PDF a Word que hemos analizado, la vista previa muestra exactamente qué se recuperó, junto con cuántos títulos y listas se infirieron en lugar de leerse.

📄

Modo texto plano

La inferencia de estructura puede fallar. Un clic la desactiva por completo y te da texto corrido limpio, sin títulos promovidos por error.

Por qué convertir PDF a Word es más difícil de lo que parece

Convertir Word a PDF es un problema de renderizado: tomar una maquetación descrita y dibujarla. PDF a Word es lo contrario, y lo contrario no es simétrico. Ir en la otra dirección es un problema de reconstrucción, y reconstruir es mucho más difícil que dibujar.

El PDF guarda glifos, no frases

Un archivo PDF no registra párrafos ni títulos. Registra instrucciones para dibujar caracteres individuales en coordenadas concretas, y por eso convertir PDF a Word significa hacer ingeniería inversa de la estructura a partir de datos de posición.

Un archivo de Word dice «esto es un Título 1 con el texto Informe trimestral». Un PDF dice «usa la fuente F2 a 22 puntos, muévete a x=72 y=782, muestra los glifos I-n-f-o-r-m-e». Nada en el archivo lo marca como título. Hay que deducirlo del hecho de que es más grande que todo lo que lo rodea.

Por qué los párrafos hay que reconstruirlos por ingeniería inversa

El texto llega como fragmentos en coordenadas, a menudo partidos en mitad de una palabra y muchas veces sin los espacios entre palabras. Recuperar prosa legible significa agrupar fragmentos en líneas por su posición vertical, insertar espacios donde los huecos horizontales los sugieren y decidir después qué saltos de línea son ajustes de línea y cuáles son límites de párrafo.

Cada uno de esos pasos es una heurística. Las nuestras están documentadas y probadas, pero siguen siendo conjeturas, y esta página marca qué partes del resultado son conjeturas en lugar de presentarlo todo como un hecho.

El problema de los documentos escaneados

Los PDF escaneados contienen imágenes de texto, no texto. Sin OCR, ningún análisis recuperará las palabras.

Esta es, con diferencia, la decepción más común con cualquier convertidor de PDF a Word, y la razón por la que tanta gente concluye que estas herramientas simplemente no funcionan. Sueltas un contrato que escaneó un compañero y recibes un archivo de Word que no contiene nada, normalmente sin explicación alguna.

Qué hace el OCR y por qué esta herramienta no lo tiene

El reconocimiento óptico de caracteres mira la imagen y averigua qué formas son qué letras. Es una tecnología genuinamente distinta de leer una capa de texto, es comparativamente lenta, y una versión de navegador implicaría enviar un modelo de reconocimiento a cada visitante.

Así que hacemos lo mejor posible después de eso: detectar la situación y decirlo con claridad, en lo primero que ves tras soltar el archivo. La detección tiene en cuenta que las páginas escaneadas rara vez están completamente vacías —los escáneres estampan números de página y el OCR parcial deja restos—, así que una página con solo un puñado de caracteres se trata como un escaneo y no como texto.

Qué hace realmente esta herramienta de PDF a Word

Esto es un extractor de texto, no un convertidor de maquetación. Recupera las palabras de un PDF en un archivo de Word editable. No reproduce el diseño original de la página.

Extracción de texto frente a conversión de maquetación

Las dos cosas que la gente entiende por PDF a Word son bastante distintas. La conversión de maquetación intenta reconstruir el documento: tablas como tablas, columnas como columnas, imágenes en su sitio. Eso requiere un motor comercial o una gran maquinaria en servidor, y las buenas implementaciones son todas de servidor.

La extracción de texto toma las palabras, el orden de lectura y toda la estructura básica que pueda inferirse con confianza. Para muchísimas tareas reales —citar una cláusula, reutilizar un párrafo, sacar cifras de un informe— eso es todo el trabajo.

Para quién es esto y para quién no

Úsalo si quieres sacar el texto de un PDF para editarlo, citarlo o reutilizarlo, y prefieres que tu documento no se suba al servidor de un desconocido.

No lo uses si necesitas que el archivo de Word se parezca al PDF, si el documento está lleno de tablas o si es un escaneo. Esos casos se tratan más abajo, junto con qué usar en su lugar.

Cómo extraer el texto de un PDF en 3 pasos

1

Suelta tu PDF

Arrastra un PDF al recuadro de arriba o haz clic para buscarlo. Se lee directamente del disco a tu navegador: no hay subida, así que un documento grande empieza al instante en lugar de esperar a tu conexión.

2

Revisa la vista previa de extracción

En cuanto se lee el archivo, ves qué se ha recuperado de verdad, cuántos títulos y elementos de lista se han inferido, y si alguna página parece escaneada o a varias columnas. Esto ocurre deliberadamente antes de la descarga, para que puedas marcharte sin perder tiempo con un archivo que nunca iba a funcionar.

3

Descarga tu DOCX

Exporta un archivo de Word estándar que se abre en Word, Google Docs, LibreOffice o Pages. Si los títulos inferidos parecen incorrectos, activa el modo texto plano y exporta de nuevo: tarda un segundo y omite toda la interpretación.

Qué consigue la extracción de PDF a Word y qué no

Toda herramienta de PDF a Word traza esta línea en algún punto. La mayoría, sencillamente, nunca te enseña dónde.

Se extrae de forma fiable

El texto del cuerpo. El orden de lectura, en documentos a una columna. Negrita y cursiva, deducidas de los nombres de las fuentes incrustadas. El texto visible de los hipervínculos.

Para un informe, una carta o un artículo corrientes, esto es en la práctica todo el contenido.

Se infiere, y a veces se equivoca

Los niveles de título, los límites de párrafo y las listas con viñetas o numeradas. Se derivan de la geometría en lugar de leerse del archivo, y la vista previa los etiqueta como inferidos exactamente por esa razón.

Cómo se adivinan los niveles de título a partir del tamaño de fuente

Tomamos la altura de glifo más común del documento como tamaño del cuerpo y promovemos todo lo que sea significativamente mayor: 1,6× o más pasa a Título 1, 1,35× a Título 2 y 1,15× a Título 3.

El tamaño más común y no la media, deliberadamente: una media se ve arrastrada hacia arriba por un título grande, que entonces dejaría de reconocerse como título. La línea base también se calcula sobre el documento entero, de modo que una portada compuesta enteramente en letra grande no distorsiona todas las páginas siguientes.

Los documentos que señalan los títulos con grosor o color en lugar de tamaño no los tendrán detectados. Es una limitación real, y el modo texto plano existe para eso.

No se admite

Las tablas salen como texto suelto en lugar de como tablas. Las imágenes no se trasladan. Encabezados, pies y números de página se extraen como texto normal allí donde estuvieran. La maquetación exacta, el posicionamiento, las fuentes y los tamaños no se reproducen en absoluto.

Tablas, imágenes y páginas escaneadas

Las páginas a varias columnas se detectan y se señalan en lugar de intercalarse en silencio, porque el orden de lectura entre columnas es genuinamente ambiguo: un artículo académico a dos columnas puede leerse columna a columna o de lado a lado de la página, y el archivo no dice cuál.

Las páginas escaneadas no producen nada, y se informa de ello antes de exportar.

La capacidad de extracción de un vistazo

ElementoEstadoNotas
Texto del cuerpoFiableSe recupera de la capa de texto
Orden de lectura (una columna)FiableAgrupado por posición de línea
Negrita y cursivaFiableDeducidas de los nombres de fuente incrustados
Texto de hipervínculosFiableEl texto visible, no el destino
Niveles de títuloInferidoPor tamaño de fuente relativo; puede fallar
Límites de párrafoInferidoPor los huecos verticales entre líneas
Listas con viñetas y numeradasInferidoPor marcadores iniciales y sangría
Orden de lectura a varias columnasInferidoSe detecta y se señala, no se reordena
TablasNo se admiteSalen como texto suelto
ImágenesNo se admiteNo se trasladan al archivo de Word
Encabezados y piesNo se admiteAparecen como texto normal
Maquetación y fuentesNo se admiteNo se reproducen
Páginas escaneadasNo se admiteRequieren OCR; se detectan y se informa

Para qué puedes usar la extracción de PDF a Word

Los usos realistas de la extracción de PDF a Word comparten una misma forma: quieres las palabras, no el diseño.

Citar contratos e informes

Sacar una cláusula exacta de un PDF tecleándola de nuevo invita a errores de transcripción justo en el tipo de documento donde los errores importan. La extracción te da la redacción literal, y para un contrato, que nunca haya salido de tu máquina no es un detalle menor.

Reutilizar texto de artículos académicos

Los PDF académicos son el caso clásico de esta herramienta y también el caso clásico de sus límites: el texto sale limpio, pero los artículos a dos columnas se señalarán, porque el orden de lectura es genuinamente ambiguo. Extrae y luego reordena a mano.

Sacar datos de facturas

Las líneas de una factura viven en tablas, que salen como texto suelto en lugar de como una cuadrícula. Aun así es más rápido que teclearlas, y las cifras llegan exactamente como estaban impresas.

Reaprovechar documentos antiguos

Convertir un viejo folleto o manual en PDF de vuelta a texto editable suele ir de las palabras, no del diseño: el diseño normalmente se va a sustituir de todos modos.

Por qué la privacidad importa aquí

Los documentos de los que la gente más quiere extraer texto —contratos, cartas médicas, extractos financieros— son los documentos que menos debería querer subir. Procesar en local elimina la pregunta en lugar de responderla.

Cuándo deberías usar un convertidor en servidor

Si necesitas…UsaPor qué
Tablas conservadas como tablasAdobe, Smallpdf o el propio WordRequiere reconstruir la maquetación
Que el archivo de Word se parezca al PDFUn convertidor comercialNo reproducimos la maquetación
Texto de un documento escaneadoUna herramienta con OCRNo existe capa de texto que leer
Que las imágenes se trasladenUn convertidor comercialAquí no se extraen
Solo las palabras, en privadoEsta herramientaNo se sube nada
Editar y volver a citar textoEsta herramientaTexto y estructura básica bastan

Después de PDF a Word: edita, convierte de vuelta y comparte

PDF a Word rara vez es el último paso. Una vez que el texto está en Word y lo has editado, convertirlo de vuelta es el paso natural: nuestro convertidor de Word a PDF también funciona íntegramente en tu navegador, así que el viaje de ida y vuelta nunca toca un servidor.

Si tu material de partida está repartido en varios PDFs, combínalos primero y extrae una sola vez, en lugar de extraer varias veces y coser los resultados en Word.

Todo lo de aquí sigue la misma regla: tus archivos se quedan en tu máquina. El resto del conjunto está en nuestra página de herramientas PDF gratuitas, y las de imagen en todas nuestras herramientas de navegador.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Un archivo de Word registra que algo es un título. Un PDF registra solo que se dibujaron caracteres en unas coordenadas; por eso la estructura hay que adivinarla.

Tres pasos, sin cuenta y sin subir nada

Step one: drop a PDF onto the page.pdf
1

Suelta un PDF. Se lee localmente, en tu navegador.

Step two: compare the original page with what was extractedOriginalExtracted
2

Comprueba qué se ha recuperado de verdad antes de comprometerte con la descarga.

Step three: download the editable Word documentDOCX
3

Exporta un .docx estándar que puedes editar en cualquier parte.

Qué recupera este extractor, qué adivina y qué no puede hacer

La mayoría de los convertidores se describen como si el resultado fuera a coincidir con el original. Este no lo hará, y fingir lo contrario solo te haría perder el tiempo. Aquí tienes el desglose real.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
Los PDF escaneados contienen imágenes de texto, no texto. Lo detectamos al soltar el archivo y te lo decimos, en lugar de entregarte un documento vacío.

PDF a Word: preguntas frecuentes

Sí, y sin límite. La extracción se ejecuta en tu propio hardware, así que no hay un coste por archivo que repercutir. Sin cuota diaria, sin marca de agua y sin plan de pago.

No. El PDF se lee en la memoria del navegador y el .docx se escribe allí mismo. Abre las herramientas de desarrollo y observa la pestaña Red mientras extraes: no se envía nada.

Porque un escaneo contiene una imagen de texto en lugar de texto, y leerla requiere OCR, algo que esta herramienta de navegador no tiene. Detectamos los escaneos al soltar el archivo y te lo decimos antes de exportar, para que no te quedes con la duda. Usa una herramienta con OCR para esos documentos.

No, y preferimos decirlo con claridad antes que dejar que lo descubras tras descargar. Aquí, PDF a Word significa texto, no diseño. Esto es un extractor de texto: obtienes las palabras, el orden de lectura, negrita y cursiva, y títulos y listas inferidos. La maquetación, las fuentes, las tablas y las imágenes no se reproducen.

No. Las celdas de las tablas salen como texto suelto en orden de lectura, no como una tabla de Word. Reconstruir la estructura de una tabla a partir de coordenadas de glifos es tan poco fiable que entregar texto que puedes reorganizar resulta más útil que una tabla sutilmente equivocada.

Sí. La extracción recorre el documento entero, y puedes restringir la exportación a un rango de páginas antes de generar el archivo de Word.

Adobe ejecuta PDF a Word en sus servidores con un motor comercial y reproduce la maquetación mucho mejor que nosotros. También exige subir tu documento. Si la maquetación importa, usa Adobe. Si importan las palabras y la privacidad, usa esto.

Editarlo en Word, Google Docs, LibreOffice o Pages: es un .docx estándar. Cuando termines, conviértelo de vuelta a PDF con nuestra herramienta de Word a PDF, que también funciona en tu navegador.

T

Equipo técnico de TinyImagePro

Creamos herramientas de archivos que funcionan en el navegador y nunca suben tus datos. Este extractor de PDF a Word usa pdf.js para leer la capa de texto, una pasada de inferencia construida a medida para reconstruir párrafos y títulos a partir de coordenadas de glifos, y la librería docx para escribir el archivo de Word, todo en tu máquina.

Sobre TinyImagePro