PDF Inspector para convertir PDF a Markdown con precisión

PDF Inspector analiza cada página antes de convertir el PDF a Markdown.

Conserva un orden de lectura útil, tablas, títulos, listas, enlaces y código, y aplica OCR selectivo cuando es necesario.

Iniciar conversión

1

Subir archivo para convertir

Upload your file

Drag and drop or click to select

o desde la URL de un sitio web / archivo público

0/3-Actualizara 30

Privacidad y rendimiento: El procesamiento de archivos se realiza íntegramente en su navegador, por lo que los archivos no se suben. La velocidad puede variar según el dispositivo y el entorno del navegador.

Cómo inspeccionar y convertir un PDF a Markdown

PDF Inspector combina el análisis del documento con la conversión para que cada página siga la ruta de extracción adecuada.

Los archivos seleccionados desde tu dispositivo se procesan localmente y generan un Markdown que puedes revisar antes de descargar.

1

Añade tu PDF

Selecciona un PDF de tu dispositivo o indica la URL pública de un archivo y añádelo a la cola de conversión.

2

Inspecciona la estructura de las páginas

Deja que PDF Inspector identifique el tipo de documento, los diseños complejos, las páginas que necesitan OCR y los posibles problemas de codificación de fuentes.

3

Convierte con OCR selectivo

Convierte directamente el texto incrustado y, al activar el OCR automático, envía a OCR solo las páginas escaneadas o basadas en imágenes que se hayan marcado.

4

Revisa y descarga el Markdown

Previsualiza los títulos, párrafos, listas, tablas, enlaces y bloques de código reconstruidos y descarga el resultado como archivo Markdown.

Por qué un PDF debe inspeccionarse antes de convertirlo a Markdown

Un PDF describe dónde aparece el contenido en la página, no cómo debe leerse en Markdown.

PDF Inspector examina las señales ocultas tras la página visual antes de decidir cómo extraer el contenido.

Un archivo puede contener distintos tipos de página
Un informe digital puede incluir texto seleccionable, anexos escaneados, páginas que solo contienen imágenes y páginas mixtas. Aplicar un único método de extracción a todo el archivo puede omitir contenido o malgastar tiempo en OCR innecesario.
El orden visual no es el orden de lectura
El texto de un PDF suele almacenarse como fragmentos posicionados. Sin el contexto de las fuentes y las coordenadas, los artículos a dos columnas, las barras laterales, los pies de imagen y los pasajes de derecha a izquierda pueden unirse en un orden incorrecto.
Las tablas pueden no existir como datos
Muchos PDF dibujan las tablas mediante líneas y palabras colocadas de forma independiente, en lugar de guardar filas y columnas. Los estados financieros, las notas al pie y las tablas que continúan en otras páginas necesitan una reconstrucción sensible al diseño.
Image 1

El proceso de conversión de PDF Inspector

PDF Inspector carga el documento una sola vez y comparte el mismo análisis entre la inspección y la extracción, de modo que las decisiones por página coincidan con el Markdown resultante.

En lugar de suponer que todas las páginas son iguales, combina la clasificación del PDF, el análisis espacial del texto, la recuperación de estructura y el enrutamiento opcional a OCR.

Por qué usar PDF Inspector para convertir PDF a Markdown

Empieza con indicios reales del PDF y genera un Markdown más fácil de verificar, editar y reutilizar.

Evita aplicar OCR a todo el documento
Mantén la extracción nativa rápida para las páginas digitales y reserva el OCR para aquellas que de verdad lo necesiten, reduciendo el texto duplicado y el reconocimiento de imágenes innecesario.
Mantén la privacidad de los archivos locales
PDF Inspector ejecuta su analizador Rust como WebAssembly dentro de un Web Worker, por lo que los PDF elegidos en tu dispositivo se procesan en el navegador sin subir archivos ni hacer un viaje de ida y vuelta al servidor.
Conserva flujos de lectura complejos
La extracción sensible a la posición ayuda a que Markdown siga las columnas y los pasajes de derecha a izquierda en un orden útil, en vez de aplanar cada fragmento según el orden de almacenamiento interno.
Conserva mejor el significado de las tablas
La detección basada en dibujos y alineaciones permite llevar a Markdown tablas con y sin bordes, incluidos diseños que un extractor de texto simple dispersaría entre varias líneas.
Crea Markdown fácil de revisar
Los títulos, listas, bloques de código, énfasis, enlaces, tablas y límites de página facilitan comparar el resultado con el original antes de incorporarlo a sistemas de documentación o recuperación.
Utiliza una primera fase ligera
El analizador principal de PDF Inspector está escrito en Rust, utiliza lopdf para analizar PDF y no necesita un modelo ML para las páginas de texto; el modelo OCR solo se carga cuando OCR está activo y una página se envía a esa ruta.

Preguntas frecuentes sobre PDF Inspector y PDF a Markdown

Respuestas claras sobre clasificación de documentos, extracción estructurada, OCR, privacidad y límites de conversión.