PDF Inspector pour convertir précisément un PDF en Markdown

PDF Inspector analyse chaque page avant de convertir le PDF en Markdown.

Il préserve un ordre de lecture cohérent, les tableaux, titres, listes, liens et blocs de code, avec un OCR sélectif si nécessaire.

Démarrer la conversion

1

Téléverser le fichier à convertir

Upload your file

Drag and drop or click to select

ou depuis l'URL d'un site web / fichier public

0/3-Mettre à niveauà 30

Confidentialité et performances: Le traitement des fichiers s’effectue entièrement dans votre navigateur : les fichiers ne sont donc pas téléversés. La vitesse peut varier selon votre appareil et l’environnement du navigateur.

Comment inspecter et convertir un PDF en Markdown

PDF Inspector associe l’analyse du document à sa conversion afin que chaque page suive la méthode d’extraction appropriée.

Les fichiers sélectionnés sur votre appareil sont traités localement et produisent un Markdown que vous pouvez prévisualiser avant de le télécharger.

1

Ajoutez votre PDF

Sélectionnez un PDF sur votre appareil ou indiquez l’URL publique d’un fichier, puis ajoutez-le à la file de conversion.

2

Inspectez la structure des pages

Laissez PDF Inspector identifier le type de document, les mises en page complexes, les pages qui nécessitent un OCR et les éventuels problèmes d’encodage des polices.

3

Convertissez avec un OCR sélectif

Convertissez directement le texte incorporé et, si l’OCR automatique est activé, dirigez uniquement les pages numérisées ou composées d’images qui ont été signalées vers l’OCR.

4

Vérifiez et téléchargez le Markdown

Prévisualisez les titres, paragraphes, listes, tableaux, liens et blocs de code reconstruits, puis téléchargez le résultat au format Markdown.

Pourquoi inspecter un PDF avant de le convertir en Markdown

Un PDF décrit où le contenu apparaît sur la page, et non la façon dont il doit être lu en Markdown.

PDF Inspector examine les signaux cachés derrière la page affichée avant de décider comment en extraire le contenu.

Un fichier peut contenir plusieurs types de pages
Un rapport numérique peut réunir du texte sélectionnable, des annexes numérisées, des insertions uniquement composées d’images et des pages mixtes. Appliquer une seule méthode d’extraction à tout le fichier peut omettre du contenu ou consacrer inutilement du temps à l’OCR.
L’ordre visuel n’est pas l’ordre de lecture
Le texte d’un PDF est souvent stocké sous forme de fragments positionnés. Sans le contexte des polices et des coordonnées, les articles sur deux colonnes, encadrés, légendes et passages de droite à gauche peuvent être assemblés dans le mauvais ordre.
Les tableaux ne sont pas toujours stockés comme des données
De nombreux PDF dessinent un tableau avec des lignes et des mots placés indépendamment plutôt que d’enregistrer de véritables lignes et colonnes. Les états financiers, notes de bas de page et tableaux poursuivis sur plusieurs pages nécessitent une reconstruction sensible à la mise en page.
Image 1

Le pipeline de conversion de PDF Inspector

PDF Inspector charge le document une seule fois et partage la même analyse entre l’inspection et l’extraction, ce qui maintient la cohérence entre les décisions prises par page et le Markdown obtenu.

Au lieu de supposer que toutes les pages se ressemblent, il associe classification du PDF, analyse spatiale du texte, récupération de la structure et routage facultatif vers l’OCR.

Pourquoi utiliser PDF Inspector pour convertir un PDF en Markdown

Commencez par des indices concrets sur le PDF, puis produisez un Markdown plus facile à vérifier, modifier et réutiliser.

Évitez l’OCR systématique
Conservez l’extraction native rapide pour les pages numériques et réservez l’OCR aux pages qui en ont réellement besoin afin de réduire les doublons de texte et la reconnaissance d’images inutile.
Préservez la confidentialité des fichiers locaux
PDF Inspector exécute son analyseur Rust en WebAssembly dans un Web Worker. Les PDF sélectionnés sur votre appareil sont donc traités dans le navigateur sans téléversement ni aller-retour vers un serveur.
Conservez les parcours de lecture complexes
L’extraction sensible à la position aide Markdown à suivre les colonnes et les passages de droite à gauche dans un ordre utile au lieu d’aplatir tous les fragments selon leur ordre de stockage interne.
Conservez davantage de sens dans les tableaux
La détection fondée sur le dessin et l’alignement permet de convertir en Markdown les tableaux avec ou sans bordures, y compris les présentations qu’un simple extracteur de texte disperserait sur plusieurs lignes.
Créez un Markdown facile à contrôler
Les titres, listes, blocs de code, emphases, liens, tableaux et limites de pages facilitent la comparaison avec la source avant l’intégration dans un système documentaire ou de recherche.
Utilisez une première passe légère
Le cœur de PDF Inspector est un analyseur écrit en Rust qui s’appuie sur lopdf pour traiter les PDF. Il ne nécessite aucun modèle ML pour les pages textuelles ; le modèle OCR n’est chargé que si l’OCR est actif et qu’une page lui est adressée.

FAQ sur PDF Inspector et la conversion de PDF en Markdown

Des réponses claires sur la classification des documents, l’extraction structurée, l’OCR, la confidentialité et les limites de conversion.