PDF Inspector로 정확하게 PDF를 Markdown으로 변환

PDF Inspector는 PDF를 Markdown으로 변환하기 전에 각 페이지를 분석합니다.

읽기 순서, 표, 제목, 목록, 링크, 코드를 보존하고 필요한 경우에만 OCR을 적용합니다.

변환 시작

1

변환할 파일 업로드

Upload your file

Drag and drop or click to select

또는 웹사이트 주소 / 공개 파일 URL 입력

0/3-업그레이드최대 30개

개인정보 보호 및 성능: 파일 처리는 브라우저에서만 실행되므로 파일이 업로드되지 않습니다. 처리 속도는 기기와 브라우저 환경에 따라 달라질 수 있습니다.

PDF를 검사하고 Markdown으로 변환하는 방법

PDF Inspector는 문서 분석과 변환을 결합하여 페이지마다 알맞은 추출 경로를 선택합니다.

기기에서 선택한 파일은 로컬에서 처리되며 다운로드 전에 미리 볼 수 있는 Markdown을 생성합니다.

1

PDF 추가

기기에서 PDF를 선택하거나 공개 파일 URL을 입력한 후 변환 대기열에 추가합니다.

2

페이지 구조 검사

PDF Inspector가 문서 유형, 복잡한 레이아웃, OCR이 필요한 페이지, 글꼴 인코딩 문제를 식별합니다.

3

선택적 OCR로 변환

포함된 텍스트는 직접 변환하고, 자동 OCR을 켠 경우 표시된 스캔 페이지나 이미지 페이지만 OCR로 보냅니다.

4

Markdown 검토 및 다운로드

재구성된 제목, 문단, 목록, 표, 링크, 코드 블록을 미리 본 다음 Markdown 파일로 다운로드합니다.

Markdown 변환 전에 PDF를 검사해야 하는 이유

PDF는 콘텐츠가 페이지 어디에 표시되는지는 설명하지만 Markdown에서 어떤 순서로 읽어야 하는지는 설명하지 않습니다.

PDF Inspector는 추출 방법을 결정하기 전에 화면에 보이는 페이지 뒤의 신호를 검사합니다.

한 파일에 서로 다른 페이지 유형이 포함될 수 있음
디지털 보고서에는 선택 가능한 텍스트, 스캔 부록, 이미지만 있는 삽입 페이지, 혼합 페이지가 함께 있을 수 있습니다. 전체 파일에 하나의 추출 방식만 적용하면 내용을 놓치거나 불필요한 OCR에 시간이 낭비될 수 있습니다.
시각적 순서와 읽기 순서는 다름
PDF 텍스트는 위치가 지정된 조각으로 저장되는 경우가 많습니다. 글꼴과 좌표 정보가 없으면 2단 논문, 사이드바, 캡션, 오른쪽에서 왼쪽으로 읽는 텍스트가 잘못된 순서로 합쳐질 수 있습니다.
표가 데이터로 저장되지 않을 수 있음
많은 PDF는 실제 행과 열 대신 선과 독립적으로 배치된 단어로 표를 그립니다. 재무제표, 각주, 다음 페이지로 이어지는 표를 복원하려면 레이아웃을 고려해야 합니다.
Image 1

PDF Markdown 변환에 PDF Inspector를 사용하는 이유

PDF의 실제 상태를 근거로 처리 방식을 정한 뒤 확인, 편집, 재사용이 쉬운 Markdown을 생성합니다.

문서 전체 OCR 방지
디지털 페이지에는 빠른 기본 텍스트 추출을 사용하고 꼭 필요한 페이지만 OCR로 보내 중복 텍스트와 불필요한 이미지 인식을 줄입니다.
로컬 파일 개인정보 보호
PDF Inspector는 Web Worker 안에서 Rust 파서를 WebAssembly로 실행하므로 기기에서 선택한 PDF가 업로드나 서버 왕복 없이 브라우저에서 처리됩니다.
복잡한 읽기 흐름 보존
위치 인식 추출을 사용하면 PDF 내부 저장 순서로 텍스트 조각을 펼치는 대신 단과 오른쪽에서 왼쪽으로 읽는 문장을 유용한 순서로 Markdown에 반영할 수 있습니다.
표의 의미를 더 많이 보존
그리기 기반 및 정렬 기반 감지는 일반 텍스트 추출기가 여러 줄로 흩어 놓는 테두리 표와 무테 표를 Markdown으로 변환하는 데 도움을 줍니다.
검토하기 쉬운 Markdown 생성
제목, 목록, 코드 블록, 강조, 링크, 표, 페이지 경계를 보존하여 문서 또는 검색 시스템에 넣기 전에 원본과 비교하기 쉽습니다.
가벼운 1차 처리 사용
PDF Inspector 핵심 파서는 Rust로 작성되었고 PDF 파싱에 lopdf를 사용합니다. 텍스트형 페이지에는 ML 모델이 필요 없으며 OCR이 활성화되고 대상 페이지가 배정될 때만 OCR 모델을 불러옵니다.

PDF Inspector 및 PDF Markdown 변환 FAQ

문서 분류, 구조화 추출, OCR, 개인정보 보호, 변환 제한에 관한 명확한 답변입니다.