핵심 요약
- 무거운 딥러닝 모델 없이 CPU와 순수 기하학 알고리즘만으로 PDF의 레이아웃, 표, 수식을 추출하는 오픈소스 'papero'가 공개되었습니다.
- 다단 문서의 읽기 순서 유지, LaTeX 수식 변환, 바운딩 박스 좌표 보존 등을 지원해 RAG 및 LLM 문서 파이프라인에 최적화되어 있습니다.
- 외부 서버 전송 없이 브라우저나 로컬 파이썬 환경에서 즉시 구동되며 마크다운, 워드, 엑셀 등 다양한 포맷 변환을 지원합니다.
요약 무거운 딥러닝 모델이나 거대한 스택 없이도 순수 기하학 연산과 CPU만으로 PDF의 복잡한 구조를 완벽에 가깝게 복원해내는 오픈소스 도구 'papero'가 개발자 커뮤니티에서 주목을 받고 있습니다.
일반적으로 PDF에서 단순 텍스트를 추출하는 것은 간단하지만, 2단이나 3단 논문의 읽기 순서(reading order) 파악, 표(테이블) 추출, 수식 인식 등 문서의 구조를 보존하는 작업은 주로 대규모 머신러닝 모델이나 무거운 클라우드 파이프라인에 의존해 왔습니다. 반면 papero는 기하학적 블록 판별 알고리즘을 활용해 일반 노트북 CPU 환경이나 브라우저 내에서도 초고속으로 작동하는 것이 가장 큰 특징입니다. 사용자의 파일이 외부 서버로 전송되지 않고 로컬 브라우저에서 안전하게 처리됩니다.
이 도구는 머리글·바닥글·페이지 번호·반복되는 로고를 자동으로 배제하고 컬럼별 읽기 순서를 유지하며, 선이 없거나 복잡한 LaTeX 스타일의 표도 행과 열을 온전히 살려 CSV나 엑셀로 추출합니다. 수식의 경우 분수, 제곱근, 위첨자·아래첨자 등을 수학 기호로 판별해 LaTeX 코드로 변환하는 동시에 수식 영역을 크롭한 이미지까지 함께 제공합니다. 또한 각 블록의 바운딩 박스(위치 좌표)를 유지해 LLM이나 RAG(검색 증강 생성) 시스템에서 인용 출처의 정확한 위치를 시각화할 수 있도록 지원합니다.
파이썬 패키지(pip install papero-extract)나 CLI 명령어는 물론, 별도 설치 없이 브라우저에서 바로 파일을 끌어다 놓아 마크다운, JSON, 워드(.docx), 엑셀 등으로 내보낼 수 있는 웹 앱도 제공됩니다. 스캔본의 경우 Tesseract OCR을 지원하며, 전체 폴더를 RAG용 데이터셋으로 일괄 변환하고 문서 누락이나 변환 충실도를 점검해주는 리포트 기능까지 포함되어 있어 문서 파싱 작업에 큰 편의를 제공할 것으로 보입니다.
Sponsored · 광고