日本語

ニュース

オープンソースのPDFパーサー「papero」が、機械学習モデルを使わずに構造化データを抽出

この記事は翻訳です。 原文を読む

Beatriz Almeida氏は、スピードと構造的な正確性を重視して設計されたオープンソースのPDFテキスト抽出ツール「papero」をリリースしました。現代的な多くのソリューションとは異なり、paperoは機械学習モデルではなくプレーンな幾何学的手法に依存しているため、ノートPCのCPU上でも効率的に動作させることができます。

このツールは、Markdown、JSON、Word、Excel、HTMLを含む複数の形式でコンテンツを抽出します。特に、読書順序、表、数式(LaTeX形式)、図の位置など、検索拡張生成(RAG)およびLLMの前処理に必要な構造要素をターゲットとしています。

Paperoは、Pythonライブラリ(pip install papero-extract)、コマンドラインインターフェース(CLI)、REST APIを含む複数の統合方法を提供しています。また、pdf.jsをベースとしたブラウザ型アプリケーションも備えており、ユーザーはPDFをローカルマシンから出すことなく、ドキュメントブロックのインスペクトやファイルの書き出しを行うことができます。

スキャンされたドキュメントについては、TesseractによるOCRをサポートしています。また、Apache Tikaを活用することで、DOCX、PPTX、XLSX、EPUBなどの様々なファイル形式を処理できます。この抽出ツールのパフォーマンスは、複数カラムのarXiv論文のような複雑なレイアウトにおいても、ブロック検出において高い速度と精度を維持できることで注目されています。

出典

  1. Lightweight PDF parser with layout, tables, formulas and bounding boxes (Hacker News Frontpage, 2026-10-01)
  2. 公式サイト