Tesseractは、100以上の言語で画像内のテキストを認識するためのコマンドラインツールとライブラリを提供するオープンソースのOCRエンジンです。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONPaperless-ngxは、物理的なドキュメントを検索可能なオンラインアーカイブに変換し、ペーパーレス化を実現するドキュメント管理システムです。
許可された YouTube 動画を中文字幕付きにローカライズし、B 站への投稿をサポートする Python ツール。音声文字起こし、OCR 認識、LLM 翻訳、ハードサブタイトルレンダリングに対応。
Skill Seekersはドキュメント、GitHubリポジトリ、PDF、動画などを構造化された知識資産に変換し、Claude、Gemini、OpenAI向けのAI SkillsやRAGパイプライン、AIコーディングアシスタントを構築するCLIツール。
PageLedgerは、監査可能なページ単位のOCRおよび文書抽出のためのPython CLIライブラリです。抽出された各ページの来歴、品質シグナル、予算を記録し、再開可能な実行、レビューキュー、人間参加型検証による再実行をサポートします。
MinerUは、PDF、画像、DOCX、PPTX、XLSXをLLM、RAG、エージェントワークフロー向けの構造化Markdown/JSONに変換するオープンソースの文書解析エンジンです。VLM+OCRのデュアルエンジン、109言語のOCR、プライベート/オフライン展開をサポートします。
Tesseract.jsは、100以上の言語で画像からテキストを抽出するJavaScript OCRライブラリです。WebAssemblyを介してブラウザで実行され、Node.jsでも動作し、Tesseractエンジンをラップしますが、認識モデルは変更しません。
EasyOCRは、80以上の言語と主要な文字体系をサポートする、すぐに使える光学文字認識ライブラリです。シンプルなPython APIとCLIを備え、PyTorchベースの検出・認識モデルに加え、カスタムトレーニングのオプションも提供します。
ByteDanceのオープンソース文書画像解析モデル(ACL 2025)。PDFや撮影済みページをMarkdown/JSONへ変換し、レイアウト、読み順、テキスト、表、数式、コードを扱う。
X-AnyLabelingは、画像・動画・テキスト・マルチモーダルデータのAI支援アノテーションに対応する軽量なクロスプラットフォームデスクトップアプリです。多数の深層学習モデルや多様な描画・タスク機能、COCO/VOC/YOLOなど多形式の入出力、Windows/Linux/macOSでの利用に対応します。
AksharaMDは、ドキュメントパーサーがソースファイルをAI対応Markdownへ変換した品質を文書単位で評価するローカル動作のツールです。準備スコア、ブロックレベルの出典タグ、警告コード、ソース基盤のACCEPT/REJECT判定を提供します。
Umi-OCR は無料・オープンソースのオフラインOCR文字認識ツールで、スクリーンショット認識、バッチ画像取り込み、PDF文書認識、QRコードスキャン・生成に対応し、多言語認識ライブラリを内蔵、コマンドラインとHTTPインターフェース呼び出しも提供します。
OCRmyPDF は、スキャンされた PDF ファイルに検索可能な OCR テキストレイヤーを追加し、検証済みの PDF/A 出力を生成するコマンドライン ツールです。Tesseract を使用して 100 種類以上の言語を認識し、傾き補正と回転補正をサポートし、Linux、macOS、Windows、FreeBSD で動作します。
BobはmacOS用の翻訳・OCRツール。メニューバーから划詞、スクリーンショット、入力による翻訳やOCR、QRコード認識などをサポート。多様な翻訳・OCRサービスに対応し、オフライン機能や音声合成も利用可能。
AurexTranslatorは、WindowsおよびLinux(X11/XWayland)用のクロスプラットフォームリアルタイム翻訳ツールです。OCRでキャプチャしたテキスト、クリップボードからコピーしたテキスト、またはゲームプロセスから直接フックしたテキストを翻訳します。
VSEはローカルで動作する動画用ハード字幕抽出ツール。ディープラーニングで字幕領域を検出しOCRでテキスト認識、SRT/TXT字幕を生成。87言語対応、バッチ処理、GPUアクセラレーション対応、サードパーティAPI不要。
PaddleOCRは、PDFや画像をLLM対応の構造化データ(JSON/Markdown)に変換するオープンソースOCRツールキット。PP-OCRv6による多言語(100+言語)文字認識、PaddleOCR-VLによる文書解析、PP-StructureV3によるレイアウト対応変換をサポート。CPU、GPU、各種AIアクセラレータに対応。