OPEN SOURCE, OPEN TO EVERYONE

オープンソース。新しい可能性。

優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。

編集部選定 · 良いオープンソースを発見4109発見済み

好奇心とともに、オープンソースの世界へ。

THE FIRST COLLECTION
Topic: ocr清除
tesseracttesseract-ocr
新着

Tesseractは、100以上の言語で画像内のテキストを認識するためのコマンドラインツールとライブラリを提供するオープンソースのOCRエンジンです。

人工知能開発ツールMultimodal AI
paperless-ngxpaperless-ngx
新着

Paperless-ngxは、物理的なドキュメントを検索可能なオンラインアーカイブに変換し、ペーパーレス化を実現するドキュメント管理システムです。

ゲームGame servers
新着

許可された YouTube 動画を中文字幕付きにローカライズし、B 站への投稿をサポートする Python ツール。音声文字起こし、OCR 認識、LLM 翻訳、ハードサブタイトルレンダリングに対応。

音楽Audio editing
skill_seekersyusufkaraaslan
新着

Skill Seekersはドキュメント、GitHubリポジトリ、PDF、動画などを構造化された知識資産に変換し、Claude、Gemini、OpenAI向けのAI SkillsやRAGパイプライン、AIコーディングアシスタントを構築するCLIツール。

音楽DAW & production
pageledgerpeterbussch
新着

PageLedgerは、監査可能なページ単位のOCRおよび文書抽出のためのPython CLIライブラリです。抽出された各ページの来歴、品質シグナル、予算を記録し、再開可能な実行、レビューキュー、人間参加型検証による再実行をサポートします。

開発ツール人工知能CLI & terminal
mineruopendatalab
新着

MinerUは、PDF、画像、DOCX、PPTX、XLSXをLLM、RAG、エージェントワークフロー向けの構造化Markdown/JSONに変換するオープンソースの文書解析エンジンです。VLM+OCRのデュアルエンジン、109言語のOCR、プライベート/オフライン展開をサポートします。

人工知能開発ツールRAG & knowledge
新着

Tesseract.jsは、100以上の言語で画像からテキストを抽出するJavaScript OCRライブラリです。WebAssemblyを介してブラウザで実行され、Node.jsでも動作し、Tesseractエンジンをラップしますが、認識モデルは変更しません。

開発ツール人工知能Component libraries
easyocrJaidedAI
新着

EasyOCRは、80以上の言語と主要な文字体系をサポートする、すぐに使える光学文字認識ライブラリです。シンプルなPython APIとCLIを備え、PyTorchベースの検出・認識モデルに加え、カスタムトレーニングのオプションも提供します。

人工知能開発ツールMultimodal AI
dolphinbytedance
新着

ByteDanceのオープンソース文書画像解析モデル(ACL 2025)。PDFや撮影済みページをMarkdown/JSONへ変換し、レイアウト、読み順、テキスト、表、数式、コードを扱う。

人工知能生産性Multimodal AI
新着

X-AnyLabelingは、画像・動画・テキスト・マルチモーダルデータのAI支援アノテーションに対応する軽量なクロスプラットフォームデスクトップアプリです。多数の深層学習モデルや多様な描画・タスク機能、COCO/VOC/YOLOなど多形式の入出力、Windows/Linux/macOSでの利用に対応します。

人工知能開発ツールTraining & evaluation
aksharamdK2alyan
新着

AksharaMDは、ドキュメントパーサーがソースファイルをAI対応Markdownへ変換した品質を文書単位で評価するローカル動作のツールです。準備スコア、ブロックレベルの出典タグ、警告コード、ソース基盤のACCEPT/REJECT判定を提供します。

人工知能開発ツールRAG & knowledge
umi-ocrhiroi-sora
新着

Umi-OCR は無料・オープンソースのオフラインOCR文字認識ツールで、スクリーンショット認識、バッチ画像取り込み、PDF文書認識、QRコードスキャン・生成に対応し、多言語認識ライブラリを内蔵、コマンドラインとHTTPインターフェース呼び出しも提供します。

生産性人工知能Utilities
ocrmypdfocrmypdf
新着

OCRmyPDF は、スキャンされた PDF ファイルに検索可能な OCR テキストレイヤーを追加し、検証済みの PDF/A 出力を生成するコマンドライン ツールです。Tesseract を使用して 100 種類以上の言語を認識し、傾き補正と回転補正をサポートし、Linux、macOS、Windows、FreeBSD で動作します。

生産性自動化Utilities
bobripperhe
新着

BobはmacOS用の翻訳・OCRツール。メニューバーから划詞、スクリーンショット、入力による翻訳やOCR、QRコード認識などをサポート。多様な翻訳・OCRサービスに対応し、オフライン機能や音声合成も利用可能。

生産性人工知能Utilities
新着

AurexTranslatorは、WindowsおよびLinux(X11/XWayland)用のクロスプラットフォームリアルタイム翻訳ツールです。OCRでキャプチャしたテキスト、クリップボードからコピーしたテキスト、またはゲームプロセスから直接フックしたテキストを翻訳します。

生産性ゲームUtilities
新着

VSEはローカルで動作する動画用ハード字幕抽出ツール。ディープラーニングで字幕領域を検出しOCRでテキスト認識、SRT/TXT字幕を生成。87言語対応、バッチ処理、GPUアクセラレーション対応、サードパーティAPI不要。

動画・映像メディア人工知能Subtitles & animation
paddleocrPaddlePaddle
新着

PaddleOCRは、PDFや画像をLLM対応の構造化データ(JSON/Markdown)に変換するオープンソースOCRツールキット。PP-OCRv6による多言語(100+言語)文字認識、PaddleOCR-VLによる文書解析、PP-StructureV3によるレイアウト対応変換をサポート。CPU、GPU、各種AIアクセラレータに対応。

人工知能開発ツールMultimodal AI