dolphinbytedance
新着ByteDanceのオープンソース文書画像解析モデル(ACL 2025)。PDFや撮影済みページをMarkdown/JSONへ変換し、レイアウト、読み順、テキスト、表、数式、コードを扱う。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONByteDanceのオープンソース文書画像解析モデル(ACL 2025)。PDFや撮影済みページをMarkdown/JSONへ変換し、レイアウト、読み順、テキスト、表、数式、コードを扱う。
Umi-OCR は無料・オープンソースのオフラインOCR文字認識ツールで、スクリーンショット認識、バッチ画像取り込み、PDF文書認識、QRコードスキャン・生成に対応し、多言語認識ライブラリを内蔵、コマンドラインとHTTPインターフェース呼び出しも提供します。
OCRmyPDF は、スキャンされた PDF ファイルに検索可能な OCR テキストレイヤーを追加し、検証済みの PDF/A 出力を生成するコマンドライン ツールです。Tesseract を使用して 100 種類以上の言語を認識し、傾き補正と回転補正をサポートし、Linux、macOS、Windows、FreeBSD で動作します。
BobはmacOS用の翻訳・OCRツール。メニューバーから划詞、スクリーンショット、入力による翻訳やOCR、QRコード認識などをサポート。多様な翻訳・OCRサービスに対応し、オフライン機能や音声合成も利用可能。
AurexTranslatorは、WindowsおよびLinux(X11/XWayland)用のクロスプラットフォームリアルタイム翻訳ツールです。OCRでキャプチャしたテキスト、クリップボードからコピーしたテキスト、またはゲームプロセスから直接フックしたテキストを翻訳します。