このプロジェクトについて
Umi-OCR は、無料・オープンソースのオフライン文字認識(OCR)ソフトウェアで、Windows 7 x64 と Linux x64 プラットフォームに対応しています。このプロジェクトは、解凍してすぐに使え、ネットワーク接続が不要で、多言語のオフライン認識ライブラリを内蔵していることを強調しています。
主な機能:
- スクリーンショットOCR:ホットキーでスクリーンショットを起動し、画像内の文字を認識します。画像貼り付けによる認識にも対応し、認識記録は編集・複数選択コピーが可能です。
- テキスト後処理:複数のレイアウト解析方式を提供し、複数段組みレイアウトの自動認識、自然段落での改行、インデント保持などに対応し、横書き・縦書き(右から左)のレイアウトもサポートします。
- バッチOCR:jpg、png、webp、bmp、tif などの一般的な画像形式のバッチ取り込みに対応し、結果は txt、jsonl、md、csv(Excel) にエクスポート可能で、数量上限はなく、タスク完了後の自動シャットダウンまたはスタンバイにも対応します。
- 無視領域:バッチ認識中に矩形枠を描画して、透かしやロゴなどの干渉文字を除外できます。
- 文書認識:pdf、xps、epub、mobi、fb2、cbz などの形式に対応し、スキャン文書からテキストを抽出したり、二層の検索可能なPDFを出力したりでき、無視領域でヘッダー・フッターを除外することも可能です。
- QRコード:QRコード・バーコードの読み取りと生成に対応し、19種類のプロトコルをカバーし、1画像複数コードや誤り訂正レベルの設定にも対応します。
- グローバル設定:インターフェース言語、テーマ、フォントサイズの切り替え、OCRプラグインの切り替え、レンダラーの調整によるスクリーンショットのちらつきやUIのずれの問題の解決が可能です。
呼び出し方法:コマンドラインマニュアルとHTTPインターフェースマニュアルを提供し、外部プログラムとの統合を容易にします。
対応するオフラインOCRエンジンには、PaddleOCR-json と RapidOCR-json が含まれ、実行環境はカスタマイズ版の PyStand に基づいています。プロジェクトは Weblate プラットフォームを使用してインターフェースのローカライズ翻訳協力を行い、多言語インターフェースをサポートしています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.