PageLedgerは、監査可能なページ単位のOCRおよび文書抽出のためのPython CLIライブラリです。抽出された各ページの来歴、品質シグナル、予算を記録し、再開可能な実行、レビューキュー、人間参加型検証による再実行をサポートします。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONYOLO11やSAM 3など61本のコンピュータビジョンチュートリアル集。物体検出、セグメンテーション、OCRなどをカバーし、Google Colabなどで直接実行可能。
RunAnywhereは、スマートフォン、ブラウザ、デスクトップ、サーバーにわたって、AIモデルを完全にオンデバイスで実行するためのクロスプラットフォームSDKスイートです。LLM、ビジョン、音声、ボイスエージェント、RAG、エンベディング、画像生成を単一のセマンティックAPIでサポートします。
Hugging Face Transformersは、テキスト、ビジョン、オーディオ、マルチモーダルタスクに対応した機械学習用モデル定義フレームワークです。100万以上の学習済みチェックポイントを備え、推論と学習のための統一APIを提供します。
SGLangは、低遅延かつ高スループットな推論を実現するために設計された、大規模言語モデル(LLM)およびマルチモーダルモデル向けの高性能サービングフレームワークです。
PixelRAGは文書をスクリーンショットとしてレンダリングし、画像上で直接検索することで、テキスト解析では失われる表やグラフなどの視覚構造を保持する。ホスト型の828万ページのWikipediaインデックス、CLIツール、Claude Code統合を含む。
TARSはByteDanceのマルチモーダルAIエージェントスタックで、Agent TARS(CLI/Web UI、MCPツールとブラウザ制御を統合)とUI-TARS Desktop(ビジョン言語モデルでコンピュータを操作するネイティブGUIエージェント)の2つのプロジェクトを提供する。