『Build a Large Language Model (From Scratch)』の公式コードリポジトリ。GPT系モデルの事前学習と微調整を段階的にPyTorchで実装し、ノートブックと演習を提供。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONlabml.aiは60以上のPyTorch実装を公開しており、各論文・アルゴリズムに解説を付した教育コンテンツ。Transformer、拡散モデル、GAN、強化学習、オプティマイザ、アーキテクチャなどをカバー。
fastaiはPyTorchベースのディープラーニングライブラリであり、迅速な開発を可能にするハイレベルコンポーネントと、研究やカスタマイズのためのローレベルコンポーネントの両方を提供します。
ComfyUIは、最先端のオープンソースおよびクローズドソースモデルを使用して、画像、ビデオ、オーディオ、3Dモデルを生成するための、視覚的なノードグラフインターフェースを備えたモジュール式AI制作エンジンです。
Keras 3は、JAX、TensorFlow、PyTorch、またはOpenVINOを使用してモデルの構築とトレーニングが可能なマルチバックエンド対応のディープラーニングフレームワークです。
データロード、可視化、データセット管理のためのモデルに依存しないビルディングブロックを提供する、コンピュータビジョン向けの包括的なツールキットです。
DocsGPTは、ドキュメント分析、マルチモデル対応、エンタープライズ検索機能を備えた、インテリジェントなエージェントやアシスタントを構築するためのオープンソースAIプラットフォームです。
PlanckGPTは、一般消費者向けノートPCでゼロから学習できる約5.4億パラメータの小型GPT言語モデルです。Fineweb-eduで事前学習し、チャット微調整も可能です。
Cogは機械学習モデルを本番環境対応のDockerコンテナにパッケージ化するオープンソースツールで、CUDA互換性を自動処理し、Pythonの型定義からHTTP推論APIを生成する。
ONNX Runtimeは、PyTorch、TensorFlow、scikit-learnなどのモデルをサポートする、機械学習の推論およびトレーニング向けのクロスプラットフォーム・アクセラレータです。
PyroはPyTorch上に構築された柔軟でスケーラブルな深層確率プログラミングライブラリであり、普遍的な確率モデルと自動推論をサポートします。
vLLMは、大規模言語モデル(LLM)の推論とサービング向けに設計された、高スループットでメモリ効率の高いライブラリです。
Gradioライブラリを使用して実装されたStable Diffusion向けの包括的なウェブインターフェースであり、AI画像生成と編集のための幅広いツールを提供します。
YOLO11やSAM 3など61本のコンピュータビジョンチュートリアル集。物体検出、セグメンテーション、OCRなどをカバーし、Google Colabなどで直接実行可能。
timmは、PyTorch用の画像モデル、レイヤー、オプティマイザー、スケジューラー、データローダー、学習/評価スクリプトを集めた大規模なコレクションであり、ResNet、EfficientNet、ViT、ConvNeXt、Swinなどの多くの事前学習済みバックボーンを提供します。
EasyOCRは、80以上の言語と主要な文字体系をサポートする、すぐに使える光学文字認識ライブラリです。シンプルなPython APIとCLIを備え、PyTorchベースの検出・認識モデルに加え、カスタムトレーニングのオプションも提供します。
VoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
Xinferenceは、言語・音声・マルチモーダルモデルの提供に対応した統合推論ライブラリです。OpenAI互換RESTful API、異種GPU/CPU活用、分散配置を提供し、LangChain、LlamaIndex、Dify、Chatboxと連携します。
Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。
UL-SMFは、長文脈Transformer推論向けKVキャッシュ圧縮フレームワークであり、FSQと16次元潜在マッピングにより最大384倍の圧縮を主張しています。中核の圧縮ロジックは、プロプライエタリなクローズドソースバイナリを必要とします。