有限状態トランスデューサと制約文法に基づく、コミ・ジリャーン語の形態素解析器、校正ツール、言語リソース。GiellaLTプロジェクトの一部。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONLangExtractは、LLMを活用して非構造化テキストから構造化情報を抽出するGoogleのPythonライブラリです。抽出結果をソーステキストの正確な位置にグラウンディングし、対話型HTMLビジュアライゼーションを生成します。
このリポジトリには、フィンランド語の形態素解析器、校正ツール、辞書を構築するための有限状態ソースファイルが含まれています。GiellaLTオープンソース多言語インフラプロジェクトの一部であり、GPLv3ライセンスで提供されています。
ベンガル語NLPリソースのコミュニティ管理カタログ。712件の論文、63件のデータセット、20件のモデル、9件のツールを13タスクにわたり収録。Astro製静的サイトで、厳格なデータ検証と共有可能なフィルタを備える。
TextBlobは、Python用の自然言語処理ライブラリで、感情分析、品詞タグ付け、名詞句抽出、分類、トークン化などをシンプルなAPIで提供し、NLTKとpatternに基づいています。
大规模中文自然语言处理语料库。维基百科、新闻、百科问答、社区问答、中英翻译等数百万至千万级高质量数据集,用于大模型预训练、词向量、文本分类、问答及机器翻译等任务。
Batchalign3は、CHATトランスクリプトの作成と拡充のためのTalkBankオーディオおよびMLパイプラインであり、ASR、強制アライメント、ニューラル形態論タグ付け、翻訳、発話セグメンテーションをカバーしています。CLI、Pythonパッケージ、PyO3ブリッジ、Reactダッシュボード、実験的なTauriデスクトップシェルを提供します。
PlanckGPTは、一般消費者向けノートPCでゼロから学習できる約5.4億パラメータの小型GPT言語モデルです。Fineweb-eduで事前学習し、チャット微調整も可能です。
微舆(BettaFish)は、ゼロから実装したマルチエージェント世論分析システム。AIクローラークラスター、マルチモーダル分析、フォーラム協調メカニズム、インテリジェントレポート生成により、情報の茧房を打破し、世論の実態を再現し、将来の動向を予測して意思決定を支援します。国内外30以上の主要SNSに対応し、プライベートデータベースへの接続も可能。純Pythonモジュール設計でDockerワンクリック導入をサポート。
『AI Engineering from Scratch』は、APIラッパーではなく第一原理からAIエンジニアリングを教える無料・MITライセンスのカリキュラム兼リファレンスマニュアル。20フェーズ・523レッスン(約342時間)で、Python・TypeScript・Rust・Juliaによる実装を収録。各レッスンは数学ベースの自作、フレームワーク利用、再利用成果物の作成で構成され、AIチューター機能やClaude認定試験対策も備える。
生成AIを形作った107の重要な研究論文を、要約・学習ロードマップ・用語集・意思決定ガイドとともに体系的に整理した厳選リポジトリ。高度なAI研究を誰にでもアクセスしやすくする教育リソースです。
純Python製の科学計算プラットフォーム。量子、ML、統計、ODEソルバーなど22モジュールを提供し、ランタイム依存ゼロ。検証と再現性のため、任意でNumPy/SciPyアダプタを利用可能。
HaqumeiはRustで実装された日本語の書記素から音素への変換(G2P)ライブラリで、PythonバインディングとCLIツールを備え、韻律情報付きの正確な変換、単語-音素マッピング、音声合成フロントエンド向け機能を提供する。
オープンソースの中国語LLaMA・Alpaca大規模言語モデルプロジェクト。元のLLaMAに中国語語彙を追加し再事前学習を行い、命令調整モデル、LoRA重み、学習・量子化・デプロイスクリプトを提供。ローカルCPU/GPUでの実行に対応。
NLTKは、自然言語処理(NLP)の研究および開発をサポートするために設計された、オープンソースのPythonモジュール、データセット、およびチュートリアルの包括的なスイートです。
SpellKitは、Rust製SymSpell実装を備えた高速で安全なRuby gemです。サブミリ秒のレイテンシ、正規表現による用語保護、ホットリロード可能な辞書、ゼロ依存を特徴とします。複数インスタンス、スキップパターンをサポートし、検索語抽出に実戦投入可能です。
txtaiはセマンティック検索、LLMオーケストレーション、複合な言語モデルワークフローを構築するための包括的なAIフレームワークです。ベクトルインデックス、グラフネットワーク、リレーショナルデータベースを統合した埋め込みデータベースを中核に据えています。
Swift Tokenizersは、Hugging FaceのRust製tokenizersクレートをラップした高性能Swiftパッケージで、トークン化のみに特化しHub依存がない。macOS、iOS、Linuxをサポートし、エンコード、デコード、ストリーミング逆トークン化、チャットテンプレート、ツール呼び出しを提供する。
HanLPは、本番環境向けの多言語自然言語処理ツールキットであり、PyTorchとTensorFlow 2.xをベースに、分かち書き、品詞タグ付け、固有表現認識、構文解析、意味解析などのタスクをサポートし、RESTfulとローカルの2種類のAPIを提供します。
Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。