このプロジェクトについて
edge-llm-benchは、実機上で動作するローカルLLMエンジン向けの中立的で再現可能なベンチマークハーネスであり、単発の測定キャンペーンではなく継続的に実行されるよう設計されています。対象はmacOS、iOS、Androidのハードウェアです。
対象エンジンにはLiteRT-LM、llama.cpp、MLX、Apple Core AI、Cactusが含まれ、すべてのバージョンピンはenvironment.lock.jsonに記録されます。参照されるデバイスにはMac Studio(M4 Max)、iPhone 17 Pro、Pixel 8a、Galaxy S26が含まれます。すべての結果は単一のスキーマ(schema/result.v1.json)、単一の蓄積レイヤー、単一のリーダーボード形式を共有します。
リポジトリにはパイプライン、すべての生キャプチャ記録、機械可読な回帰判定が同梱されていますが、クロスランタイムの順位は意図的に公開していません。ユーザーは同梱の生データからbuild_summary.pyとrender_leaderboard.pyを使ってローカルで独自のリーダーボードをレンダリングし、gitignore対象のLEADERBOARD.mdを生成します。
主要コマンドにはrelease-watch(上流リリースをピン留めバージョンと比較)、matrix(ベンチマーク構成のセルファイルを実行)、regress(エンジンバージョンをベースラインと比較)が含まれます。モデルの追加はセルファイルへの1行で済みます。
各実行はレコードごとにschema-v1 JSONとその生コンソールログをresults/raw/以下に出力します。派生CSVはresults/summary/に置かれ、回帰判定はresults/regression-reports/以下にJSONとして永続化されます。CIはこれらの整合性を保ちます。
セットアップ手順はプラットフォームごとに異なります。MacレーンはHomebrew、ベンダリングされたエンジン用のブートストラップスクリプト、CLIビルドを使用します。Androidレーンはリリースページのビルド済みエンジンバイナリを使用し、bazel/NDKビルドを回避します。iPhoneレーンはXcode署名とGUI専用のメモリエンタイトルメントを必要とし、最も重いセットアップとなります。
公平性と誠実性のメカニズムは中心的な機能です。各行は量子化やエンジンピンを含むレシピを記録します。異なるレシピでの高速な数値は異なるデプロイプロファイルを表すためです。試行のばらつきが大きい場合、そのセルはスコアリングされずUNRELIABLEとマークされます。失敗した実行、クラッシュ、OOMは理由とともにテーブルに残ります。セッション間の差分はセッションアンカーを通じて正規化されます。予算やモードが一致しない場合はスコアリングを拒否します。MacとiPhoneのキャプチャは、実行が高温で開始した場合やばらつきが大きい場合に自動的に隔離され、一度再試行されます。
カバレッジはmeasured(保存されたキャプチャが存在)、wired(ピン留めバージョンでビルドされるがキャプチャはまだない)、または理由を明記したn/aとして追跡されます。LiteRT-LMは4デバイスすべてで測定され、llama.cppはAndroidデバイスで測定され、MLXとCore AIはApple専用で、CactusはMac版がなくAndroidサポートは計画中です。開示されたギャップには、Android LiteRT NPUがEarly Accessのみであること、Android llama.cppが公式CPUリリースバイナリを使用していること、Android v1にウォームレジームとTTFT測定が欠けていることが含まれます。
耐久タスク(endurance-chat-30m)は単一ターンの速度ではなく持続的な挙動を測定します。1つのエンジンプロセス、KVキャッシュが蓄積される1つの会話、固定の12プロンプトスクリプト、ネイティブのターンあたり256トークン上限を使用します。各ターンはデコードレート、KV占有率、メモリ、熱状態、退化を記録します。ターン37でのクラッシュはターン1〜36を証拠として保持します。セッションは4つの判定を導出します。デコード減衰、メモリ傾斜、退化開始、完了です。レーンはMacとAndroid(Galaxy S26)に存在し、現在はLiteRT-LMのみです。
リポジトリには、Pixel 8aとMac Studio M4 Maxで実行された2026-08-17のLiteRT-LM v0.15.0からv0.16.0への回帰実行によるシードベースラインが含まれています。これはapple-silicon-llm-benchから切り出されたもので、同プロジェクトは測定アーカイブとして残ります。MITライセンスの下で提供されています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.