منصوبے کے بارے میں

edge-llm-bench مقامی LLM انجنوں کے لیے ایک غیر جانبدار، دوبارہ قابلِ تولید بینچ مارک ہارنس ہے جو حقیقی آلات پر چلتا ہے اور اسے ایک بار کے پیمائشی مہمات کے بجائے مسلسل چلنے کے لیے ڈیزائن کیا گیا ہے۔ یہ macOS، iOS اور Android ہارڈویئر کو ہدف بناتا ہے۔ شامل انجنوں میں LiteRT-LM، llama.cpp، MLX، Apple Core AI اور Cactus شامل ہیں، اور ہر ورژن پن environment.lock.json میں درج ہوتا ہے۔ حوالہ دیے گئے آلات میں Mac Studio (M4 Max)، iPhone 17 Pro، Pixel 8a اور Galaxy S26 شامل ہیں۔ تمام نتائج ایک ہی اسکیما (schema/result.v1.json)، ایک ہی جمع کرنے کی تہہ اور ایک ہی لیڈر بورڈ فارمیٹ کا اشتراک کرتے ہیں۔ ریپوزٹری پائپ لائن، ہر خام کیپچر ریکارڈ اور مشین کے قابلِ پڑھنے والے ریگریشن فیصلے فراہم کرتی ہے، لیکن جان بوجھ کر کراس رن ٹائم درجہ بندی شائع نہیں کرتی۔ صارفین build_summary.py اور render_leaderboard.py استعمال کرتے ہوئے فراہم کردہ خام ڈیٹا سے مقامی طور پر اپنا لیڈر بورڈ تیار کرتے ہیں، جس سے ایک gitignored LEADERBOARD.md بنتا ہے۔ بنیادی کمانڈز میں release-watch (اپ اسٹریم ریلیزز کا پن شدہ ورژنز سے موازنہ کرتا ہے)، matrix (بینچ مارک کنفیگریشنز کی سیلز فائل چلاتا ہے) اور regress (کسی انجن ورژن کا بیس لائن سے موازنہ کرتا ہے) شامل ہیں۔ ماڈل شامل کرنا سیلز فائل میں ایک لائن کا کام ہے۔ ہر رن فی ریکارڈ schema-v1 JSON کے ساتھ اس کا خام کنسول لاگ results/raw/ کے تحت خارج کرتا ہے۔ ماخوذ CSVs results/summary/ میں رہتی ہیں، اور ریگریشن فیصلے results/regression-reports/ کے تحت JSON کے طور پر محفوظ رہتے ہیں۔ CI انھیں مستقل رکھتا ہے۔ سیٹ اپ کے راستے پلیٹ فارم کے لحاظ سے مختلف ہیں۔ Mac لین Homebrew، وینڈرڈ انجنوں کے لیے ایک بوٹ اسٹریپ اسکرپٹ اور ایک CLI بلڈ استعمال کرتا ہے۔ Android لین ریلیزز پیج سے پہلے سے بنے انجن بائنریز استعمال کرتا ہے، جس سے bazel/NDK بلڈز سے بچا جاتا ہے۔ iPhone لین کے لیے Xcode سائننگ اور صرف GUI میموری انٹائٹلمنٹس درکار ہیں، جو اسے سب سے بھاری سیٹ اپ بناتا ہے۔ انصاف اور دیانت داری کے میکانزم ایک مرکزی خصوصیت ہیں۔ ہر قطار اپنی ترکیب درج کرتی ہے، بشمول کوانٹائزیشن اور انجن پن، کیونکہ مختلف ترکیب کے تحت تیز رفتار عدد ایک مختلف تعیناتی پروفائل کی نمائندگی کرتا ہے۔ ٹرائلز کا وسیع پھیلاؤ کسی سیل کو اسکور کرنے کے بجائے UNRELIABLE کے طور پر نشان زد کرنے کا سبب بنتا ہے۔ ناکام رنز، کریشز اور OOMs اپنی وجوہات کے ساتھ جدول میں رہتے ہیں۔ کراس سیشن ڈیلٹاز کو سیشن اینکرز کے ذریعے معمول بنایا جاتا ہے۔ مماثل نہ ہونے والے بجٹ یا موڈز اسکور کرنے سے انکار کرتے ہیں۔ Mac اور iPhone کیپچرز خودکار طور پر قرنطینہ اور ایک بار دوبارہ کوشش کی جاتی ہیں جب کوئی رن گرم شروع ہو یا وسیع پھیلاؤ دکھائے۔ کوریج کو measured (محفوظ کیپچرز موجود ہیں)، wired (پن شدہ ورژن پر بلڈ ہوتا ہے لیکن ابھی کوئی کیپچر نہیں) یا n/a کے طور پر بیان کردہ وجہ کے ساتھ ٹریک کیا جاتا ہے۔ LiteRT-LM تمام چار آلات پر measured ہے؛ llama.cpp Android آلات پر measured ہے؛ MLX اور Core AI صرف Apple کے لیے ہیں؛ Cactus کا کوئی Mac بازو نہیں اور Android سپورٹ منصوبہ بند ہے۔ افشا شدہ خلا میں Android LiteRT NPU کا صرف Early Access ہونا، Android llama.cpp کا سرکاری CPU ریلیز بائنری استعمال کرنا، اور Android v1 میں گرم نظام اور TTFT پیمائش کی کمی شامل ہے۔ ایک برداشت کا کام (endurance-chat-30m) سنگل ٹرن رفتار کے بجائے مسلسل رویے کی پیمائش کرتا ہے: ایک انجن پروسیس، جمع ہوتے KV کیش کے ساتھ ایک گفتگو، ایک مقررہ 12 پرامپٹ اسکرپٹ اور فی ٹرن 256 ٹوکن کی مقامی حد۔ ہر ٹرن ڈی کوڈ ریٹ، KV قبضہ، میموری، تھرمل حالت اور انحطاط ریکارڈ کرتا ہے۔ ٹرن 37 پر کریش ٹرنز 1-36 کو ثبوت کے طور پر محفوظ رکھتا ہے۔ سیشنز چار فیصلے اخذ کرتے ہیں: ڈی کوڈ کمی، میموری ڈھلوان، انحطاط کا آغاز اور تکمیل۔ Mac اور Android (Galaxy S26) کے لیے لینیں موجود ہیں، فی الحال صرف LiteRT-LM۔ ریپوزٹری میں 2026-08-17 کے LiteRT-LM v0.15.0 سے v0.16.0 ریگریشن رن کا ایک بیج بیس لائن شامل ہے جو Pixel 8a اور Mac Studio M4 Max پر چلایا گیا۔ یہ apple-silicon-llm-bench سے نکالا گیا تھا، جو پیمائش کا آرکائیو رہتا ہے۔ MIT کے تحت لائسنس یافتہ۔