برازیلی قومی عام نصاب (BNCC) کے لیے LLMs کی ہالوسینیشن کا ایک اوپن بینچ مارک۔ یہ ماپتا ہے کہ ماڈلز کتنی رسمی کوڈز اور تحریریں ایجاد کرتے ہیں، جس میں کھلی میتھڈولوجی، خام ڈیٹا اور قابل آڈٹ CI شامل ہے۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔
THE FIRST COLLECTIONسچن کے لیے GitHub پروفائل README، جو کہ ایک اپلائیڈ AI آرکیٹیکٹ اور انجینئر ہیں۔ یہ ایجنٹس، RAG، اور ریلائبلٹی ٹولز پر مبنی اوپن سورس پروجیکٹس، مہارتوں اور رابطے کی تفصیلات فراہم کرتا ہے۔
AgentLeak ایک اوپن سورس پرائیویسی ٹیسٹنگ ٹول ہے جو AI ایجنٹس کے لیے ڈیٹا لیک کا پتہ لگاتا ہے۔ یہ ٹول کالز، میموری اور لاگز میں لیک کا پتہ لگاتا ہے، مقامی Python SDK، CLI اور MCP ٹولز استعمال کرتا ہے، اور کلاؤڈ ڈیپنڈنسی کے بغیر ریڈیکٹڈ رپورٹس اور CI گیٹس فراہم کرتا ہے۔
MLflow ایک اوپن سورس AI انجینئرنگ پلیٹ فارم ہے جو ایجنٹس، LLMs اور روایتی ML ماڈلز کے لائف سائیکل کو مینج کرنے کے لیے ڈیزائن کیا گیا ہے، جس کی توجہ observability، evaluation اور deployment پر ہے۔
SUM ایک اوپن سورس ٹول ہے جو کرپٹوگرافک رسیدوں کے ساتھ AI متن کی تبدیلیوں کی تصدیق کرتا ہے۔ یہ جانچتا ہے کہ AI متن کو دوبارہ لکھنے پر کیا تبدیل ہوا، کیا محفوظ رہا، اور کیا ضائع ہوا، کراس رن ٹائم Ed25519 دستخطوں اور آف لائن تصدیق کے ساتھ۔
garak ایک اوپن سورس LLM کمزوری اسکینر ہے جو NVIDIA نے تیار کیا ہے، جو جنریٹو AI ماڈلز میں ہیلوسینیشن، ڈیٹا لیک، پرامپٹ انجیکشن، زہریلے پن، جیل بریک اور دیگر کمزوریوں کی جانچ کرتا ہے، بالکل nmap یا Metasploit کی طرح لیکن LLMs کے لیے۔
iFixAi AI ایجنٹس کا آزادانہ آڈٹ فراہم کرتا ہے، جو آپریشنل یقین دہانی اور دشمنانہ ٹیسٹنگ پر مرکوز ہے۔ یہ پانچ بنیادی ستونوں: Fabrication, Manipulation, Deception, Unpredictability, اور Opacity کے ذریعے ایجنٹس کی کارکردگی کو A–F گریڈ میں درجہ بندی کرتا ہے۔
DeepEval ایک اوپن سورس LLM ایویلیوایشن فریم ورک ہے جو AI ایپلی کیشنز، بشمول RAG پائپ لائنز، ایجنٹس، اور چیٹ بوٹس کی یونٹ ٹیسٹنگ کے لیے ڈیزائن کیا گیا ہے۔