প্রকল্প সম্পর্কে

Proving Ground মার্কেটিং দাবির পরিবর্তে আচরণগত প্রমাণের ভিত্তিতে AI এজেন্টদের গ্রেডিং করার জন্য একটি মানসম্মত পদ্ধতি প্রদান করে। এটি নিরাপত্তা, কাজের সফলতা, গ্রাউন্ডিং, সেফটি, বায়াস, প্রাইভেসী, ইনস্ট্রাকশন ফলোয়িং, কনভারসেশনাল কোয়ালিটি, অনেস্টি, রোবাস্টনেস, মেমোরি এবং ল্যাটেন্সি সহ বারোটি মাত্রায় এজেন্টদের মূল্যায়ন করে। এর মূল কারিগরি বৈশিষ্ট্যগুলোর মধ্যে রয়েছে: - Adapters: REST API এবং Socket.IO-এর মাধ্যমে ব্ল্যাক-বক্স ইন্টারঅ্যাকশন সমর্থন করে, এবং একটি ব্রাউজার-ভিত্তিক WidgetAdapter পরিকল্পনা করা হয়েছে। - Grading Pipeline: বাইনারি তথ্যের (যেমন, সিক্রেট লিক, ল্যাটেন্সি) জন্য ডিটারমিনিস্টিক চেক এবং গুণগত মূল্যায়নের জন্য একটি LLM-as-judge এনসেম্বল (Claude ব্যবহার করে) এর সমন্বয় ব্যবহার করে। - Anti-Gaming Measures: ভেন্ডরদের নিজস্ব পরীক্ষার জন্য একটি পাবলিক প্র্যাকটিস সেট এবং ওভার-টিউনিং প্রতিরোধ করতে চূড়ান্ত সার্টিফিকেশনের জন্য একটি প্রাইভেট, হেল্ড-আউট সেট ব্যবহার করে। - Certification Tiers: কম্পোজিট স্কোর এবং বিভিন্ন মাত্রায় ন্যূনতম পারফরম্যান্স ফ্লোরের ভিত্তিতে Standard, Premium, অথবা Elite টিয়ার বরাদ্দ করে। - Verification: টুল-এক্সিকিউশন গ্রেডিং অন্তর্ভুক্ত করে যাতে যাচাই করা যায় যে এজেন্টরা কেবল দাবি না করে প্রকৃতপক্ষে কাজগুলো (যেমন, বুকিং বা ইমেল করা) সম্পাদন করছে।