প্রকল্প সম্পর্কে
COSPA (Cost Of Solving Programming Assignments) হল একটি বেঞ্চমার্কিং ফ্রেমওয়ার্ক যা কোডিং এজেন্টের "খরচ-কার্যকারিতা" মূল্যায়ন করার জন্য তৈরি করা হয়েছে। এটি সঠিক উত্তর, টোকেন ব্যবহার, অতিবাহিত সময় এবং অনুমানকৃত API খরচ রেকর্ড করে মডেলটির প্রতি একক খরচে কতটা ক্ষমতা বা গুণমান প্রদান করে তা পরিমাপ করে।
এই ফ্রেমওয়ার্কটি ছয়টি বেঞ্চমার্ক স্যুট নিয়ে গঠিত একটি অফিসিয়াল ৩৩৬-টাস্ক প্যানেল ব্যবহার করে:
- BigCodeBench-Hard Agentic: Python ফাংশন বাস্তবায়ন।
- SWE-Explore Verified: কোড লোকেশন এবং প্রাসঙ্গিকতা চিহ্নিতকরণ।
- Multi-SWE-bench Flash: মাল্টি-ল্যাঙ্গুয়েজ রিপোজিটরি মেরামত।
- Terminal-Bench Core: সিস্টেম অ্যাডমিনিস্ট্রেশন এবং টার্মিনাল কাজ।
- SWE-PolyBench Verified: Java, JS, Python, এবং TypeScript-এর জন্য রিপোজিটরি মেরামত।
- FeatureBench Lite: বিভিন্ন রিপোজিটরিতে ফিচার বাস্তবায়ন।
COSPA মডেল হোস্ট করে না; এটির জন্য OpenAI-সামঞ্জস্যপূর্ণ এন্ডপয়েন্ট অথবা Pi কোডিং এজেন্টের মাধ্যমে কনফিগার করা প্রদানকারীর প্রয়োজন। এটি স্থিতিশীলতা নিশ্চিত করতে একাধিক ট্রায়াল এক্সিকিউশনের সময় হার্ডওয়্যার রিসোর্স (RAM, Disk, PSI) পরিচালনার জন্য একটি উন্নত হোস্ট গার্ড সিস্টেম অন্তর্ভুক্ত করে।
প্রধান বৈশিষ্ট্যগুলি হল:
- pi_vanilla এবং jouzu-এর মতো একাধিক এজেন্ট কনফিগারেশন (অ্যাডাপ্টার) সমর্থন।
- ম্যানিফেস্ট, মডেল ট্রেস এবং গ্রেডার রায়সহ বিস্তারিত ফলাফল ট্র্যাকিং।
- টার্মিনাল বা ব্রাউজার UI-এর মাধ্যমে স্কোর, কভারেজ এবং আস্থার ব্যবধান বিশ্লেষণের জন্য অন্তর্ভুক্ত ভিউয়ার।
- রেফারেন্স ফিক্সগুলি বৈধ এবং স্টার্টার রিপোজিটরিগুলি ধারাবাহিকভাবে ব্যর্থ হওয়া নিশ্চিত করার জন্য কঠোর টাস্ক নির্বাচন মানদণ্ড।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.