প্রকল্প সম্পর্কে
DeepEval হলো লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) সিস্টেমের জন্য একটি ওপেন-সোর্স মূল্যায়ন ফ্রেমওয়ার্ক, যা অনেকটা Pytest-এর মতো কাজ করে তবে এটি বিশেষভাবে এআই অ্যাপ্লিকেশনের জন্য তৈরি। এটি ডেভেলপারদের এলএলএম অ্যাপগুলোকে ব্ল্যাক বক্স হিসেবে এন্ড-টু-এন্ড মূল্যায়ন করতে, সম্পূর্ণ এজেন্টের গতিপথ বিশ্লেষণ করতে অথবা টুল ব্যবহার ও রিট্রিভালের মতো পৃথক ধাপগুলো পরীক্ষা করার সুযোগ দেয়।
এর প্রধান বৈশিষ্ট্যগুলোর মধ্যে রয়েছে:
- ব্যবহারের জন্য প্রস্তুত বিভিন্ন মেট্রিক্স:
- কাস্টম/অল-পারপাস: G-Eval এবং DAG।
- এজেন্টিক: টাস্ক কমপ্লিশন, টুল কারেক্টনেস, গোল একুরেসি এবং প্ল্যান অ্যাডহেরেন্স।
- আরএজি (RAG): অ্যানসার রিলেভেন্সি, ফেইথফুলনেস, কনটেক্সচুয়াল রিকল এবং কনটেক্সচুয়াল প্রিসিশন।
- মাল্টি-টার্ন: নলেজ রিটেনশন, কনভারসেশন কমপ্লিটনেস এবং রোল অ্যাডহেরেন্স।
- মাল্টিমোডাল: টেক্সট-টু-ইমেজ, ইমেজ এডিটিং এবং ইমেজ কোহেরেন্স।
- অন্যান্য: হ্যালুসিনেশন, সামারাইজেশন, বায়াস, টক্সিসিটি এবং JSON কারেক্টনেস।
- সিন্থেটিক ডেটাসেট জেনারেশন: পরীক্ষার জন্য সিঙ্গেল এবং মাল্টি-টার্ন ডেটাসেট তৈরি করার ক্ষমতা।
- বেঞ্চমার্কিং: MMLU, HellaSwag এবং HumanEval-এর মতো জনপ্রিয় বেঞ্চমার্কগুলোর সমর্থন।
- প্রম্পট অপ্টিমাইজেশন: মূল্যায়নের ফলাফলের ওপর ভিত্তি করে স্বয়ংক্রিয় প্রম্পট অপ্টিমাইজেশন।
- ব্যাপক ইন্টিগ্রেশন: এটি LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic এবং Google ADK-এর মতো ফ্রেমওয়ার্কগুলোর সাথে কাজ করে।
এই ফ্রেমওয়ার্কটি এনএলপি (NLP) মডেলের মাধ্যমে লোকাল এক্সিকিউশন এবং 'LLM-as-a-judge' প্যাটার্ন উভয়ই সমর্থন করে এবং স্বয়ংক্রিয় গুণমান নিশ্চিতকরণের জন্য CI/CD এনভায়রনমেন্টে ইন্টিগ্রেট করা যায়।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.