প্রকল্প সম্পর্কে

DeepEval হলো লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) সিস্টেমের জন্য একটি ওপেন-সোর্স মূল্যায়ন ফ্রেমওয়ার্ক, যা অনেকটা Pytest-এর মতো কাজ করে তবে এটি বিশেষভাবে এআই অ্যাপ্লিকেশনের জন্য তৈরি। এটি ডেভেলপারদের এলএলএম অ্যাপগুলোকে ব্ল্যাক বক্স হিসেবে এন্ড-টু-এন্ড মূল্যায়ন করতে, সম্পূর্ণ এজেন্টের গতিপথ বিশ্লেষণ করতে অথবা টুল ব্যবহার ও রিট্রিভালের মতো পৃথক ধাপগুলো পরীক্ষা করার সুযোগ দেয়। এর প্রধান বৈশিষ্ট্যগুলোর মধ্যে রয়েছে: - ব্যবহারের জন্য প্রস্তুত বিভিন্ন মেট্রিক্স: - কাস্টম/অল-পারপাস: G-Eval এবং DAG। - এজেন্টিক: টাস্ক কমপ্লিশন, টুল কারেক্টনেস, গোল একুরেসি এবং প্ল্যান অ্যাডহেরেন্স। - আরএজি (RAG): অ্যানসার রিলেভেন্সি, ফেইথফুলনেস, কনটেক্সচুয়াল রিকল এবং কনটেক্সচুয়াল প্রিসিশন। - মাল্টি-টার্ন: নলেজ রিটেনশন, কনভারসেশন কমপ্লিটনেস এবং রোল অ্যাডহেরেন্স। - মাল্টিমোডাল: টেক্সট-টু-ইমেজ, ইমেজ এডিটিং এবং ইমেজ কোহেরেন্স। - অন্যান্য: হ্যালুসিনেশন, সামারাইজেশন, বায়াস, টক্সিসিটি এবং JSON কারেক্টনেস। - সিন্থেটিক ডেটাসেট জেনারেশন: পরীক্ষার জন্য সিঙ্গেল এবং মাল্টি-টার্ন ডেটাসেট তৈরি করার ক্ষমতা। - বেঞ্চমার্কিং: MMLU, HellaSwag এবং HumanEval-এর মতো জনপ্রিয় বেঞ্চমার্কগুলোর সমর্থন। - প্রম্পট অপ্টিমাইজেশন: মূল্যায়নের ফলাফলের ওপর ভিত্তি করে স্বয়ংক্রিয় প্রম্পট অপ্টিমাইজেশন। - ব্যাপক ইন্টিগ্রেশন: এটি LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic এবং Google ADK-এর মতো ফ্রেমওয়ার্কগুলোর সাথে কাজ করে। এই ফ্রেমওয়ার্কটি এনএলপি (NLP) মডেলের মাধ্যমে লোকাল এক্সিকিউশন এবং 'LLM-as-a-judge' প্যাটার্ন উভয়ই সমর্থন করে এবং স্বয়ংক্রিয় গুণমান নিশ্চিতকরণের জন্য CI/CD এনভায়রনমেন্টে ইন্টিগ্রেট করা যায়।