প্রকল্প সম্পর্কে

Tongyi DeepResearch হলো আলিবাবার Tongyi Lab-এর প্রকাশিত একটি ওপেন-সোর্স এজেন্টিক বৃহৎ ভাষা মডেল, যা দীর্ঘ-পরিসরের গভীর তথ্য-অনুসন্ধান কাজের জন্য তৈরি। প্রধান মডেল Tongyi-DeepResearch-30B-A3B-এর মোট 30.5B প্যারামিটার রয়েছে, প্রতি টোকেনে 3.3B সক্রিয় হয় এবং কনটেক্সট দৈর্ঘ্য 128K। এটি HuggingFace এবং ModelScope-এ উপলব্ধ, সাথে ModelScope এবং HuggingFace Spaces-এ অনলাইন ডেমো, একটি Bailian সার্ভিস বিকল্প এবং একটি OpenRouter API এন্ডপয়েন্ট রয়েছে যা স্থানীয় GPU ছাড়াই ইনফারেন্স করতে দেয়। রিপোজিটরিতে মডেল কার্ড, একটি টেকনিক্যাল ব্লগ এবং একটি arXiv রিপোর্ট রয়েছে, সাথে ব্যবহারিক টুলিং: একটি ইনফারেন্স ফোল্ডার যেখানে ReAct-স্টাইল এজেন্ট স্ক্রিপ্ট এবং শেল রানার আছে, এবং একটি ইভালুয়েশন ডিরেক্টরি যেখানে বেঞ্চমার্ক স্ক্রিপ্ট আছে। সেটআপের জন্য Python 3.10 ব্যবহার করা হয় একটি আলাদা conda বা virtualenv পরিবেশে, requirements.txt থেকে ডিপেন্ডেন্সি ইনস্টল করা হয় এবং .env ফাইলের মাধ্যমে API কী কনফিগার করা হয়। উল্লেখিত বাহ্যিক সার্ভিসগুলির মধ্যে রয়েছে ওয়েব সার্চ এবং Google Scholar-এর জন্য Serper, পেজ পড়ার জন্য Jina, পেজ সারাংশের জন্য একটি OpenAI-সামঞ্জস্যপূর্ণ API, ফাইল পার্সিংয়ের জন্য Dashscope এবং Python ইন্টারপ্রেটার স্যান্ডবক্সের জন্য একটি SandboxFusion এন্ডপয়েন্ট। ইভালুয়েশন ডেটা JSON বা JSONL হিসেবে সরবরাহ করা যায়, যেখানে প্রতিটি এন্ট্রিতে একটি প্রশ্ন এবং একটি রেফারেন্স উত্তর থাকে যা স্বয়ংক্রিয় বিচারের জন্য ব্যবহৃত হয়। ডকুমেন্ট-ভিত্তিক প্রশ্নগুলো eval_data/file_corpus ডিরেক্টরিতে রাখা ফাইলগুলিকে উল্লেখ করতে পারে। README-তে দুটি ইনফারেন্স প্যারাডাইম উল্লেখ করা হয়েছে: মূল অভ্যন্তরীণ ক্ষমতা মূল্যায়নের জন্য ReAct, এবং একটি IterResearch-ভিত্তিক "Heavy" মোড যা টেস্ট-টাইম স্কেলিং প্রয়োগ করে। বর্ণিত প্রশিক্ষণ বিবরণের মধ্যে রয়েছে একটি সম্পূর্ণ স্বয়ংক্রিয় সিন্থেটিক ডেটা পাইপলাইন, এজেন্টিক ডেটার উপর বৃহৎ-স্কেল ধারাবাহিক প্রি-ট্রেনিং, এবং একটি কাস্টমাইজড Group Relative Policy Optimization ফ্রেমওয়ার্ক, টোকেন-লেভেল পলিসি গ্র্যাডিয়েন্ট, লিভ-ওয়ান-আউট অ্যাডভান্টেজ এস্টিমেশন এবং নেগেটিভ স্যাম্পল ফিল্টারিং সহ এন্ড-টু-এন্ড অন-পলিসি রিইনফোর্সমেন্ট লার্নিং। প্রজেক্টটি আরও একটি বৃহত্তর ডিপ রিসার্চ এজেন্ট পরিবার তালিকাভুক্ত করে, যার মধ্যে ওয়েব ট্রাভার্সাল, স্বায়ত্তশাসিত তথ্য অনুসন্ধান, ডেটা সিন্থেসিস, ভিশন-ল্যাঙ্গুয়েজ রিসার্চ এজেন্ট, কনটেক্সট সামারিজেশন এবং প্যারালাল থিংকিং সম্পর্কিত পেপার রয়েছে। README-তে Humanity's Last Exam, BrowseComp, BrowseComp-ZH, WebWalkerQA, xbench-DeepSearch, FRAMES এবং SimpleQA-এর মতো ডেটাসেট জুড়ে বেঞ্চমার্ক ফলাফল উল্লেখ করা হয়েছে, যদিও নির্দিষ্ট স্কোর শুধুমাত্র ছবিতে দেখানো হয়েছে। এতে একটি FAQ, সাইটেশন তথ্য এবং হাংঝো, বেইজিং ও সাংহাইয়ে গবেষণা ইন্টার্নদের জন্য একটি নিয়োগ বিজ্ঞপ্তি অন্তর্ভুক্ত রয়েছে।