इस प्रोजेक्ट के बारे में
Tongyi DeepResearch अलीबाबा की Tongyi Lab द्वारा जारी एक ओपन-सोर्स एजेंटिक बड़ा भाषा मॉडल है, जिसका उद्देश्य लंबी-अवधि, गहन सूचना-खोज कार्य हैं। प्रमुख मॉडल, Tongyi-DeepResearch-30B-A3B, में कुल 30.5B पैरामीटर हैं, प्रति टोकन 3.3B सक्रिय होते हैं, और 128K संदर्भ लंबाई है। यह HuggingFace और ModelScope पर उपलब्ध है, ModelScope और HuggingFace Spaces पर ऑनलाइन डेमो, एक Bailian सेवा विकल्प, और एक OpenRouter API एंडपॉइंट है जो स्थानीय GPU के बिना इन्फ्रेंस की अनुमति देता है।
रिपॉजिटरी मॉडल कार्ड, एक तकनीकी ब्लॉग, और एक arXiv रिपोर्ट, साथ ही व्यावहारिक टूलिंग प्रदान करती है: एक इन्फ्रेंस फ़ोल्डर जिसमें ReAct-शैली एजेंट स्क्रिप्ट और शेल रनर है, और एक मूल्यांकन निर्देशिका जिसमें बेंचमार्क स्क्रिप्ट हैं। सेटअप Python 3.10 का उपयोग एक अलग conda या virtualenv वातावरण में करता है, requirements.txt से निर्भरताएँ स्थापित करता है, और .env फ़ाइल के माध्यम से API कुंजियाँ कॉन्फ़िगर करता है। संदर्भित बाहरी सेवाओं में Serper वेब खोज और Google Scholar के लिए, Jina पृष्ठ पढ़ने के लिए, एक OpenAI-संगत API पृष्ठ सारांश के लिए, Dashscope फ़ाइल पार्सिंग के लिए, और SandboxFusion एंडपॉइंट Python इंटरप्रेटर सैंडबॉक्स के लिए शामिल हैं।
मूल्यांकन डेटा JSON या JSONL के रूप में प्रदान किया जा सकता है, जहाँ प्रत्येक प्रविष्टि में एक प्रश्न और एक संदर्भ उत्तर होता है जिसका उपयोग स्वचालित निर्णय के लिए किया जाता है। दस्तावेज़-आधारित प्रश्न eval_data/file_corpus निर्देशिका में रखी गई फ़ाइलों को संदर्भित कर सकते हैं। README दो इन्फ्रेंस प्रतिमानों को नोट करता है: मुख्य आंतरिक क्षमताओं के मूल्यांकन के लिए ReAct, और एक IterResearch-आधारित "Heavy" मोड जो टेस्ट-टाइम स्केलिंग लागू करता है। वर्णित प्रशिक्षण विवरण में एक पूरी तरह से स्वचालित सिंथेटिक डेटा पाइपलाइन, एजेंटिक डेटा पर बड़े पैमाने पर निरंतर प्री-ट्रेनिंग, और एक अनुकूलित Group Relative Policy Optimization फ्रेमवर्क, टोकन-स्तरीय पॉलिसी ग्रेडिएंट, leave-one-out लाभ अनुमान, और नकारात्मक नमूनों के फ़िल्टरिंग के साथ एंड-टू-एंड ऑन-पॉलिसी रीन्फोर्समेंट लर्निंग शामिल हैं।
परियोजना एक व्यापक डीप रिसर्च एजेंट परिवार को भी सूचीबद्ध करती है, जिसमें वेब ट्रैवर्सल, स्वायत्त सूचना खोज, डेटा संश्लेषण, विज़न-लैंग्वेज रिसर्च एजेंट, संदर्भ सारांश, और समानांतर सोच पर संबंधित पेपर शामिल हैं। README में Humanity's Last Exam, BrowseComp, BrowseComp-ZH, WebWalkerQA, xbench-DeepSearch, FRAMES, और SimpleQA जैसे डेटासेट में बेंचमार्क परिणामों का उल्लेख है, हालाँकि विशिष्ट स्कोर केवल छवियों में दिखाए गए हैं। इसमें एक FAQ, उद्धरण जानकारी, और हांग्जो, बीजिंग और शंघाई में शोध इंटर्न के लिए एक भर्ती सूचना शामिल है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.