عن المشروع

تونغي ديب ريسيرش هو نموذج لغوي كبير وكيل مفتوح المصدر أصدره مختبر تونغي التابع لشركة أليبابا، ويهدف إلى مهام البحث العميق عن المعلومات على المدى الطويل. النموذج الرئيسي، تونغي-ديب-ريسيرش-30B-A3B، لديه 30.5 مليار معامل إجمالي مع 3.3 مليار مفعلة لكل رمز، وطول سياق يبلغ 128 ألف رمز. وهو متاح على HuggingFace وModelScope، مع عروض توضيحية عبر الإنترنت على ModelScope وHuggingFace Spaces، وخيار خدمة Bailian، ونقطة نهاية OpenRouter API التي تتيح الاستدلال دون الحاجة إلى وحدات معالجة رسومية محلية. يوفّر المستودع بطاقة النموذج، ومدونة تقنية، وتقرير arXiv، بالإضافة إلى أدوات عملية: مجلد استدلال يحتوي على سكربت وكيل بأسلوب ReAct ومشغّل أوامر، ودليل تقييم يحتوي على نصوص معايير. يتطلب الإعداد استخدام Python 3.10 في بيئة معزولة عبر conda أو virtualenv، وتثبيت التبعيات من requirements.txt، وتكوين مفاتيح API عبر ملف .env. تشمل الخدمات الخارجية المُشار إليها Serper للبحث على الويب وGoogle Scholar، وJina لقراءة الصفحات، وواجهة برمجة تطبيقات متوافقة مع OpenAI لتلخيص الصفحات، وDashscope لتحليل الملفات، ونقطة نهاية SandboxFusion لبيئة Python interpreter معزولة. يمكن توفير بيانات التقييم بصيغة JSON أو JSONL، حيث يحتوي كل إدخال على سؤال وإجابة مرجعية تُستخدم للتحكيم التلقائي. يمكن للأسئلة المستندة إلى مستندات الإشارة إلى ملفات موضوعة في دليل eval_data/file_corpus. يذكر ملف README نموذجين للاستدلال: ReAct لتقييم القدرات الجوهرية الأساسية، ووضع "Heavy" القائم على IterResearch والذي يطبّق تحجيم وقت الاختبار. تشمل تفاصيل التدريب الموصوفة خط أنابيب بيانات اصطناعية مؤتمت بالكامل، واستمرار تدريب مسبق واسع النطاق على بيانات وكيلة، وتعلّم تعزيزي على السياسة من البداية إلى النهاية مع إطار Group Relative Policy Optimization مخصص، وتدرجات سياسة على مستوى الرمز، وتقدير ميزة leave-one-out، وتصفية العينات السلبية. يسرد المشروع أيضًا عائلة أوسع من وكلاء البحث العميق مع أوراق بحثية ذات صلة حول اجتياز الويب، والبحث المستقل عن المعلومات، وتوليف البيانات، ووكلاء البحث في الرؤية واللغة، وتلخيص السياق، والتفكير المتوازي. يذكر ملف README نتائج معايير عبر مجموعات بيانات مثل Humanity's Last Exam وBrowseComp وBrowseComp-ZH وWebWalkerQA وxbench-DeepSearch وFRAMES وSimpleQA، على الرغم من أن الدرجات المحددة تظهر فقط في الصور. يتضمن أسئلة شائعة، ومعلومات استشهاد، وإشعار توظيف لمتدربين باحثين في هانغتشو وبكين وشنغهاي.