Об этом проекте

Tongyi DeepResearch — это открытая агентная большая языковая модель, выпущенная лабораторией Tongyi Alibaba, предназначенная для долгосрочных задач глубокого поиска информации. Флагманская модель Tongyi-DeepResearch-30B-A3B имеет 30,5 млрд параметров всего, с 3,3 млрд активируемых на токен и длиной контекста 128K. Она доступна на HuggingFace и ModelScope, с онлайн-демо на ModelScope и HuggingFace Spaces, опцией сервиса Bailian и конечной точкой API OpenRouter, которая позволяет выполнять инференс без локальных GPU. Репозиторий предоставляет карточку модели, технический блог и отчет arXiv, а также практические инструменты: папку инференса со скриптом агента в стиле ReAct и оболочкой, и каталог оценки со скриптами бенчмарков. Установка использует Python 3.10 в изолированной среде conda или virtualenv, устанавливает зависимости из requirements.txt и настраивает ключи API через файл .env. Упоминаемые внешние сервисы включают Serper для веб-поиска и Google Scholar, Jina для чтения страниц, API, совместимый с OpenAI, для суммаризации страниц, Dashscope для разбора файлов и конечную точку SandboxFusion для песочницы интерпретатора Python. Данные для оценки могут быть предоставлены в формате JSON или JSONL, где каждая запись содержит вопрос и эталонный ответ, используемый для автоматической оценки. Вопросы на основе документов могут ссылаться на файлы, размещенные в каталоге eval_data/file_corpus. В README отмечаются две парадигмы инференса: ReAct для оценки основных внутренних способностей и режим "Heavy" на основе IterResearch, который применяет масштабирование во время тестирования. Описанные детали обучения включают полностью автоматизированный конвейер синтетических данных, крупномасштабное непрерывное предварительное обучение на агентных данных и сквозное обучение с подкреплением на политике с настраиваемой структурой Group Relative Policy Optimization, градиентами политики на уровне токенов, оценкой преимущества leave-one-out и фильтрацией отрицательных примеров. Проект также перечисляет более широкое семейство агентов глубокого исследования с соответствующими статьями по обходу веб-страниц, автономному поиску информации, синтезу данных, исследовательским агентам на основе зрения и языка, суммаризации контекста и параллельному мышлению. В README упоминаются результаты бенчмарков на таких наборах данных, как Humanity's Last Exam, BrowseComp, BrowseComp-ZH, WebWalkerQA, xbench-DeepSearch, FRAMES и SimpleQA, хотя конкретные оценки показаны только на изображениях. Он включает FAQ, информацию о цитировании и уведомление о наборе исследовательских стажеров в Ханчжоу, Пекине и Шанхае.