Sobre o projeto
Tongyi DeepResearch é um modelo de linguagem agêntico de código aberto lançado pelo Tongyi Lab da Alibaba, voltado para tarefas de busca profunda de informações de longo horizonte. O modelo principal, Tongyi-DeepResearch-30B-A3B, tem 30,5B de parâmetros totais com 3,3B ativados por token e comprimento de contexto de 128K. Ele está disponível no HuggingFace e no ModelScope, com demonstrações online no ModelScope e no HuggingFace Spaces, uma opção de serviço Bailian e um endpoint de API OpenRouter que permite inferência sem GPUs locais.
O repositório fornece o card do modelo, um blog técnico e um relatório arXiv, além de ferramentas práticas: uma pasta de inferência com um script de agente estilo ReAct e runner de shell, e um diretório de avaliação com scripts de benchmark. A configuração usa Python 3.10 em um ambiente conda ou virtualenv isolado, instala dependências a partir de requirements.txt e configura chaves de API via arquivo .env. Serviços externos referenciados incluem Serper para busca na web e Google Scholar, Jina para leitura de páginas, uma API compatível com OpenAI para sumarização de páginas, Dashscope para análise de arquivos e um endpoint SandboxFusion para um sandbox de interpretador Python.
Os dados de avaliação podem ser fornecidos como JSON ou JSONL, onde cada entrada tem uma pergunta e uma resposta de referência usada para julgamento automático. Perguntas baseadas em documentos podem referenciar arquivos colocados em um diretório eval_data/file_corpus. O README observa dois paradigmas de inferência: ReAct para avaliar habilidades intrínsecas centrais, e um modo "Heavy" baseado em IterResearch que aplica escalonamento em tempo de teste. Detalhes de treinamento descritos incluem um pipeline de dados sintéticos totalmente automatizado, pré-treinamento contínuo em larga escala em dados agênticos e aprendizado por reforço on-policy de ponta a ponta com uma estrutura customizada de Group Relative Policy Optimization, gradientes de política em nível de token, estimativa de vantagem leave-one-out e filtragem de amostras negativas.
O projeto também lista uma família mais ampla de agentes de pesquisa profunda com artigos relacionados sobre travessia na web, busca autônoma de informações, síntese de dados, agentes de pesquisa de visão-linguagem, sumarização de contexto e pensamento paralelo. O README menciona resultados de benchmark em conjuntos de dados como Humanity's Last Exam, BrowseComp, BrowseComp-ZH, WebWalkerQA, xbench-DeepSearch, FRAMES e SimpleQA, embora pontuações específicas sejam mostradas apenas em imagens. Ele inclui um FAQ, informações de citação e um aviso de recrutamento para estagiários de pesquisa em Hangzhou, Pequim e Xangai.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.