Sobre el proyecto
Tongyi DeepResearch es un modelo de lenguaje grande agéntico de código abierto publicado por el Tongyi Lab de Alibaba, orientado a tareas de búsqueda profunda de información a largo plazo. El modelo insignia, Tongyi-DeepResearch-30B-A3B, tiene 30.5B de parámetros totales con 3.3B activados por token y una longitud de contexto de 128K. Está disponible en HuggingFace y ModelScope, con demos en línea en ModelScope y HuggingFace Spaces, una opción de servicio Bailian y un endpoint de API OpenRouter que permite inferencia sin GPUs locales.
El repositorio proporciona la tarjeta del modelo, un blog técnico y un informe arXiv, además de herramientas prácticas: una carpeta de inferencia con un script de agente estilo ReAct y un ejecutor de shell, y un directorio de evaluación con scripts de benchmark. La configuración usa Python 3.10 en un entorno aislado de conda o virtualenv, instala dependencias desde requirements.txt y configura claves de API mediante un archivo .env. Los servicios externos referenciados incluyen Serper para búsqueda web y Google Scholar, Jina para lectura de páginas, una API compatible con OpenAI para resumir páginas, Dashscope para análisis de archivos y un endpoint de SandboxFusion para un sandbox de intérprete de Python.
Los datos de evaluación pueden proporcionarse como JSON o JSONL, donde cada entrada tiene una pregunta y una respuesta de referencia utilizada para el juzgamiento automático. Las preguntas basadas en documentos pueden referenciar archivos colocados en un directorio eval_data/file_corpus. El README señala dos paradigmas de inferencia: ReAct para evaluar habilidades intrínsecas centrales, y un modo "Heavy" basado en IterResearch que aplica escalamiento en tiempo de prueba. Los detalles de entrenamiento descritos incluyen un pipeline de datos sintéticos totalmente automatizado, preentrenamiento continuo a gran escala con datos agénticos y aprendizaje por refuerzo on-policy de extremo a extremo con un marco personalizado de Group Relative Policy Optimization, gradientes de política a nivel de token, estimación de ventaja leave-one-out y filtrado de muestras negativas.
El proyecto también enumera una familia más amplia de agentes de investigación profunda con artículos relacionados sobre recorrido web, búsqueda autónoma de información, síntesis de datos, agentes de investigación de visión-lenguaje, resumen de contexto y pensamiento paralelo. El README menciona resultados de benchmarks en conjuntos de datos como Humanity's Last Exam, BrowseComp, BrowseComp-ZH, WebWalkerQA, xbench-DeepSearch, FRAMES y SimpleQA, aunque las puntuaciones específicas solo se muestran en imágenes. Incluye una sección de preguntas frecuentes, información de citación y un aviso de contratación para pasantes de investigación en Hangzhou, Beijing y Shanghái.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.