À propos du projet

DeepAnalyze, développé par les équipes de l'Université Renmin de Chine et de l'Université Tsinghua, est un grand modèle de langage agentique (agentic LLM) destiné à la science des données autonome. Son objectif est d'exécuter l'ensemble du processus de science des données sans intervention humaine, y compris la préparation des données, l'analyse, la modélisation, la visualisation et la génération de rapports, tout en prenant en charge une recherche approfondie ouverte sur diverses sources de données. Capacités principales - Couverture complète du processus de science des données : exécution automatique de tâches telles que la préparation des données, l'analyse, la modélisation, la visualisation et la génération de rapports. - Recherche de données ouverte : gestion des données structurées (bases de données, CSV, Excel), semi-structurées (JSON, XML, YAML) et non structurées (TXT, Markdown), produisant finalement des rapports d'analyse. - Open source complet : le modèle (DeepAnalyze-8B), le code, les données d'entraînement (DataScience-Instruct-500K) et la démo sont tous open source, facilitant le déploiement local ou le développement secondaire. Méthodes d'utilisation - Le modèle peut être déployé via vLLM, offrant une API de style OpenAI, avec un tableau de recommandations de configuration mémoire couvrant les scénarios de 16 Go à 80 Go de VRAM, prenant en charge les modèles quantifiés et le cache KV FP8. - Plusieurs interfaces interactives sont fournies : WebUI, WebUI v2 (prenant en charge l'API HeyWhale et l'exécution de code sandbox basée sur Docker), JupyterUI et une interface en ligne de commande (prenant en charge le chinois et l'anglais). - Des canaux de demande de clé API et une documentation d'utilisation sont fournis, avec également la possibilité de configurer un service de style OpenAI. Entraînement et évaluation - Prise en charge du fine-tuning basé sur DeepSeek-R1-0528-Qwen3-8B ou DeepAnalyze-8B, avec des scripts pour le fine-tuning de capacités individuelles, l'entraînement de démarrage à froid d'agents multi-capacités et l'entraînement par renforcement. - Unification des processus d'évaluation de la plupart des benchmarks existants en science des données dans le playground, facilitant l'évaluation de DeepAnalyze ou d'agents personnalisés. Écosystème et projets connexes - Les projets connexes incluent SkillAdam (plugin d'optimisation automatique des compétences d'agent), DeepPrep (agent de préparation des données), CoDA-Bench (benchmark d'agents de code pour les tâches d'analyse intensive en données) et DA-Studio (le système derrière WebUI v2). - Le cadre d'entraînement est basé sur ms-swift et SkyRL, avec des données d'entraînement provenant de Reasoning-Table, Spider, BIRD, DABStep, entre autres. Scénarios d'utilisation Adapté aux utilisateurs et équipes ayant besoin d'analyse de données automatisée, de génération de rapports d'analyse en masse, ou de déploiement privé local d'assistants d'analyse de données.