À propos du projet

BioMCP est un binaire CLI unique construit autour d'une grammaire de commandes qui atteint directement environ 70 sources biomédicales fiables, notamment PubMed, ClinVar, ClinicalTrials.gov, OncoKB et Reactome, avec des sources supplémentaires exposées dans les réponses d'autres sources. Les mêmes outils sont exposés comme serveur Model Context Protocol (MCP), afin que des agents IA tels que Claude Code, Codex et Claude Desktop puissent les appeler. L'objectif annoncé est de réduire le labyrinthe habituel des données biomédicales : une seule requête atteint des sources qui se trouvent normalement derrière différents API, identifiants et habitudes de recherche. Chercheurs, cliniciens et agents utilisent la même grammaire pour rechercher, cibler et pivoter sans reconstruire un flux de travail par source. Les résultats sont décrits comme compacts et orientés preuves, couvrant des données publiques en direct ainsi que des analyses locales d'études. Capacités clés décrites dans le README : - Recherche bibliographique : `search article` se déploie sur PubTator3 et Europe PMC, déduplique les identifiants PMID/PMCID/DOI, et peut ajouter une branche Semantic Scholar lorsque les filtres le permettent. - Pivots inter-entités : passer d'un gène, variant, médicament, maladie, voie, protéine ou article vers la vue intégrée suivante au lieu de reconstruire manuellement les filtres. - Playbooks : `biomcp skill list` affiche des exemples travaillés fournis, ouverts via `biomcp skill <slug>`. - Analyses locales d'études : les commandes `study` couvrent les flux de requête locale, cohorte, survie, comparaison et co-occurrence avec des graphiques terminal, SVG et PNG pour des jeux de données téléchargés de type cBioPortal. - Aides à la traçabilité : `article citations`, `article references`, `article recommendations` et `article entities` étendent un article connu en une carte de preuves plus large. - Enrichissement et traitement par lots : `biomcp enrich` pour l'enrichissement de jeux de gènes g:Profiler, et `biomcp batch` pour jusqu'à 10 appels `get` ciblés en une seule commande. La grammaire des commandes est organisée en `search <entity> [filters]` pour la découverte, `skill list` pour le catalogue de playbooks, `discover <query>` pour la résolution de concepts, `get <entity> <id> [sections]` pour le détail ciblé, `<entity> <helper> <id>` pour les pivots inter-entités, `enrich` pour les jeux de gènes, `batch` pour les gets parallèles, et `search all` pour une orientation inter-entités commençant par les comptages. Les entités accessibles via get incluent gene, variant, article, author, trial, diagnostic, drug, disease, pathway, protein, adverse-event, pgx et cell-line, chacune mappée à des fournisseurs amont nommés. Les entités en recherche seule sont gwas et phenotype. Chaque `get` prend en charge des sections sélectionnables pour une divulgation progressive ; en mode JSON, les réponses exposent `_meta.next_commands` et `_meta.section_sources` pour les suivis et la provenance au niveau des sections. Les options d'installation incluent un script d'installation curl, PyPI via `uv tool install biomcp-cli` (le README avertit que le paquet PyPI sans rapport `biomcp` ne doit pas être utilisé), Homebrew, une image Docker GHCR, un marketplace de plugins Claude Code, un enregistrement MCP Codex et une extension Claude Desktop. Un mode serveur HTTP distant (`biomcp serve-http`) prend en charge les déploiements partagés, avec des routes de sonde à `/health`, `/readyz` et `/`. Le README note que la limitation de débit est locale au processus et recommande un point de terminaison HTTP partagé pour de nombreux workers concurrents, ainsi qu'un proxy TLS authentifié de confiance pour les déploiements distants. La plupart des commandes fonctionnent sans identifiants ; des clés API optionnelles (NCBI, Semantic Scholar, OpenFDA, NCI, OncoKB, AlphaGenome, DisGeNET) améliorent les limites de débit ou débloquent des enrichissements optionnels. Le projet déclare n'ajouter ni télémétrie, ni analytique, ni téléversement de journaux distants. BioMCP est sous licence MIT, effectue des requêtes à la demande plutôt que de vendre des jeux de données, et le README avertit que les conditions des sources amont régissent la réutilisation des résultats récupérés, KEGG et COSMIC étant signalés comme limites notables de réutilisation.