Sobre el proyecto
BioMCP es un binario CLI único construido alrededor de una gramática de comandos que accede directamente a aproximadamente 70 fuentes biomédicas confiables, incluyendo PubMed, ClinVar, ClinicalTrials.gov, OncoKB y Reactome, con fuentes adicionales que aparecen dentro de las respuestas de otras fuentes. Las mismas herramientas se exponen como un servidor de Protocolo de Contexto de Modelo (MCP), por lo que agentes de IA como Claude Code, Codex y Claude Desktop pueden llamarlas.
El objetivo declarado es reducir el laberinto habitual de datos biomédicos: una consulta llega a fuentes que normalmente están detrás de diferentes API, identificadores y hábitos de búsqueda. Investigadores, clínicos y agentes usan la misma gramática para buscar, enfocar y pivotar sin reconstruir un flujo de trabajo por fuente. Los resultados se describen como compactos y orientados a evidencia, abarcando datos públicos en vivo más análisis de estudios locales.
Capacidades clave descritas en el README:
- Búsqueda de literatura: `search article` se expande a PubTator3 y Europe PMC, deduplica identificadores PMID/PMCID/DOI, y puede añadir una etapa de Semantic Scholar cuando los filtros lo permiten.
- Pivotes entre entidades: pasar de un gen, variante, fármaco, enfermedad, vía, proteína o artículo a la siguiente vista integrada sin reconstruir filtros manualmente.
- Playbooks: `biomcp skill list` muestra ejemplos trabajados incluidos, abiertos mediante `biomcp skill <slug>`.
- Análisis de estudios locales: los comandos `study` cubren flujos de consulta local, cohorte, supervivencia, comparación y co-ocurrencia con gráficos en terminal, SVG y PNG para conjuntos de datos descargados estilo cBioPortal.
- Ayudas de rastro de papel: `article citations`, `article references`, `article recommendations` y `article entities` expanden un artículo conocido en un mapa de evidencia más amplio.
- Enriquecimiento y procesamiento por lotes: `biomcp enrich` para enriquecimiento de conjuntos génicos con g:Profiler, y `biomcp batch` para hasta 10 llamadas `get` enfocadas en un solo comando.
La gramática de comandos se organiza como `search <entidad> [filtros]` para descubrimiento, `skill list` para el catálogo de playbooks, `discover <consulta>` para resolución de conceptos, `get <entidad> <id> [secciones]` para detalle enfocado, `<entidad> <ayudante> <id>` para pivotes entre entidades, `enrich` para conjuntos de genes, `batch` para gets paralelos, y `search all` para orientación entre entidades con recuentos primero.
Las entidades obtenibles incluyen gen, variante, artículo, autor, ensayo, diagnóstico, fármaco, enfermedad, vía, proteína, evento adverso, pgx y línea celular, cada una mapeada a proveedores ascendentes nombrados. Las entidades solo de búsqueda son gwas y fenotipo. Cada `get` admite secciones seleccionables para divulgación progresiva; en modo JSON, las respuestas exponen `_meta.next_commands` y `_meta.section_sources` para seguimientos y procedencia a nivel de sección.
Las opciones de instalación incluyen un script de instalación curl, PyPI mediante `uv tool install biomcp-cli` (el README advierte que el paquete PyPI `biomcp` no relacionado no debe usarse), Homebrew, una imagen Docker GHCR, un mercado de plugins de Claude Code, un registro MCP de Codex y una extensión de Claude Desktop. Un modo de servidor HTTP remoto (`biomcp serve-http`) admite implementaciones compartidas, con rutas de sondeo en `/health`, `/readyz` y `/`. El README señala que la limitación de velocidad es local al proceso y recomienda un endpoint HTTP compartido para muchos trabajadores concurrentes, además de un proxy TLS autenticado y confiable para implementaciones remotas.
La mayoría de los comandos funcionan sin credenciales; las claves API opcionales (NCBI, Semantic Scholar, OpenFDA, NCI, OncoKB, AlphaGenome, DisGeNET) mejoran los límites de velocidad o desbloquean enriquecimientos opcionales. El proyecto declara que no añade telemetría, análisis ni carga de registros remota. BioMCP tiene licencia MIT, realiza consultas bajo demanda en lugar de vender conjuntos de datos, y el README advierte que los términos de las fuentes ascendentes rigen la reutilización de los resultados recuperados, destacando KEGG y COSMIC como límites notables de reutilización.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.