Sobre el proyecto
DataPulse es una capa de verificación abierta y de solo lectura para los datos públicos de Malasia. No republica conjuntos de datos oficiales; en su lugar, sondea repetidamente las fuentes, registra lo que observa realmente y publica evidencia legible por máquina sobre cada conjunto de datos para que los humanos y los agentes de IA puedan juzgar si una cifra es segura para reutilizar o citar. El tablero en vivo se encuentra en data-pulse.my.
Catálogo
El proyecto rastrea 418 conjuntos de datos oficiales de Malasia, organizados por un ID de editor estable (custodio). Los editores incluyen el Bank Negara Malaysia, el Departamento de Estadísticas de Malasia (DOSM/OpenDOSM), el Departamento del Contador General, el Departamento de Medio Ambiente, el Departamento de Agricultura y Pesca, la Agencia Nacional Antidrogas, entre otros. El inventario abarca series económicas y financieras (OPR, tipos de cambio, tasas de interés, inflación, agregados monetarios, sistemas de pago), estadísticas demográficas y de salud, crimen, agricultura y monitoreo ambiental. Treinta de las entradas son feeds de tránsito GTFS (KTMB, Prasarana, BAS.MY), que cubren tanto horarios estáticos como posiciones de vehículos en tiempo real. Cada conjunto de datos tiene una página de documentación y algunos incluyen muestras en CSV o JSON.
Taxonomía de salud
En lugar de una marca de verificación verde general, cada conjunto de datos lleva uno de diez estados honestos: fresh, aging, stale, discontinued, degraded, browser-dependent, unreachable, unknown, unknown-freshness o reference. Una fuente que funciona pero que no puede demostrar estar actualizada se etiqueta como unknown-freshness en lugar de asumirse como saludable; una serie que un editor ha dejado de actualizar se marca como discontinued (una decisión del editor, datos congelados) en lugar de tratarse como un fallo de frescura. Las filas de referencia describen datos de búsqueda versionados donde la frescura basada en la fecha no aplica, con variantes como policy-reference y reference-current. Un _trust_summary público informa la distribución actual y cuenta explícitamente las señales faltantes de frescura y de recuento de filas. Los cambios de salud pueden seguirse a través de un feed RSS.
Licencias y procedencia
Cada conjunto de datos declara su licencia en formato legible por máquina, reproducible desde datapulse.json. La distribución declarada incluye Creative Commons Attribution 4.0, Open Government Licence (Malaysia), MIT, Singapore Open Data Licence, MBPP Government Open Data Terms y algunas filas donde la licencia del editor no está declarada. El sondeo sigue un programa escalonado y consciente de la cadencia (por ejemplo, diario, semanal para precios de combustible, mensual para encuestas), y cada conjunto de datos cuenta con un administrador legible por humanos más un ID de custodio estable para la procedencia del editor.
Verificación
El proyecto describe tres capas verificables: un sobre firmado con Ed25519 sobre el contenido exacto de cada observación, una verificación de fuente de registro donde la observación servida coincide byte a byte con la fuente versionada en Git, y un testigo temporal en forma de una prueba de inclusión en el registro público de Rekor/Sigstore. Un script independiente (scripts/verify_external.py) puede descargarse y ejecutarse sin necesidad de clonar el repositorio ni utilizar ningún código de DataPulse. El README es explícito sobre el alcance: la plataforma demuestra la integridad y el tiempo de sus observaciones, no que una cifra gubernamental ascendente sea semánticamente verdadera.
Acceso de agentes
DataPulse expone un servidor MCP de solo lectura en https://mcp.data-pulse.my/mcp a través de Streamable HTTP sin autenticación. Anuncia 19 herramientas de solo lectura sobre el catálogo de 418 conjuntos de datos, que incluyen search_datasets, get_dataset, get_data_passport, find_stale, find_anomalies, find_deteriorating, find_recovering, find_unreliable, find_schema_drift, check_reconciliation, get_provenance, get_evidence, verify_dataset, get_freshness_summary, verify_evidence, trust_verdict, verify_attestation, find_by_licence y usage_summary. La conexión desde Claude Desktop, Cursor o Cline es un único bloque de configuración JSON. Los archivos de descubrimiento público incluyen llms.txt, agent.json, mcp.json y un sitemap.
Fuentes dependientes del navegador
Cinco fuentes (aproximadamente el 1.4% del catálogo) renderizan JavaScript del lado del cliente y son sondeadas con Camofox, un sidecar de headless-Chromium parcheado y auto-alojado, configurado a través de la variable de entorno CAMOFOX_BASE_URL. Sin esto, esos conjuntos de datos permanecen honestamente en estado browser-dependent.
Audiencia prevista
El proyecto está dirigido a constructores de IA y desarrolladores de agentes que deseen verificaciones de frescura y licencia antes de que un modelo cite una cifra malasia; investigadores, analistas y periodistas que necesiten fundamentar su trabajo en datos verificables; equipos de cumplimiento y monitoreo regulatorio que necesiten un registro a prueba de manipulaciones de que una cifra fue verificada en un momento conocido; y tecnólogos cívicos que busquen una visión transparente de qué tan descubribles y confiablemente descritos están los datos públicos. El sondeo se describe como de solo lectura y legal: solo fuentes disponibles públicamente, con límite de tasa, auto-identificables y sin saltarse nunca la autenticación.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.