À propos du projet

DataPulse est une couche de vérification ouverte et en lecture seule pour les données publiques malaisiennes. Il ne republie pas les jeux de données officiels ; au lieu de cela, il sonde répétitivement les sources, enregistre ce qu'il observe réellement et publie des preuves lisibles par machine sur chaque jeu de données afin que les humains et les agents IA puissent juger si un chiffre peut être réutilisé ou cité en toute sécurité. Le tableau de bord en direct est disponible sur data-pulse.my. Catalogue Le projet suit 418 jeux de données officiels malaisiens, organisés par identifiant de publisher stable (custodian). Les publishers incluent la Bank Negara Malaysia, le Department of Statistics Malaysia (DOSM/OpenDOSM), l'Accountant General's Department, le Department of Environment, le Department of Agriculture and Fisheries, la National Anti-Drugs Agency, et d'autres. L'inventaire couvre les séries économiques et financières (OPR, taux de change, taux d'intérêt, inflation, agrégats monétaires, systèmes de paiement), les statistiques démographiques et de santé, la criminalité, l'agriculture et la surveillance environnementale. Trente des entrées sont des flux de transit GTFS (KTMB, Prasarana, BAS.MY), couvrant à la fois les horaires statiques et les positions des véhicules en temps réel. Chaque jeu de données possède une page de documentation, et certains incluent des échantillons CSV ou JSON. Taxonomie de santé Au lieu d'une simple coche verte, chaque jeu de données porte l'un des dix statuts honnêtes : fresh, aging, stale, discontinued, degraded, browser-dependent, unreachable, unknown, unknown-freshness ou reference. Une source qui fonctionne mais dont on ne peut prouver l'actualité est étiquetée unknown-freshness plutôt que supposée saine ; une série qu'un publisher a cessé de mettre à jour est marquée discontinued (une décision du publisher, données gelées) plutôt que traitée comme un échec de fraîcheur. Les lignes de référence décrivent des données de recherche versionnées où la fraîcheur basée sur la date ne s'applique pas, avec des variantes telles que policy-reference et reference-current. Un _trust_summary public rapporte la distribution actuelle et compte explicitement les signaux de fraîcheur et de nombre de lignes manquants. Les changements de santé peuvent être suivis via un flux RSS. Licences et provenance Chaque jeu de données déclare sa licence sous une forme lisible par machine, reproductible à partir de datapulse.json. La distribution déclarée inclut Creative Commons Attribution 4.0, Open Government Licence (Malaysia), MIT, Singapore Open Data Licence, MBPP Government Open Data Terms, et certaines lignes où la licence du publisher n'est pas précisée. Le sondage suit un calendrier hiérarchisé et conscient de la cadence (par exemple, quotidien, hebdomadaire pour les prix du carburant, mensuel pour les enquêtes), et chaque jeu de données dispose d'un steward lisible par l'humain ainsi que d'un identifiant de custodian stable pour la provenance du publisher. Vérification Le projet décrit trois couches vérifiables : une enveloppe signée Ed25519 sur le contenu exact de chaque observation, une vérification de la source d'enregistrement où l'observation servie correspond au bit près à la source Git versionnée, et un témoin temporel sous la forme d'une preuve d'inclusion dans un journal public Rekor/Sigstore. Un script autonome (scripts/verify_external.py) peut être téléchargé et exécuté sans cloner le dépôt ni utiliser le code de DataPulse. Le README est explicite sur la portée : la plateforme prouve l'intégrité et le timing de ses observations, et non que le chiffre gouvernemental en amont est sémantiquement vrai. Accès Agent DataPulse expose un serveur MCP en lecture seule à l'adresse https://mcp.data-pulse.my/mcp via Streamable HTTP sans authentification. Il propose 19 outils en lecture seule sur le catalogue des 418 jeux de données, notamment search_datasets, get_dataset, get_data_passport, find_stale, find_anomalies, find_deteriorating, find_recovering, find_unreliable, find_schema_drift, check_reconciliation, get_provenance, get_evidence, verify_dataset, get_freshness_summary, verify_evidence, trust_verdict, verify_attestation, find_by_licence et usage_summary. La connexion depuis Claude Desktop, Cursor ou Cline se fait via un seul bloc de configuration JSON. Les fichiers de découverte publics incluent llms.txt, agent.json, mcp.json et un sitemap. Sources dépendantes du navigateur Cinq sources (environ 1,4 % du catalogue) rendent du JavaScript côté client et sont sondées avec Camofox, un sidecar headless-Chromium patché et auto-hébergé, configuré via la variable d'environnement CAMOFOX_BASE_URL. Sans cela, ces jeux de données conservent honnêtement le statut browser-dependent. Public visé Le projet s'adresse aux constructeurs d'IA et aux développeurs d'agents qui souhaitent des vérifications de fraîcheur et de licence avant qu'un modèle ne cite un chiffre malaisien ; aux chercheurs, analystes et journalistes qui ont besoin de fonder leur travail sur des données vérifiables ; aux équipes de conformité et de surveillance réglementaire nécessitant un enregistrement infalsifiable qu'un chiffre a été vérifié à un moment donné ; et aux technologues civiques recherchant une vue transparente de la découvrabilité et de la fiabilité de la description des données publiques. Le sondage est décrit comme étant en lecture seule et légal : sources publiques uniquement, limité en débit, auto-identifié et ne contournant jamais l'authentification.