Sobre o projeto

DataPulse é uma camada de verificação aberta e de apenas leitura para dados públicos da Malásia. Ele não republica conjuntos de dados oficiais; em vez disso, sonda repetidamente as fontes, registra o que observa e publica evidências legíveis por máquina sobre cada conjunto de dados, para que humanos e agentes de IA possam julgar se um número é seguro para reutilização ou citação. O painel ao vivo está em data-pulse.my. Catálogo O projeto rastreia 418 conjuntos de dados oficiais da Malásia, organizados por ID de publicador estável (custodiante). Os publicadores incluem o Bank Negara Malaysia, o Departamento de Estatísticas da Malásia (DOSM/OpenDOSM), o Departamento do Contador Geral, o Departamento de Meio Ambiente, o Departamento de Agricultura e Pescas, a Agência Nacional Antidrogas, entre outros. O inventário abrange séries econômicas e financeiras (OPR, taxas de câmbio, taxas de juros, inflação, agregados monetários, sistemas de pagamento), estatísticas demográficas e de saúde, crime, agricultura e monitoramento ambiental. Trinta das entradas são feeds de trânsito GTFS (KTMB, Prasarana, BAS.MY), cobrindo tanto horários estáticos quanto posições de veículos em tempo real. Cada conjunto de dados possui uma página de documentação, e alguns incluem amostras em CSV ou JSON. Taxonomia de saúde Em vez de uma marca de verificação verde genérica, cada conjunto de dados possui um de dez status honestos: fresh, aging, stale, discontinued, degraded, browser-dependent, unreachable, unknown, unknown-freshness ou reference. Uma fonte que funciona, mas não pode ser comprovada como atual, é rotulada como unknown-freshness em vez de presumida como saudável; uma série que o publicador parou de atualizar é marcada como discontinued (uma decisão do publicador, dados congelados) em vez de ser tratada como uma falha de atualidade. Linhas de referência descrevem dados de consulta versionados onde a atualidade baseada em data não se aplica, com variantes como policy-reference e reference-current. Um _trust_summary público relata a distribuição atual e conta explicitamente sinais ausentes de atualidade e contagem de linhas. Mudanças de saúde podem ser acompanhadas via feed RSS. Licenças e proveniência Cada conjunto de dados declara sua licença em formato legível por máquina, reproduzível a partir do datapulse.json. A distribuição declarada inclui Creative Commons Attribution 4.0, Open Government Licence (Malaysia), MIT, Singapore Open Data Licence, MBPP Government Open Data Terms e algumas linhas onde a licença do publicador não é declarada. A sondagem segue um cronograma escalonado e consciente da cadência (por exemplo, diário, semanal para preços de combustível, mensal para pesquisas), e cada conjunto de dados possui um gestor legível por humanos e um ID de custodiante estável para a proveniência do publicador. Verificação O projeto descreve três camadas verificáveis: um envelope assinado com Ed25519 sobre o conteúdo exato de cada observação, uma verificação de fonte de registro onde a observação servida corresponde byte a byte à fonte Git versionada, e uma testemunha temporal na forma de uma prova de inclusão de log público Rekor/Sigstore. Um script independente (scripts/verify_external.py) pode ser baixado e executado sem a necessidade de clonar o repositório ou usar qualquer código do DataPulse. O README é explícito sobre o escopo: a plataforma prova a integridade e o tempo de suas observações, não que um número governamental de origem seja semanticamente verdadeiro. Acesso de agentes O DataPulse expõe um servidor MCP de apenas leitura em https://mcp.data-pulse.my/mcp via Streamable HTTP sem autenticação. Ele anuncia 19 ferramentas de apenas leitura sobre o catálogo de 418 conjuntos de dados, incluindo search_datasets, get_dataset, get_data_passport, find_stale, find_anomalies, find_deteriorating, find_recovering, find_unreliable, find_schema_drift, check_reconciliation, get_provenance, get_evidence, verify_dataset, get_freshness_summary, verify_evidence, trust_verdict, verify_attestation, find_by_licence e usage_summary. A conexão a partir do Claude Desktop, Cursor ou Cline é feita por um único bloco de configuração JSON. Arquivos de descoberta pública incluem llms.txt, agent.json, mcp.json e um sitemap. Fontes dependentes de navegador Cinco fontes (cerca de 1,4% do catálogo) renderizam JavaScript no lado do cliente e são sondadas com o Camofox, um sidecar headless-Chromium patcheado e auto-hospedado, configurado através da variável de ambiente CAMOFOX_BASE_URL. Sem ele, esses conjuntos de dados permanecem honestamente com o status browser-dependent. Público-alvo O projeto é voltado para construtores de IA e desenvolvedores de agentes que desejam verificações de atualidade e licença antes que um modelo cite um dado da Malásia; pesquisadores, analistas e jornalistas que precisam fundamentar seu trabalho em dados verificáveis; equipes de conformidade e monitoramento regulatório que necessitam de um registro à prova de adulteração de que um número foi verificado em um momento conhecido; e tecnólogos cívicos que buscam uma visão transparente de quão descritíveis e confiáveis são os dados públicos. A sondagem é descrita como sendo de apenas leitura e legal: apenas fontes publicamente disponíveis, com limite de taxa, autoidentificáveis e nunca ignorando a autenticação.