Prefect es un marco de orquestación de flujos de trabajo basado en Python, diseñado para construir, automatizar y monitorear tuberías de datos resilientes con funciones de programación y reintentos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONMade With ML es un curso y código abierto que enseña cómo diseñar, desarrollar, desplegar e iterar en aplicaciones de aprendizaje automático de grado productivo, cubriendo MLOps, pruebas, servicio, CI/CD y aprendizaje continuo.
RisingWave es una plataforma de streaming de eventos diseñada para IA agéntica que integra la ingesta, el procesamiento y el servicio de datos en un único sistema.
Pipeline de análisis en tiempo real en Docker que usa Redpanda como broker compatible con Kafka y PySpark Structured Streaming. Simula eventos clickstream, aplica agregación con ventanas y watermarking.
Argo Workflows es un motor de flujo de trabajo nativo de contenedores para orquestar trabajos paralelos en Kubernetes, implementado como una Definición de Recurso Personalizado (CRD).
Kestra es una plataforma de orquestación de código abierto y orientada a eventos, diseñada para flujos de trabajo de datos, IA e infraestructura, utilizando una interfaz declarativa de YAML.
Taipy es un framework de Python diseñado para que científicos de datos e ingenieros de ML creen y desplieguen aplicaciones web de datos e IA listas para producción sin necesidad de aprender lenguajes front-end.
Xonsh es un shell multiplataforma que utiliza Python 3 como lenguaje, integrando comandos de shell con sintaxis de Python. Compatible con Linux, macOS, Windows y más, ofrece extensiones e integración con IA.
SolarisPKN-Stats es un sistema automatizado para recopilar, almacenar y actualizar estadísticas de proyectos de múltiples plataformas en archivos JSON estructurados.
CocoIndex es un framework de indexación incremental de código abierto que ofrece a agentes de IA y aplicaciones LLM contexto siempre actualizado reprocesando solo los datos modificados.
Deck Lab es un espacio de trabajo en Python/Flask para construir, investigar y simular goldfish mazos competitivos de Commander (MTG), con contratos de datos versionados, QA aislado y lanzamientos de contenedores verificados. body:
Great Expectations (GX Core) es una biblioteca de Python de código abierto para la calidad de los datos, que proporciona un marco para crear pruebas unitarias de datos para garantizar la coherencia y la fiabilidad.
Una plataforma de investigación y análisis de datos que permite a los usuarios importar conjuntos de datos personalizados para su visualización y análisis.
Evidence es una alternativa de código abierto y basada en código a las herramientas de BI de arrastrar y soltar: cree informes rápidos e interactivos con SQL y markdown, y luego publíquelos o alójelos.
Apache Superset es una aplicación web de inteligencia de negocios moderna y preparada para empresas, utilizada para la exploración y visualización de datos.
DataPulse es una capa de confianza y verificación abierta y de solo lectura para datos públicos de Malasia. Analiza 418 conjuntos de datos oficiales, publica evidencia legible por máquina sobre frescura, licencias y procedencia, y expone el catálogo a agentes de IA mediante un servidor MCP de solo lectura con 19 herramientas.
Dagster es un orquestador de pipelines de datos nativo de la nube diseñado para el desarrollo, la producción y la observación de activos de datos a lo largo de todo su ciclo de vida.
Semantica es una infraestructura de conocimiento para desarrolladores que permite crear Context Graphs y Knowledge Graphs, ofreciendo razonamiento determinista, trazabilidad de decisiones y cumplimiento normativo para dominios regulados como finanzas y salud.
Apache Airflow es una plataforma para crear, programar y monitorear flujos de trabajo mediante código, utilizada comúnmente para tuberías de datos y orquestación de AI/ML.
delta-explain visualiza la poda de archivos de Delta Lake. Lee los registros de transacciones para mostrar la poda por particiones y la omisión basada en estadísticas para un predicado dado, con CLI, API de Python, control en CI y generación de informes JSON.