NVIDIA cuDF es una biblioteca de DataFrames acelerada por GPU para procesamiento de datos tabulares, parte del conjunto CUDA-X. Ofrece API compatibles con pandas, un motor GPU para Polars y un backend Dask para manipulación de datos de alto rendimiento.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONFlow es un motor ETL y orquestador de flujo de trabajo de alto rendimiento, escrito en Go, con un único binario. Cuenta con un constructor web visual integrado, pipelines XML declarativos, compatibilidad entre bases de datos y telemetría de auditoría integrada.
Un repositorio educativo que enseña aprendizaje automático supervisado desde los principios básicos utilizando Python, cubriendo fundamentos matemáticos e implementaciones prácticas.
Currículo gratuito de ciencia de datos de Microsoft para principiantes, con 20 lecciones, proyectos prácticos, cuestionarios y traducciones en más de 50 idiomas.
FiftyOne es una herramienta de código abierto para crear conjuntos de datos de alta calidad y modelos de visión por computadora. Permite a los usuarios visualizar, etiquetar, evaluar y curar datos de inteligencia artificial visual.
OpenRefine es una herramienta de código abierto basada en Java diseñada para limpiar, transformar y conciliar datos desordenados a través de una interfaz de navegador web.
Great Expectations (GX Core) es una biblioteca de Python de código abierto para la calidad de los datos, que proporciona un marco para crear pruebas unitarias de datos para garantizar la coherencia y la fiabilidad.
VectorBT es una biblioteca de backtesting de Python de código abierto que vectoriza la investigación de estrategias: empaqueta miles de combinaciones de parámetros en arrays de NumPy y los acelera con Numba y un motor Rust opcional, además de análisis de cartera y visualización interactiva con Plotly.
Una plataforma de investigación y análisis de datos que permite a los usuarios importar conjuntos de datos personalizados para su visualización y análisis.
Evidence es una alternativa de código abierto y basada en código a las herramientas de BI de arrastrar y soltar: cree informes rápidos e interactivos con SQL y markdown, y luego publíquelos o alójelos.
Apache Superset es una aplicación web de inteligencia de negocios moderna y preparada para empresas, utilizada para la exploración y visualización de datos.
tsfresh es un paquete de Python para la extracción y selección automática de características de series temporales, combinando estadística, procesamiento de señales y pruebas de hipótesis.
IPython es una potente shell de comandos interactiva para la computación en múltiples lenguajes de programación, principalmente Python, que ofrece una introspección y shell integration mejoradas.
pandas es una potente biblioteca de Python que proporciona estructuras de datos rápidas, flexibles y expresivas diseñadas para trabajar con datos relacionales o etiquetados.
Apache Airflow es una plataforma para crear, programar y monitorear flujos de trabajo mediante código, utilizada comúnmente para tuberías de datos y orquestación de AI/ML.
Trino es un motor de consultas SQL distribuido y rápido diseñado para el análisis de big data, anteriormente conocido como PrestoSQL.
Un cliente de terminal enriquecido para MySQL con autocompletado, resaltado de sintaxis e integración de dataframes.
marimo es un cuaderno de Python reactivo que garantiza la coherencia entre el código y los resultados, almacenados como archivos Python puros para facilitar el uso de git y la implementación.
Statsmodels es una biblioteca de Python para modelado estadístico, econometría y análisis de datos. Soporta regresión, series temporales, análisis de supervivencia y más.
Una biblioteca de Python para enriquecer DataFrames de pandas mediante la adición de nuevas columnas generadas por modelos de IA basados en instrucciones en lenguaje natural.