Sobre el proyecto

Apache DataFusion es un motor de consultas extensible diseñado para desarrolladores que crean sistemas analíticos y bases de datos de alto rendimiento. Escrito en Rust y utilizando Apache Arrow para su formato en memoria, cuenta con un planificador de consultas completo y un motor de ejecución vectorizado, multihilo, de streaming y columnar. Las capacidades clave incluyen: - APIs: Proporciona interfaces tanto de SQL como de DataFrame para realizar consultas. - Soporte de datos: Soporte integrado para los formatos CSV, Parquet, JSON y Avro. - Extensibilidad: Permite la personalización de fuentes de datos, lenguajes de consulta, funciones y operadores. - Ecosistema: Integrado con subproyectos que incluyen DataFusion Python, DataFusion Java, DataFusion Comet (acelerador de Spark) y DataFusion Ballista (ejecución distribuida). El motor es adecuado para crear motores de consultas específicos de dominio, nuevas plataformas de bases de datos y canalizaciones de datos. Incluye varias características opcionales para compresión, expresiones criptográficas y cifrado modular de Parquet.