Sobre el proyecto
Apache DataFusion es un motor de consultas extensible diseñado para desarrolladores que crean sistemas analíticos y bases de datos de alto rendimiento. Escrito en Rust y utilizando Apache Arrow para su formato en memoria, cuenta con un planificador de consultas completo y un motor de ejecución vectorizado, multihilo, de streaming y columnar.
Las capacidades clave incluyen:
- APIs: Proporciona interfaces tanto de SQL como de DataFrame para realizar consultas.
- Soporte de datos: Soporte integrado para los formatos CSV, Parquet, JSON y Avro.
- Extensibilidad: Permite la personalización de fuentes de datos, lenguajes de consulta, funciones y operadores.
- Ecosistema: Integrado con subproyectos que incluyen DataFusion Python, DataFusion Java, DataFusion Comet (acelerador de Spark) y DataFusion Ballista (ejecución distribuida).
El motor es adecuado para crear motores de consultas específicos de dominio, nuevas plataformas de bases de datos y canalizaciones de datos. Incluye varias características opcionales para compresión, expresiones criptográficas y cifrado modular de Parquet.