Об этом проекте

Daft — это высокопроизводительный движок данных, предназначенный для ИИ и мультимодальных рабочих нагрузок. Он позволяет пользователям обрабатывать изображения, аудио, видео, эмбеддинги и структурированные данные в рамках единого фреймворка и описывается как Python-нативный с ядром на Rust. Ключевые возможности, отмеченные в README: - Нативная мультимодальная обработка: работа с изображениями, аудио, видео и эмбеддингами наряду со структурированными данными в одном фреймворке. - Встроенные ИИ-операции: выполнение LLM-промптов, генерация эмбеддингов и классификация данных в масштабе с использованием OpenAI, Transformers или пользовательских моделей. - Python-нативный, на движке Rust: Python в основе с Rust под капотом, без сложности JVM. - Бесшовное масштабирование: запуск локально и масштабирование до распределённых кластеров на Ray или Kubernetes. - Универсальная связность: доступ к данным из S3, GCS, Iceberg, Delta Lake, Hugging Face и Unity Catalog. - Надёжность из коробки: интеллектуальное управление памятью и разумные настройки по умолчанию. Установка выполняется через `pip install daft` и требует Python 3.10 или выше. README ссылается на quickstart, который загружает реальный набор данных электронной коммерции, обрабатывает изображения товаров и запускает ИИ-инференс в масштабе, а также на примеры, руководство пользователя и справочник по API. Также упоминается страница бенчмарков. Проект приветствует вклад и перечисляет good first issues. Он собирает неидентифицируемую телеметрию через Scarf, которую можно отключить, установив `DO_NOT_TRACK=true`; в README указано, что идентификаторы сессий или пользователей не собираются и проприетарный код или данные не собираются. Сравнительная таблица в README позиционирует Daft рядом с Pandas, Polars, Modin, Ray Data, PySpark и Dask DF по таким атрибутам, как оптимизатор запросов, поддержка мультимодальности, распределённое выполнение, поддержка Arrow, векторизованное выполнение и out-of-core обработка. Daft лицензирован под Apache 2.0.