Платформа для исследования и анализа данных, позволяющая пользователям импортировать собственные наборы данных для визуализации и анализа.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONEvidence — это open-source альтернатива BI-инструментам с drag-and-drop: создавайте быстрые интерактивные отчеты с помощью SQL и markdown, а затем публикуйте их или развертывайте статически.
Apache Superset — это современное веб-приложение для бизнес-аналитики корпоративного уровня, предназначенное для исследования и визуализации данных.
DataPulse — это открытый слой верификации государственных данных Малайзии. Проект отслеживает 418 датасетов, предоставляя машиночитаемые доказательства их актуальности и лицензирования через MCP-сервер для ИИ-агентов.
Dagster — это облачный оркестратор конвейеров данных, предназначенный для разработки, эксплуатации и мониторинга информационных активов на протяжении всего их жизненного цикла.
Semantica — инфраструктура для построения графов знаний и контекстных графов, заменяющая или дополняющая векторный RAG. Предназначена для регулируемых отраслей с требованиями к объяснимости и аудируемости.
Apache Airflow — это платформа для программного создания, планирования и мониторинга рабочих процессов в виде кода, часто используемая для конвейеров данных и оркестрации AI/ML.
delta-explain — инструмент для визуализации отсечения файлов в Delta Lake. Он анализирует журналы транзакций, чтобы показать работу отсечения по разделам и пропуск файлов на основе статистик для заданного предиката, поддерживает CLI, Python API, гейты для CI и вывод отчётов в формате JSON.
Huey — бесплатный статичный веб-инструмент для анализа данных в браузере на базе DuckDB-WASM. Поддерживает CSV, Parquet, JSON, XLSX и DuckDB-файлы с возможностью создания сводных таблиц, конструктора запросов и производных атрибутов. Все данные обрабатываются локально.
Flow — это высокопроизводительный движок ETL и оркестратор рабочих процессов в виде одного бинарного файла на Go, с встроенным визуальным веб-редактором, декларативными XML-конвейерами, поддержкой кросс-баз данных и встроенной телеметрией аудита.
Prefect — это фреймворк для оркестрации рабочих процессов на базе Python, предназначенный для создания, автоматизации и мониторинга отказоустойчивых конвейеров данных с функциями планирования и повторных попыток.
Made With ML — это открытый курс и кодовая база, обучающая проектированию, разработке, развёртыванию и итерации приложений машинного обучения промышленного уровня, охватывающая MLOps, тестирование, сервинг, CI/CD и непрерывное обучение.
RisingWave — это платформа потоковой передачи событий для агентного ИИ, которая объединяет сбор, обработку и предоставление данных в единой системе.
Локальный конвейер real-time аналитики с использованием Redpanda (Kafka-совместимый брокер) и PySpark Structured Streaming. Эмулирует clickstream события, выполняет агрегацию по окнам с watermarking — всё через docker-compose.
Argo Workflows — это контейнерный движок рабочих процессов для оркестрации параллельных заданий в Kubernetes, реализованный в виде Custom Resource Definition (CRD).
Kestra — это open-source платформа оркестрации с событийным управлением, предназначенная для рабочих процессов данных, ИИ и инфраструктуры, использующая декларативный интерфейс YAML.
Taipy — это Python-фреймворк для дата-сайентистов и ML-инженеров, позволяющий создавать и развертывать готовые к эксплуатации веб-приложения на основе данных и ИИ без изучения фронтенд-языков.
Xonsh — это полнофункциональная кроссплатформенная оболочка, использующая Python 3 в качестве языка, плавно интегрирующая команды оболочки с Python. Работает на Linux, macOS, Windows, BSD, Jupyter, Android, Raspberry Pi и Nix, с системой расширений и функциями для ИИ.
SolarisPKN-Stats — это автоматизированная система сбора, хранения и обновления статистики проектов с различных платформ в структурированные JSON-файлы.
CocoIndex — фреймворк инкрементального индексирования с открытым исходным кодом для предоставления AI-агентам и LLM-приложениям актуального контекста путём переработки только изменённых данных.