CocoIndex는 코베이스, 회의록, Slack, PDF, 영상 등 다양한 데이터원을 LLM 애플리케이션용 실시간 컨텍스트로 변환하는 오픈소스 점증적 인덱싱 프레임워크입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONDeck Lab은 Python/Flask 기반의 Commander(MTG) 덱 빌딩·리서치·골드피시 시뮬레이션 작업 공간으로, 버전화된 데이터 계약, 격리된 QA, 검증된 컨테이너 릴리스를 갖춘다.
Great Expectations (GX Core)는 데이터 일관성과 신뢰성을 보장하기 위해 데이터 단위 테스트 프레임워크를 제공하는 오픈 소스 Python 라이브러리입니다.
사용자가 맞춤형 데이터 세트를 가져와 시각화 및 분석을 수행할 수 있는 데이터 연구 및 분석 플랫폼입니다.
Evidence는 드래그 앤 드롭 방식의 BI 도구를 대체하는 오픈 소스 코드 기반 도구로, SQL과 markdown을 사용하여 빠르고 인터랙티브한 보고서를 구축하고 정적 사이트로 게시하거나 자체 호스팅할 수 있습니다.
Apache Superset은 데이터 탐색 및 시각화에 사용되는 현대적인 기업용 비즈니스 인텔리전스(BI) 웹 애플리케이션입니다.
DataPulse는 말레이시아 공공 데이터를 위한 개방형 읽기 전용 신뢰 및 검증 레이어입니다. 418개의 공식 데이터셋을 반복적으로 조사하여 최신성, 라이선스, 스키마 및 출처에 대한 기계 판독 가능 증거를 게시하며, 19개의 도구를 갖춘 읽기 전용 MCP 서버를 통해 AI 에이전트에게 카탈로그를 제공합니다.
Dagster는 데이터 자산의 전체 라이프사이클에 걸친 개발, 운영 및 관찰을 위해 설계된 클라우드 네이티브 데이터 파이프라인 오케스트레이터입니다.
Semantica는 그래프 네이티브 인프라로, LLM과 에이전트를 위한 시맨틱 레이어로서 구조화된 컨텍스트, 결정론적 추론, 완전한 의사결정 계보를 제공합니다.
Apache Airflow는 워크플로우를 코드로 작성, 예약 및 모니터링하는 플랫폼으로, 주로 데이터 파이프라인과 AI/ML 오케스트레이션에 사용됩니다.
delta-explain은 Delta Lake의 파일 프루닝 과정을 시각화하는 도구로, 트랜잭션 로그를 분석해 주어진 조건에 따른 파티션 프루닝과 통계 기반 파일 스킵 결과를 보여줍니다. CLI, Python API, CI 게이트, JSON 리포팅 기능을 지원합니다.
Huey는 DuckDB-WASM을 활용하는 무료 오픈소스 정적 웹 애플리케이션으로, CSV, Parquet, JSON, XLSX, DuckDB 파일을 브라우저에서 직접 탐색·분석할 수 있는 도구입니다..pivot 테이블, 쿼리 빌더, 파생 속성 생성을 지원하며 모든 데이터 처리는 로컬에서 이루어져 프라이버시를 보장합니다.
Flow는 단일 바이너리, 고성능 ETL 엔진 및 워크플로우 오케스트레이터로, Go로 작성되었습니다. 임베디드 시각적 웹 빌더, 선언적 XML 파이프라인, 크로스 데이터베이스 지원, 내장 감사 텔레메트리를 특징으로 합니다.
Prefect는 스케줄링 및 재시도와 같은 기능을 통해 탄력적인 데이터 파이프라인을 구축, 자동화 및 모니터링하도록 설계된 Python 기반 워크플로우 오케스트레이션 프레임워크입니다.
Made With ML은 프로덕션 수준의 머신러닝 애플리케이션 구축을 가르치는 오픈소스 교육 저장소 및 강좌입니다. MLOps, 테스트, 서빙, CI/CD, 지속학습까지ครอบคลุม합니다.
RisingWave는 데이터 수집, 처리, 서빙을 단일 시스템으로 통합하여 에이전트형 AI를 위해 설계된 이벤트 스트리밍 플랫폼입니다.
Redpanda와 PySpark Structured Streaming을 활용한 로컬 실시간 분석 파이프라인. Docker Compose로 클릭스트림 이벤트 시뮬레이션, 워터마킹 기반 시간 윈도우 집계 등을 구현한 교육용 프로젝트입니다.
Argo Workflows는 Kubernetes에서 병렬 작업을 오케스트레이션하기 위한 컨테이너 네이티브 워크플로우 엔진으로, Custom Resource Definition(CRD)으로 구현되었습니다.
Kestra는 선언적 YAML 인터페이스를 활용하여 데이터, AI 및 인프라 워크플로우를 위해 설계된 오픈 소스 이벤트 기반 오케스트레이션 플랫폼입니다.
Taipy는 데이터 과학자와 ML 엔지니어가 프론트엔드 언어를 배우지 않고도 프로덕션 수준의 데이터 및 AI 기반 웹 애플리케이션을 구축하고 배포할 수 있도록 설계된 Python 프레임워크입니다.