사용자가 맞춤형 데이터 세트를 가져와 시각화 및 분석을 수행할 수 있는 데이터 연구 및 분석 플랫폼입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONEvidence는 드래그 앤 드롭 방식의 BI 도구를 대체하는 오픈 소스 코드 기반 도구로, SQL과 markdown을 사용하여 빠르고 인터랙티브한 보고서를 구축하고 정적 사이트로 게시하거나 자체 호스팅할 수 있습니다.
Apache Superset은 데이터 탐색 및 시각화에 사용되는 현대적인 기업용 비즈니스 인텔리전스(BI) 웹 애플리케이션입니다.
tsfresh는 시계열 데이터에서 수백 개의 특징을 자동으로 추출하고 선택하는 Python 패키지로, 통계, 신호 처리, 가설 검정을 결합하여 머신러닝에 적합한 관련 특징을 생성합니다.
IPython은 주로 Python을 비롯한 여러 프로그래밍 언어의 컴퓨팅을 위한 강력한 대화형 명령 셸로, 향상된 내성(introspection)과 셸 통합 기능을 제공합니다.
pandas는 관계형 또는 레이블 데이터 작업을 위해 설계된 빠르고 유연하며 표현력이 풍부한 데이터 구조를 제공하는 강력한 Python 라이브러리입니다.
Apache Airflow는 워크플로우를 코드로 작성, 예약 및 모니터링하는 플랫폼으로, 주로 데이터 파이프라인과 AI/ML 오케스트레이션에 사용됩니다.
Trino는 빅데이터 분석을 위해 설계된 빠른 분산 SQL 쿼리 엔진으로, 이전에는 PrestoSQL로 알려져 있었습니다.
자동 완성, 구문 강조 및 데이터프레임 통합 기능을 갖춘 풍부한 기능을 제공하는 MySQL 터미널 클라이언트입니다.
marimo는 코드와 출력 간의 일관성을 보장하는 반응형 Python 노트북으로, git 친화적인 배포를 위해 순수 Python 파일로 저장됩니다.
Statsmodels는 통계 모델링, 계량경제학, 데이터 분석을 위한 Python 라이브러리입니다. 회귀, 시계열, 생존 분석 등을 지원합니다.
자연어 지시문을 기반으로 AI 모델이 생성한 새로운 열을 추가하여 pandas DataFrames을 확장하는 Python 라이브러리입니다.
NVIDIA cuDF는 CUDA-X 제품군의 일부로, GPU 가속 기반 DataFrame 라이브러리입니다. pandas 호환 API, Polars GPU 엔진, Dask 백엔드를 제공하여 고성능 데이터 처리를 지원합니다.
Flow는 단일 바이너리, 고성능 ETL 엔진 및 워크플로우 오케스트레이터로, Go로 작성되었습니다. 임베디드 시각적 웹 빌더, 선언적 XML 파이프라인, 크로스 데이터베이스 지원, 내장 감사 텔레메트리를 특징으로 합니다.
Python을 사용하여 수학적 기초부터 실무 구현까지 지도 학습 머신러닝을 원리부터 가르치는 교육용 저장소입니다.
Microsoft의 초보자를 위한 10주, 20강 데이터 과학 커리큘럼으로, 프로젝트 기반 수업, 퀴즈, 50개 이상의 언어 번역이 포함되어 있습니다.
FiftyOne은 고품질 데이터셋과 컴퓨터 비전 모델을 구축하기 위한 오픈소스 Python 도구로, 이미지, 비디오, 주석 시각화, 모델 평가, 데이터 정제 기능을 제공합니다.
OpenRefine은 웹 브라우저 인터페이스를 통해 지저분한 데이터를 정제, 변환 및 조정하도록 설계된 Java 기반의 오픈 소스 파워 툴입니다.
Great Expectations (GX Core)는 데이터 일관성과 신뢰성을 보장하기 위해 데이터 단위 테스트 프레임워크를 제공하는 오픈 소스 Python 라이브러리입니다.
VectorBT는 오픈소스 파이썬 백테스팅 라이브러리로, 수천 개의 매개변수 조합을 NumPy 배열로 압축하고 Numba와 선택적 Rust 엔진으로 가속화하며, 포트폴리오 분석과 대화형 Plotly 시각화를 제공합니다.