Apache Flink은 데이터 스트리밍과 배치 처리 모두에 강력한 기능을 제공하는 오픈 소스 스트림 처리 프레임워크입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONApache Beam은 배치 및 스트리밍 데이터 병렬 처리 파이프라인을 정의하기 위한 통합 프로그래밍 모델입니다.
Delta Lake는 Lakehouse 아키텍처를 가능하게 하는 오픈소스 스토리지 프레임워크로, Spark, PrestoDB, Flink, Trino, Hive와 같은 컴퓨팅 엔진과 통합되어 ACID 트랜잭션, 시간 여행, 스키마 진화를 제공하여 안정적인 데이터 관리를 지원합니다.
Arkime은 PCAP 형식으로 네트워크 트래픽을 저장하고 인덱싱하는 대규모 오픈 소스 네트워크 분석 및 패킷 캡처 시스템입니다.
Trino는 빅데이터 분석을 위해 설계된 빠른 분산 SQL 쿼리 엔진으로, 이전에는 PrestoSQL로 알려져 있었습니다.
CatBoost는 Yandex의 오픈소스 그래디언트 부스팅 라이브러리로, 분류, 회귀, 랭킹에 사용되며, 범주형 특성 지원, CPU/GPU 학습, Apache Spark를 통한 분산 학습, Python, R, Java, C++ API를 제공합니다.
확장 가능하고 안정적이며 고성능 대규모 시스템 구축에 관한 큐레이션된 읽기 목록으로, 설계 원칙과 주요 기술 기업의 사례 연구, 면접 자료를 포함합니다.
Apache DataFusion은 Apache Arrow를 인메모리 형식으로 사용하는 Rust 기반의 확장 가능한 쿼리 엔진으로, 빠른 분석 시스템 구축을 위한 SQL 및 DataFrame API를 제공합니다.
ClickHouse는 실시간 분석 데이터 보고를 위해 설계된 오픈 소스 컬럼 지향 데이터베이스 관리 시스템입니다.
Cython은 Python 코드를 C/C++로 변환하여 효율적인 확장 모듈을 생성하는 최적화 컴파일러입니다.
Apache Doris 공식 웹사이트(doris.apache.org)의 소스 코드로, Docusaurus 3로 구축되었습니다. Apache Doris(실시간 MPP 분석 데이터베이스)를 위한 다국어 문서, 블로그 글, 커뮤니티 가이드를 호스팅합니다.
Apache Spark는 대규모 데이터 처리를 위해 설계된 통합 분석 엔진으로, 일반 계산 그래프를 위한 최적화된 엔진과 고수준 API를 제공합니다.