프로젝트 소개
Apache Fluss는 실시간 분석 및 AI 워크로드를 위해 설계된 오픈소스 스트리밍 스토리지 시스템입니다. Lakehouse 아키텍처를 위한 실시간 데이터 계층 역할을 하며, 데이터 스트리밍과 데이터 Lakehouse 간의 격차를 해소합니다. Fluss는 저지연, 고처리량 데이터 수집 및 처리를 지원하면서 Apache Flink 및 Apache Spark와 같은 인기 컴퓨팅 엔진과 통합되며, StarRocks 지원이 계획되어 있습니다.
주요 기능은 다음과 같습니다:
- **초 단위 미만의 데이터 신선도**: 저지연 분석과 실시간 의사 결정을 위한 지속적인 수집과 즉각적인 데이터 가용성.
- **스트리밍 및 Lakehouse 통합**: 테이블을 단일 추상화로 사용하여 엔진 전반에서 실시간 및 과거 데이터를 통합하고, Lakehouse 위에 저지연 액세스를 제공하는 스트리밍 네이티브 스토리지를 지원합니다.
- **컬럼형 스트리밍**: Apache Arrow를 기반으로 데이터 스트림에 대한 데이터베이스 기본 기능, 컬럼 가지치기, 조건자 푸시다운을 지원하여 I/O 및 네트워크 비용을 최소화합니다.
- **컴퓨팅-스토리지 분리**: 스트림 프로세서는 계산에 집중하고 Fluss가 상태와 스토리지를 관리하며, 중복 제거, 부분 업데이트, 델타 조인, 집계 병합 엔진과 같은 기능을 제공합니다.
- **ML 및 AI 지원 스토리지**: 실시간 피처 스토어와 중앙 집중식 ML/AI 데이터 저장소를 위한 행 기반, 컬럼형, 벡터, 다중 모달 데이터를 지원하는 통합 스토리지 계층.
- **변경 로그 및 의사 결정 추적**: 내장된 변경 로그 생성으로 감사, 재현성, 관측성을 위한 상태 및 의사 결정 진화의 추가 전용 기록을 제공합니다.
## 빌드
필수 조건: Unix 유사 환경, Git, Maven(>= 3.8.6), Java 11.
```bash
git clone https://github.com/apache/fluss.git
cd fluss
./mvnw clean package -DskipTests
```
빌드는 올바른 Maven 버전을 보장하기 위해 Maven Wrapper를 사용합니다. 프로젝트는 `build-target`에 설치됩니다.
## 기여
Apache Fluss는 오픈소스이며 기여를 환영합니다. 토론에 참여하고, 버그나 기능 요청에 대한 이슈를 열고, 코드나 문서에 기여할 수 있습니다.
## 라이선스
Apache Fluss는 Apache License 2.0에 따라 라이선스가 부여됩니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.