프로젝트 소개
DataX는 알리바바가 오픈소스로 공개한 오프라인 데이터 동기화 프레임워크이자 알리바바 클라우드 DataWorks 데이터 통합의 오픈소스 버전입니다. 핵심 설계는 한 번의 동기화를 두 부분으로 나눕니다. Reader 플러그인은 원본 데이터 소스에서 데이터를 읽고, Writer 플러그인은 대상 측에 데이터를 쓰는 역할을 합니다. 프레임워크는 둘 사이에서 데이터를 전달하며, 플러그인 체계를 통해 다양한 스토리지 및 컴퓨팅 시스템에 적응합니다. 새 데이터 소스 플러그인을 추가하면 이론적으로 기존 데이터 소스와 읽기/쓰기 조합을 구성할 수 있습니다.
README에 나열된 지원 범위는 여러 유형을 포괄합니다. 관계형 데이터베이스에는 MySQL, Oracle, OceanBase, SQL Server, PostgreSQL, DRDS, Kingbase 및 범용 RDBMS가 포함됩니다. NoSQL 및 빅데이터 스토리지에는 HBase, MongoDB, Cassandra, OTS, Phoenix 등이 포함됩니다. 데이터 웨어하우스 및 분석 시스템에는 Hive, MaxCompute/ODPS, Hologres, ClickHouse, StarRocks, Apache Doris, Databend, SelectDB 등이 포함됩니다. 또한 HDFS, OSS, FTP, TxtFile, DataHub, SLS, OpenTSDB, TSDB, TDengine, Neo4j 등도 지원합니다. 데이터 소스별 Reader와 Writer 지원 여부는 완전히 동일하지 않으므로 사용 시 해당 플러그인 문서를 확인해야 합니다.
프로젝트는 소개 문서, 빠른 시작, 데이터 소스 참조 가이드, 플러그인 개발 가이드를 제공하며 다운로드 가능한 배포 패키지도 제공합니다. 개발자는 플러그인 개발 문서에 따라 새 데이터 소스를 연동할 수 있습니다. 최근 버전에는 HDFS Parquet 읽기/쓰기, TxtFile insert 문 내보내기, Phoenix where 조건, GaussDB 플러그인, ClickHouse 플러그인 및 여러 드라이버와 문제 수정 사항이 포함됩니다.
유의할 점은 알리바바 클라우드 DataWorks 데이터 통합은 DataX 팀 역량을 기반으로 한 상용 버전이라는 것입니다. README에 따르면 더 많은 데이터 소스, 실시간 동기화, 전체 데이터베이스 마이그레이션, 대량 클라우드 이전, 증분 동기화, 샤딩 및 테이블 분할 등의 솔루션을 제공합니다. 이러한 고급 기능을 오픈소스 버전 DataX와 동일하게 간주해서는 안 됩니다. 오픈소스 코드는 Apache License를 따르며 무료로 사용할 수 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.