Sobre o projeto
DataX é um framework de sincronização de dados offline de código aberto da Alibaba, sendo também a versão open source da integração de dados do Alibaba Cloud DataWorks. Seu design central divide uma sincronização em duas partes: o plugin Reader é responsável por ler dados da fonte de origem, e o plugin Writer é responsável por gravar dados no destino. O framework transmite dados entre os dois e se adapta a diferentes sistemas de armazenamento e computação por meio do sistema de plugins; após adicionar um plugin para uma nova fonte de dados, em teoria é possível formar combinações de leitura e escrita com as fontes existentes.
O escopo suportado listado no README abrange vários tipos: bancos de dados relacionais incluem MySQL, Oracle, OceanBase, SQL Server, PostgreSQL, DRDS, Kingbase e RDBMS genérico; armazenamentos NoSQL e big data incluem HBase, MongoDB, Cassandra, OTS, Phoenix, entre outros; data warehouses e sistemas analíticos incluem Hive, MaxCompute/ODPS, Hologres, ClickHouse, StarRocks, Apache Doris, Databend, SelectDB, entre outros; além disso, suporta HDFS, OSS, FTP, TxtFile, DataHub, SLS, OpenTSDB, TSDB, TDengine, Neo4j, etc. O suporte de Reader e Writer não é idêntico para todas as fontes de dados, sendo necessário consultar a documentação do plugin correspondente ao utilizá-las.
O projeto fornece documentação introdutória, guia de início rápido, guia de referência de fontes de dados e guia de desenvolvimento de plugins, além de pacotes de distribuição para download. Desenvolvedores podem integrar novas fontes de dados seguindo a documentação de desenvolvimento de plugins. Versões recentes também envolvem leitura e escrita de Parquet no HDFS, exportação de instruções insert via TxtFile, condições where no Phoenix, plugin GaussDB, plugin ClickHouse, além de diversas correções de drivers e problemas.
É importante observar que a integração de dados do Alibaba Cloud DataWorks é a versão comercial baseada nas capacidades da equipe do DataX. O README afirma que ela oferece mais fontes de dados, sincronização em tempo real, migração de bancos inteiros, migração em lote para a nuvem, sincronização incremental e soluções de sharding de bancos e tabelas; essas capacidades avançadas não devem ser equiparadas diretamente ao DataX open source. O código aberto adota a licença Apache e pode ser usado gratuitamente.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.