Google Dataflow é um serviço totalmente gerenciado de processamento de dados em streaming e em lote. Ele oferece suporte a pipelines escritos em Java ou Python e é baseado no SDK do Apache Beam.
Há duas maneiras principais de usar o Google Dataflow com o ClickHouse, e ambas utilizam o ClickHouseIO Apache Beam connector.
São elas:
Java runner
O Java runner permite implementar pipelines personalizados no Dataflow usando a integração ClickHouseIO do SDK do Apache Beam. Essa abordagem oferece total flexibilidade e controle sobre a lógica do pipeline, permitindo adaptar o processo de ETL a requisitos específicos.
No entanto, essa opção exige conhecimento de programação em Java e familiaridade com o framework Apache Beam.
Principais recursos
- Alto grau de personalização.
- Ideal para casos de uso complexos ou avançados.
- Exige programação e conhecimento da API Beam.
Modelos predefinidos
O ClickHouse oferece modelos predefinidos projetados para casos de uso específicos, como importações em lote do BigQuery ou ingestão via streaming do Pub/Sub para o ClickHouse. Esses modelos estão prontos para uso e simplificam o processo de integração, sendo uma excelente opção se você prefere uma solução sem código.
Principais recursos
- Não exige programação em Beam.
- Configuração rápida e fácil para casos de uso simples.
- Também é adequada se você tiver pouca experiência em programação.
Ambas as abordagens são totalmente compatíveis com o Google Cloud e o ecossistema ClickHouse, oferecendo flexibilidade de acordo com sua experiência técnica e os requisitos do projeto.