Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

集成 ClickHouse Cloud

概述

ClickPipes 是一个托管式集成平台,让从多种数据源摄取数据变得像点几下按钮一样简单。ClickPipes 专为要求最严苛的工作负载而设计,其强大且可扩展的架构可确保始终如一的性能与可靠性。ClickPipes 既可用于持续数据摄取,也可用于一次性数据加载。

ClickPipes 既可以通过 ClickPipes UI 部署和管理,也可以通过 OpenAPITerraform 以编程方式进行部署和管理。

连接器

ClickPipes for 流式数据

连接器 功能生命周期 数据源
Kafka GA Apache Kafka、Confluent Cloud、Redpanda、AWS MSK、Google Cloud Managed Service for Apache Kafka、Azure Event HubsWarpStream 以及其他兼容 Kafka API 的数据源。
Amazon Kinesis GA
GCP Pub/Sub 私有预览

面向对象存储的 ClickPipes

连接器 功能生命周期 数据源
亚马逊 S3 GA 亚马逊 S3、Cloudflare R2、DigitalOcean Spaces、OVH Object Storage 及其他兼容 S3 API 的数据源。
Google Cloud Storage GA
Azure Blob 存储 GA

用于 CDC (变更数据捕获) 的 ClickPipes

连接器 功能生命周期 数据源
Postgres GA 亚马逊 RDS亚马逊 AuroraGoogle Cloud SQLAlloyDBAzure Flexible ServerSupabaseNeonCrunchy BridgeTimescaleDBPlanetScale自管理及其他兼容数据源。
MySQL Public Beta 亚马逊 RDS亚马逊 AuroraCloud SQLAzure Flexible Server自管理 MySQL适用于 MariaDB 的亚马逊 RDS自管理 MariaDB及其他兼容数据源。
MongoDB Public Beta MongoDB AtlasAmazon DocumentDB自管理及其他兼容数据源。
BigQuery 私有预览

更多连接器将陆续加入 ClickPipes,更多信息请联系我们

AWS IAM 数据库身份验证

ClickPipes 支持对 Amazon RDS 和 Aurora 使用 AWS IAM 数据库身份验证。具体配置因数据库引擎和 AWS 服务而异,因此请选择与您的数据库对应的源端设置指南:

数据库引擎 AWS 服务 设置指南
PostgreSQL Amazon RDS RDS for PostgreSQL
PostgreSQL Amazon Aurora Aurora PostgreSQL-Compatible Edition
MySQL Amazon RDS RDS for MySQL
MySQL Amazon Aurora Aurora MySQL-Compatible Edition
MariaDB Amazon RDS RDS for MariaDB

静态 IP 列表

ClickPipes 静态 NAT IP 地址列表已移至 ClickPipes 网络文档

调整 ClickHouse 设置

ClickHouse Cloud 为大多数使用场景提供了合理的默认设置。不过,如果你需要为 ClickPipes 目标表调整某些 ClickHouse 设置,那么为 ClickPipes 配置一个专用角色是最灵活的解决方案。 步骤:

  1. 创建自定义角色 CREATE ROLE my_clickpipes_role SETTINGS ...。详情请参见 CREATE ROLE 语法。
  2. 在创建 ClickPipes 的过程中,在 Details and Settings 步骤将该自定义角色添加给 ClickPipes 用户。
分配自定义角色

调整 ClickPipes 高级设置

ClickPipes 提供了适用于大多数场景的合理默认设置。如果你的场景需要进一步微调,可以调整以下设置:

对象存储 ClickPipes

Setting Default value Description
Max insert bytes 10 GB 单个插入批次中处理的字节数。
Max file count 100 单个插入批次中处理的最大文件数。
Max threads auto(3) 用于文件处理的最大并发线程数
Max insert threads 1 用于文件处理的最大并发插入线程数
Min insert block size bytes 1 GB 可插入表的块最小字节数
Max download threads 4 最大并发下载线程数
Object storage polling interval 30 s 配置将数据插入 ClickHouse 集群前的最长等待时间。
Parallel distributed insert select 2 并行 Distributed insert select 设置
Parallel view processing false 是否启用以并发而非顺序方式推送到已附加视图。
Use cluster function true 是否在多个节点上并行处理文件。
ClickPipes 的高级设置

流式 ClickPipes

设置 默认值 描述
Streaming max insert wait time 5 s 配置在将数据插入 ClickHouse 集群之前允许的最长等待时间。

错误报告

ClickPipes 会根据摄取过程中遇到的错误类型,将错误分别存储在两个独立的表中。

记录错误

ClickPipes 会在目标表旁创建一张表,表名以后缀 <destination_table_name>_clickpipes_error 结尾。该表会包含因数据格式错误或 schema 不匹配而产生的所有错误,并保留完整的无效消息内容。该表的生存时间 (TTL)为 7 天。

系统错误

与 ClickPipe 运行相关的错误会存储在 system.clickpipes_log 表中。该表还会记录与你的 ClickPipe 运行有关的其他错误 (如网络、连接等) 。此表的 生存时间 (TTL) 为 7 天。

如果 ClickPipes 在 15 分钟后仍无法连接到数据源,或在 1 小时后仍无法连接到目标端,ClickPipes 实例将停止,并在系统错误表中记录相应的消息 (前提是 ClickHouse 实例可用) 。

监控

除了控制台内的监控外,ClickPipes 还会将指标暴露到一个兼容 Prometheus 的端点,以便抓取。这些指标会与其他 ClickHouse Cloud 服务指标一同发布,因此你可以将 ClickPipes 的监控集成到现有的可观测性技术栈中 (例如 GrafanaDatadog) 。有关可用指标的完整列表,请参阅 Monitoring ClickPipes

FAQ

  • 什么是 ClickPipes?

    ClickPipes 是 ClickHouse Cloud 的一项功能,可让您轻松将 ClickHouse 服务连接到外部数据源,尤其是 Kafka。借助 ClickPipes for Kafka,您可以持续、轻松地将数据加载到 ClickHouse 中,使其可用于实时分析。

  • ClickPipes 是否支持数据转换?

    是的,ClickPipes 通过提供 DDL 创建能力来支持基础数据转换。随后,您可以在数据加载到 ClickHouse Cloud 服务中的目标表时,借助 ClickHouse 的 materialized views 功能 对数据进行更高级的转换。

  • 使用 ClickPipes 会产生额外费用吗?

    ClickPipes 按两个维度计费:Ingested Data 和 Compute。有关定价的完整详情,请参见此页面。运行 ClickPipes 还可能在目标 ClickHouse Cloud 服务上产生间接的计算和存储成本,这与任何摄取工作负载类似。

  • 使用 ClickPipes for Kafka 时,有办法处理错误或故障吗?

    可以。ClickPipes for Kafka 在从 Kafka 消费数据时,如果遇到任何运行问题 (包括网络问题、连接问题等) ,都会自动重试。如果出现格式错误的数据或无效的 schema,ClickPipes 会将该记录存储到 record_error 表中,并继续处理。

Navigation