概述
ClickPipes 是一个托管式集成平台,让从多种数据源摄取数据变得像点几下按钮一样简单。ClickPipes 专为要求最严苛的工作负载而设计,其强大且可扩展的架构可确保始终如一的性能与可靠性。ClickPipes 既可用于持续数据摄取,也可用于一次性数据加载。
ClickPipes 既可以通过 ClickPipes UI 部署和管理,也可以通过 OpenAPI 和 Terraform 以编程方式进行部署和管理。
连接器
ClickPipes for 流式数据
| 连接器 | 功能生命周期 | 数据源 |
|---|---|---|
| GA | Apache Kafka、Confluent Cloud、Redpanda、AWS MSK、Google Cloud Managed Service for Apache Kafka、Azure Event Hubs、WarpStream 以及其他兼容 Kafka API 的数据源。 | |
| GA | ||
| 私有预览 |
面向对象存储的 ClickPipes
| 连接器 | 功能生命周期 | 数据源 |
|---|---|---|
| GA | 亚马逊 S3、Cloudflare R2、DigitalOcean Spaces、OVH Object Storage 及其他兼容 S3 API 的数据源。 | |
| GA | ||
| GA |
用于 CDC (变更数据捕获) 的 ClickPipes
| 连接器 | 功能生命周期 | 数据源 |
|---|---|---|
| GA | 亚马逊 RDS、亚马逊 Aurora、Google Cloud SQL、AlloyDB、Azure Flexible Server、Supabase、Neon、Crunchy Bridge、TimescaleDB、PlanetScale、自管理及其他兼容数据源。 | |
| Public Beta | 亚马逊 RDS、亚马逊 Aurora、Cloud SQL、Azure Flexible Server、自管理 MySQL、适用于 MariaDB 的亚马逊 RDS、自管理 MariaDB及其他兼容数据源。 | |
| Public Beta | MongoDB Atlas、Amazon DocumentDB、自管理及其他兼容数据源。 | |
| 私有预览 |
更多连接器将陆续加入 ClickPipes,更多信息请联系我们。
AWS IAM 数据库身份验证
ClickPipes 支持对 Amazon RDS 和 Aurora 使用 AWS IAM 数据库身份验证。具体配置因数据库引擎和 AWS 服务而异,因此请选择与您的数据库对应的源端设置指南:
| 数据库引擎 | AWS 服务 | 设置指南 |
|---|---|---|
| PostgreSQL | Amazon RDS | RDS for PostgreSQL |
| PostgreSQL | Amazon Aurora | Aurora PostgreSQL-Compatible Edition |
| MySQL | Amazon RDS | RDS for MySQL |
| MySQL | Amazon Aurora | Aurora MySQL-Compatible Edition |
| MariaDB | Amazon RDS | RDS for MariaDB |
静态 IP 列表
ClickPipes 静态 NAT IP 地址列表已移至 ClickPipes 网络文档。
调整 ClickHouse 设置
ClickHouse Cloud 为大多数使用场景提供了合理的默认设置。不过,如果你需要为 ClickPipes 目标表调整某些 ClickHouse 设置,那么为 ClickPipes 配置一个专用角色是最灵活的解决方案。 步骤:
- 创建自定义角色
CREATE ROLE my_clickpipes_role SETTINGS ...。详情请参见 CREATE ROLE 语法。 - 在创建 ClickPipes 的过程中,在
Details and Settings步骤将该自定义角色添加给 ClickPipes 用户。

调整 ClickPipes 高级设置
ClickPipes 提供了适用于大多数场景的合理默认设置。如果你的场景需要进一步微调,可以调整以下设置:
对象存储 ClickPipes
| Setting | Default value | Description |
|---|---|---|
Max insert bytes |
10 GB | 单个插入批次中处理的字节数。 |
Max file count |
100 | 单个插入批次中处理的最大文件数。 |
Max threads |
auto(3) | 用于文件处理的最大并发线程数。 |
Max insert threads |
1 | 用于文件处理的最大并发插入线程数。 |
Min insert block size bytes |
1 GB | 可插入表的块最小字节数。 |
Max download threads |
4 | 最大并发下载线程数。 |
Object storage polling interval |
30 s | 配置将数据插入 ClickHouse 集群前的最长等待时间。 |
Parallel distributed insert select |
2 | 并行 Distributed insert select 设置。 |
Parallel view processing |
false | 是否启用以并发而非顺序方式推送到已附加视图。 |
Use cluster function |
true | 是否在多个节点上并行处理文件。 |

流式 ClickPipes
| 设置 | 默认值 | 描述 |
|---|---|---|
Streaming max insert wait time |
5 s | 配置在将数据插入 ClickHouse 集群之前允许的最长等待时间。 |
错误报告
ClickPipes 会根据摄取过程中遇到的错误类型,将错误分别存储在两个独立的表中。
记录错误
ClickPipes 会在目标表旁创建一张表,表名以后缀 <destination_table_name>_clickpipes_error 结尾。该表会包含因数据格式错误或 schema 不匹配而产生的所有错误,并保留完整的无效消息内容。该表的生存时间 (TTL)为 7 天。
系统错误
与 ClickPipe 运行相关的错误会存储在 system.clickpipes_log 表中。该表还会记录与你的 ClickPipe 运行有关的其他错误 (如网络、连接等) 。此表的 生存时间 (TTL) 为 7 天。
如果 ClickPipes 在 15 分钟后仍无法连接到数据源,或在 1 小时后仍无法连接到目标端,ClickPipes 实例将停止,并在系统错误表中记录相应的消息 (前提是 ClickHouse 实例可用) 。
监控
除了控制台内的监控外,ClickPipes 还会将指标暴露到一个兼容 Prometheus 的端点,以便抓取。这些指标会与其他 ClickHouse Cloud 服务指标一同发布,因此你可以将 ClickPipes 的监控集成到现有的可观测性技术栈中 (例如 Grafana、Datadog) 。有关可用指标的完整列表,请参阅 Monitoring ClickPipes。
FAQ
-
什么是 ClickPipes?
ClickPipes 是 ClickHouse Cloud 的一项功能,可让您轻松将 ClickHouse 服务连接到外部数据源,尤其是 Kafka。借助 ClickPipes for Kafka,您可以持续、轻松地将数据加载到 ClickHouse 中,使其可用于实时分析。
-
ClickPipes 是否支持数据转换?
是的,ClickPipes 通过提供 DDL 创建能力来支持基础数据转换。随后,您可以在数据加载到 ClickHouse Cloud 服务中的目标表时,借助 ClickHouse 的 materialized views 功能 对数据进行更高级的转换。
-
使用 ClickPipes 会产生额外费用吗?
ClickPipes 按两个维度计费:Ingested Data 和 Compute。有关定价的完整详情,请参见此页面。运行 ClickPipes 还可能在目标 ClickHouse Cloud 服务上产生间接的计算和存储成本,这与任何摄取工作负载类似。
-
使用 ClickPipes for Kafka 时,有办法处理错误或故障吗?
可以。ClickPipes for Kafka 在从 Kafka 消费数据时,如果遇到任何运行问题 (包括网络问题、连接问题等) ,都会自动重试。如果出现格式错误的数据或无效的 schema,ClickPipes 会将该记录存储到 record_error 表中,并继续处理。