Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

Integración con ClickHouse Cloud

Descripción general

ClickPipes es una plataforma de integración gestionada que hace que la ingestión de datos desde una amplia variedad de fuentes sea tan sencilla como hacer clic en unos pocos botones. Diseñada para las cargas de trabajo más exigentes, la arquitectura robusta y escalable de ClickPipes garantiza un rendimiento y una fiabilidad constantes. ClickPipes puede utilizarse para la ingestión continua de datos o para una carga puntual de datos.

ClickPipes puede implementarse y gestionarse mediante la UI de ClickPipes, así como de forma programática mediante OpenAPI y Terraform.

Conectores

ClickPipes para streaming

Conector Ciclo de vida de la funcionalidad Fuentes de datos
Kafka GA Apache Kafka, Confluent Cloud, Redpanda, AWS MSK, servicio gestionado de Google Cloud para Apache Kafka, Azure Event Hubs, WarpStream y otras fuentes de datos compatibles con la API de Kafka.
Amazon Kinesis GA
GCP Pub/Sub Vista previa privada

ClickPipes para el almacenamiento de objetos

Conector Ciclo de vida de la funcionalidad Fuentes de datos
Amazon S3 GA Amazon S3, Cloudflare R2, DigitalOcean Spaces, OVH Object Storage y otras fuentes de datos compatibles con la API de S3.
Google Cloud Storage GA
Azure Blob Storage GA

ClickPipes para CDC

Conector Ciclo de vida de la funcionalidad Fuentes de datos
Postgres GA Amazon RDS, Amazon Aurora, Google Cloud SQL, AlloyDB, Azure Flexible Server, Supabase, Neon, Crunchy Bridge, TimescaleDB, PlanetScale, autogestionado y otras fuentes de datos compatibles.
MySQL Beta pública Amazon RDS, Amazon Aurora, Cloud SQL, Azure Flexible Server, MySQL autogestionado, Amazon RDS para MariaDB, MariaDB autogestionado y otras fuentes de datos compatibles.
MongoDB Beta pública MongoDB Atlas, Amazon DocumentDB, autogestionado y otras fuentes de datos compatibles.
BigQuery Vista previa privada

Se irán añadiendo más conectores a ClickPipes. Puede obtener más información poniéndose en contacto con nosotros.

Autenticación de base de datos con AWS IAM

ClickPipes admite la autenticación de base de datos con AWS IAM para Amazon RDS y Aurora. La configuración varía según el motor de base de datos y el servicio de AWS, así que elige la guía de configuración de origen que corresponda a tu base de datos:

Motor de base de datos Servicio de AWS Guía de configuración
PostgreSQL Amazon RDS RDS para PostgreSQL
PostgreSQL Amazon Aurora Aurora PostgreSQL-Compatible Edition
MySQL Amazon RDS RDS para MySQL
MySQL Amazon Aurora Aurora MySQL-Compatible Edition
MariaDB Amazon RDS RDS para MariaDB

Lista de IP estáticas

La lista de direcciones IP NAT estáticas de ClickPipes se ha trasladado a la documentación de redes de ClickPipes.

Ajustar los ajustes de ClickHouse

ClickHouse Cloud proporciona valores predeterminados adecuados para la mayoría de los casos de uso. Sin embargo, si necesita ajustar algunos ajustes de ClickHouse para las tablas de destino de ClickPipes, un rol dedicado para ClickPipes es la solución más flexible. Pasos:

  1. cree un rol personalizado CREATE ROLE my_clickpipes_role SETTINGS .... Consulte la sintaxis de CREATE ROLE para obtener más información.
  2. añada el rol personalizado al usuario de ClickPipes en el paso Details and Settings durante la creación de ClickPipes.
Asignar un rol personalizado

Ajustar la configuración avanzada de ClickPipes

ClickPipes proporciona valores predeterminados adecuados para la mayoría de los casos de uso. Si su caso de uso requiere un ajuste más preciso, puede modificar la siguiente configuración:

ClickPipes de almacenamiento de objetos

Configuración Valor predeterminado Descripción
Max insert bytes 10 GB Número de bytes que se procesan en un único lote de inserción.
Max file count 100 Número máximo de archivos que se procesan en un único lote de inserción.
Max threads auto(3) Número máximo de hilos concurrentes para el procesamiento de archivos.
Max insert threads 1 Número máximo de hilos de inserción concurrentes para el procesamiento de archivos.
Min insert block size bytes 1 GB Tamaño mínimo en bytes del bloque que puede insertarse en una tabla.
Max download threads 4 Número máximo de hilos de descarga concurrentes.
Object storage polling interval 30 s Configura el período máximo de espera antes de insertar datos en el clúster de ClickHouse.
Parallel distributed insert select 2 Configuración de inserción distribuida paralela para SELECT.
Parallel view processing false Si se habilita el envío a vistas adjuntas de forma concurrente en lugar de secuencial.
Use cluster function true Si los archivos se procesan en paralelo en varios nodos.
Configuración avanzada de ClickPipes

ClickPipes de streaming

Configuración Valor predeterminado Descripción
Streaming max insert wait time 5 s Configura el tiempo máximo de espera antes de insertar datos en el clúster de ClickHouse.

Registro de errores

ClickPipes almacenará los errores en dos tablas distintas, según el tipo de error que se produzca durante el proceso de ingestión.

Registro de errores

ClickPipes creará una tabla junto a tu tabla de destino con el sufijo <destination_table_name>_clickpipes_error. Esta tabla contendrá cualquier error provocado por datos malformados o por un esquema incompatible, e incluirá el mensaje no válido completo. Esta tabla tiene un TTL de 7 días.

Errores del sistema

Los errores relacionados con el funcionamiento de ClickPipe se almacenarán en la tabla system.clickpipes_log. En ella se guardarán todos los demás errores relacionados con el funcionamiento de su ClickPipe (red, conectividad, etc.). Esta tabla tiene un TTL de 7 días.

Si ClickPipes no puede conectarse a una fuente de datos después de 15 min o a un destino después de 1 h, la instancia de ClickPipes se detendrá y almacenará un mensaje correspondiente en la tabla de errores del sistema (siempre que la instancia de ClickHouse esté disponible).

Monitoreo

Además del monitoreo en la consola, ClickPipes expone métricas en un endpoint compatible con Prometheus para su scraping. Estas métricas se publican junto con otras métricas del servicio de ClickHouse Cloud y le permiten integrar el monitoreo de ClickPipes con su stack de observabilidad actual (por ejemplo, Grafana, Datadog). Consulte Monitoreo de ClickPipes para ver la lista completa de métricas disponibles.

Preguntas frecuentes

  • ¿Qué es ClickPipes?

    ClickPipes es una funcionalidad de ClickHouse Cloud que facilita la conexión de sus servicios de ClickHouse con fuentes de datos externas, en concreto Kafka. Con ClickPipes for Kafka, puede cargar datos de forma continua en ClickHouse y ponerlos a disposición para análisis en tiempo real.

  • ¿ClickPipes admite la transformación de datos?

    Sí, ClickPipes admite transformaciones básicas de datos al exponer la creación del DDL. Después, puede aplicar transformaciones más avanzadas a los datos a medida que se cargan en su tabla de destino en un servicio de ClickHouse Cloud, aprovechando la funcionalidad de vistas materializadas de ClickHouse.

  • ¿Usar ClickPipes implica un costo adicional?

    ClickPipes se factura en dos dimensiones: Ingested Data y Compute. Los detalles completos de los precios están disponibles en esta página. Ejecutar ClickPipes también puede generar un costo indirecto de cómputo y almacenamiento en el servicio de ClickHouse Cloud de destino, como ocurre con cualquier carga de trabajo de ingesta.

  • ¿Hay alguna forma de gestionar errores o fallos al usar ClickPipes for Kafka?

    Sí, ClickPipes for Kafka realizará reintentos automáticos en caso de fallos al consumir datos de Kafka debidos a cualquier problema operativo, incluidos problemas de red, de conectividad, etc. En caso de datos malformados o de un esquema no válido, ClickPipes almacenará el registro en la tabla record_error y continuará procesándolo.

Navigation