Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

Intégration à ClickHouse Cloud

Vue d’ensemble

ClickPipes est une plateforme d’intégration gérée qui simplifie l’ingestion de données depuis un large éventail de sources au point de se faire en quelques clics. Conçue pour les charges de travail les plus exigeantes, l’architecture robuste et évolutive de ClickPipes garantit des performances et une fiabilité constantes. ClickPipes peut être utilisé pour l’ingestion continue de données ou pour des chargements ponctuels de données.

ClickPipes peut être déployé et géré via la ClickPipes UI, ainsi que par programmation à l’aide d’OpenAPI et de Terraform.

Connecteurs

ClickPipes pour le streaming

Connecteur Cycle de vie de la fonctionnalité Sources de données
Kafka GA Apache Kafka, Confluent Cloud, Redpanda, AWS MSK, Google Cloud Managed Service for Apache Kafka, Azure Event Hubs, WarpStream et d'autres sources de données compatibles avec l'API Kafka.
Amazon Kinesis GA
GCP Pub/Sub Aperçu privé

ClickPipes pour le stockage d'objets

Connecteur Cycle de vie de la fonctionnalité Sources de données
Amazon S3 GA Amazon S3, Cloudflare R2, DigitalOcean Spaces, OVH Object Storage et d'autres sources de données compatibles avec l'API S3.
Google Cloud Storage GA
Azure Blob Storage GA

ClickPipes pour CDC

Connecteur Cycle de vie de la fonctionnalité Sources de données
Postgres GA Amazon RDS, Amazon Aurora, Google Cloud SQL, AlloyDB, Azure Flexible Server, Supabase, Neon, Crunchy Bridge, TimescaleDB, PlanetScale, autogéré et d'autres sources de données compatibles.
MySQL Bêta publique Amazon RDS, Amazon Aurora, Cloud SQL, Azure Flexible Server, MySQL autogéré, Amazon RDS for MariaDB, MariaDB autogéré et d'autres sources de données compatibles.
MongoDB Bêta publique MongoDB Atlas, Amazon DocumentDB, autogéré et d'autres sources de données compatibles.
BigQuery Aperçu privé

D’autres connecteurs seront ajoutés à ClickPipes ; vous pouvez en savoir plus en nous contactant.

Authentification de base de données avec AWS IAM

ClickPipes prend en charge l'authentification de base de données avec AWS IAM pour Amazon RDS et Aurora. La configuration diffère selon le moteur de base de données et le service AWS. Choisissez donc le guide de configuration de la source correspondant à votre base de données :

Moteur de base de données Service AWS Guide de configuration
PostgreSQL Amazon RDS RDS pour PostgreSQL
PostgreSQL Amazon Aurora Aurora PostgreSQL-Compatible Edition
MySQL Amazon RDS RDS pour MySQL
MySQL Amazon Aurora Aurora MySQL-Compatible Edition
MariaDB Amazon RDS RDS pour MariaDB

Liste des IP statiques

La liste des IP NAT statiques de ClickPipes a été déplacée vers la documentation réseau de ClickPipes.

Ajuster les paramètres ClickHouse

ClickHouse Cloud fournit des valeurs par défaut adaptées à la plupart des cas d’usage. Toutefois, si vous devez ajuster certains paramètres ClickHouse pour les tables de destination de ClickPipes, un rôle dédié à ClickPipes est la solution la plus souple. Étapes :

  1. créez un rôle personnalisé CREATE ROLE my_clickpipes_role SETTINGS .... Consultez la syntaxe de CREATE ROLE pour plus de détails.
  2. ajoutez le rôle personnalisé à l’utilisateur ClickPipes à l’étape Details and Settings lors de la création de ClickPipes.
Attribuer un rôle personnalisé

Ajuster les paramètres avancés de ClickPipes

ClickPipes propose des paramètres par défaut adaptés à la plupart des cas d’utilisation. Si le vôtre nécessite un réglage plus fin, vous pouvez ajuster les paramètres suivants :

stockage d’objets ClickPipes

Paramètre Valeur par défaut Description
Max insert bytes 10 GB Nombre d’octets à traiter dans un même lot d’insertion.
Max file count 100 Nombre maximal de fichiers à traiter dans un même lot d’insertion.
Max threads auto(3) Nombre maximal de threads concurrents pour le traitement des fichiers.
Max insert threads 1 Nombre maximal de threads d’insertion concurrents pour le traitement des fichiers.
Min insert block size bytes 1 GB Taille minimale en octets du bloc pouvant être inséré dans une table.
Max download threads 4 Nombre maximal de threads de téléchargement concurrents.
Object storage polling interval 30 s Configure le délai d’attente maximal avant l’insertion des données dans le cluster ClickHouse.
Parallel distributed insert select 2 Paramètre Parallel distributed insert select.
Parallel view processing false Indique s’il faut activer l’envoi vers les vues attachées de manière concurrente plutôt que séquentielle.
Use cluster function true Indique s’il faut traiter les fichiers en parallèle sur plusieurs nœuds.
Paramètres avancés de ClickPipes

ClickPipes de streaming

Paramètre Valeur par défaut Description
Streaming max insert wait time 5 s Définit le délai d’attente maximal avant l’insertion des données dans le cluster ClickHouse.

Rapport d’erreurs

ClickPipes stocke les erreurs dans deux tables distinctes selon le type d’erreur rencontré lors du processus d’ingestion.

Enregistrement des erreurs

ClickPipes créera une table à côté de votre table de destination avec le suffixe <destination_table_name>_clickpipes_error. Cette table contiendra toutes les erreurs liées à des données mal formées ou à un schéma incompatible, et inclura l’intégralité du message non valide. Cette table a une TTL de 7 jours.

Erreurs système

Les erreurs liées au fonctionnement de ClickPipe sont stockées dans la table system.clickpipes_log. Cette table stocke toutes les autres erreurs liées au fonctionnement de votre ClickPipe (réseau, connectivité, etc.). Cette table a un TTL de 7 jours.

Si ClickPipes ne parvient pas à se connecter à une source de données après 15 min ou à une destination après 1 h, l'instance ClickPipes s'arrête et enregistre un message approprié dans la table des erreurs système (à condition que l'instance ClickHouse soit disponible).

Monitoring

En plus du monitoring dans la console, ClickPipes expose des métriques via un endpoint compatible Prometheus pour le scraping. Ces métriques sont publiées avec les autres métriques du service ClickHouse Cloud et vous permettent d’intégrer le monitoring de ClickPipes à votre stack d’observability existante (par exemple, Grafana, Datadog). Consultez Monitoring ClickPipes pour obtenir la liste complète des métriques disponibles.

FAQ

  • Qu’est-ce que ClickPipes ?

    ClickPipes est une fonctionnalité de ClickHouse Cloud qui facilite la connexion de vos services ClickHouse à des sources de données externes, en particulier Kafka. Avec ClickPipes for Kafka, vous pouvez charger en continu des données dans ClickHouse et les rendre disponibles pour des analyses en temps réel.

  • ClickPipes prend-il en charge la transformation des données ?

    Oui, ClickPipes prend en charge des transformations de données basiques en exposant le DDL de création. Vous pouvez ensuite appliquer des transformations plus avancées aux données lors de leur chargement dans leur table de destination au sein d’un service ClickHouse Cloud, en vous appuyant sur la fonctionnalité de vues matérialisées de ClickHouse.

  • L’utilisation de ClickPipes entraîne-t-elle un coût supplémentaire ?

    ClickPipes est facturé selon deux dimensions : Ingested Data et Compute. Tous les détails de la tarification sont disponibles sur cette page. L’exécution de ClickPipes peut également générer un coût indirect de calcul et de stockage sur le service ClickHouse Cloud de destination, comme pour toute charge de travail d’ingestion.

  • Existe-t-il un moyen de gérer les erreurs ou les défaillances lors de l’utilisation de ClickPipes for Kafka ?

    Oui, ClickPipes for Kafka effectuera automatiquement de nouvelles tentatives en cas d’échec lors de la consommation de données depuis Kafka, pour tout problème opérationnel, notamment les problèmes de réseau, de connectivité, etc. En cas de données mal formées ou de schéma invalide, ClickPipes stockera l’enregistrement dans la table record_error et poursuivra le traitement.

Navigation