Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

Entrepôt de données

L’entrepôt de données moderne ne lie plus étroitement le stockage et le calcul. À la place, des couches distinctes mais interconnectées pour le stockage, la gouvernance et le traitement des requêtes vous offrent la flexibilité nécessaire pour choisir les bons outils pour vos flux de travail.

En ajoutant des formats de table ouverts et un moteur de requêtes hautes performances comme ClickHouse à un stockage objet dans le cloud, vous bénéficiez de fonctionnalités dignes d’une base de données — transactions ACID, validation des schémas et requêtes analytiques rapides — sans sacrifier l’ouverture de votre lac de données. Cette combinaison allie performances et stockage interopérable et économique pour prendre en charge vos charges de travail analytiques traditionnelles et vos charges de travail IA/ML modernes.

Ce que cette architecture offre

En combinant un stockage objet ouvert et des formats de table avec ClickHouse comme moteur de requêtes, vous obtenez :

Avantage Description
Mises à jour cohérentes des tables Les commits atomiques de l'état des tables garantissent que les écritures concurrentes ne produisent pas de données corrompues ou partielles. Cela résout l'un des principaux problèmes des lacs de données de données brutes.
Gestion des schémas La validation imposée et le suivi de l'évolution du schéma évitent le problème du « marécage de données », où les données deviennent inutilisables à cause d'incohérences de schéma.
Performances des requêtes L'indexation, les statistiques et les optimisations de l'organisation des données, comme le data skipping et le clustering, permettent aux requêtes SQL d'atteindre des performances comparables à celles d'un entrepôt de données dédié. Combiné au moteur colonnaire de ClickHouse, cela reste vrai même pour des données stockées dans un stockage objet.
Gouvernance Les catalogues et les formats de table offrent un contrôle d'accès fin et des capacités d'audit au niveau des lignes et des colonnes, ce qui compense les mécanismes de sécurité limités des lacs de données de base.
Séparation du stockage et du calcul Le stockage et le calcul évoluent indépendamment sur un stockage objet standard, nettement moins coûteux qu'un stockage propriétaire d'entrepôt de données. Si cette séparation est la norme dans les entrepôts Cloud modernes, les formats ouverts vous permettent de choisir quel moteur de calcul évolue avec vos données.

Comment ClickHouse propulse votre entrepôt de données

Les données circulent depuis les plateformes de streaming et les entrepôts de données existants, via le stockage objet, jusqu’à ClickHouse, où elles sont transformées, optimisées et mises à disposition de vos outils BI/IA.

Architecture d’entrepôt de données ClickHouse
Ingestion des données

Pour les chargements de données en masse, vous utilisez généralement un stockage objet comme S3 ou GCS comme intermédiaire. Les performances de lecture de Parquet de ClickHouse vous permettent de charger des données à des centaines de millions de lignes par seconde à l’aide du S3 table engine. Pour le streaming en temps réel, ClickPipes se connecte directement à des plateformes comme Kafka et Confluent.

Vous pouvez également migrer depuis des entrepôts de données existants comme Snowflake, BigQuery et Databricks en exportant vers le stockage objet, puis en chargeant les données dans ClickHouse via les table engines.

Requêtes

Vous pouvez interroger les données directement depuis des stockages objet comme S3 et GCS, ou depuis des lacs de données utilisant des formats de table ouverts comme Iceberg, Delta Lake et Hudi — directement ou via des catalogues de données comme AWS Glue Catalog, Unity Catalog et Iceberg REST.

ClickHouse Cloud offre le query cache, les sparse indexes et les projections prêts à l’emploi, ainsi que plus de 70 formats de fichier et des fonctions SQL pour les dates, les tableaux, JSON, le géospatial et les agrégations approximatives à grande échelle.

Transformations des données

Les vues matérialisées de ClickHouse automatisent les transformations : elles se déclenchent lorsque de nouvelles données sont insérées dans les tables sources, ce qui vous permet d’extraire, d’agréger et de modifier les données à mesure qu’elles arrivent, sans avoir à créer de pipelines sur mesure.

Pour des modélisations plus complexes, l’intégration dbt de ClickHouse vous permet de définir les transformations sous forme de modèles SQL versionnés.

Intégrations

ClickHouse dispose de connecteurs natifs pour des outils BI comme Tableau et Looker. Les outils sans connecteur natif peuvent se connecter via le MySQL wire protocol. Le MCP server connecte ClickHouse aux LLM pour l’analytique conversationnelle, et des contrôles RBAC flexibles vous permettent d’exposer des tables en lecture seule en toute sécurité.

Architecture hybride : le meilleur des deux mondes

En plus d’interroger votre lac de données, vous pouvez ingérer dans le stockage natif MergeTree de ClickHouse les données pour lesquelles les performances sont cruciales, pour des cas d’usage qui exigent une latence ultra-faible — tableaux de bord en temps réel, analyses opérationnelles ou applications interactives.

Vous bénéficiez ainsi d’une stratégie de données par niveaux. Les données chaudes, fréquemment consultées, résident dans le stockage optimisé de ClickHouse pour des réponses aux requêtes en moins d’une seconde, tandis que l’historique complet des données reste dans le lac de données et demeure interrogeable. Vous pouvez également utiliser les vues matérialisées de ClickHouse pour transformer et agréger en continu les données du lac de données dans des tables optimisées, assurant automatiquement la jonction entre les deux niveaux.

Vous choisissez où stocker les données en fonction des exigences de performance, et non des limitations techniques.

Navigation