لقطات الشاشة في هذا الدليل مأخوذة من ClickHouse Cloud وحدة تحكم SQL. تعمل جميع الاستعلامات على كلٍّ من Cloud وعمليات النشر المُدارة ذاتيًا.
يوفّر ClickHouse ثلاث طرق لقراءة تنسيقات الجداول المفتوحة: دوال الجداول، ومحركات الجداول، ومحرك قاعدة البيانات DataLakeCatalog. إذا كانت جداولك موجودة في Data Catalog (Glue وUnity Catalog وREST وغيرها)، فاتصل عبر DataLakeCatalog لتتمكن من الوصول إلى جميع جداول Iceberg/Delta لديك من خلال دالة واحدة. أمّا قسمَا دالة الجدول ومحرك الجدول أدناه فهما الأنسب للاستعلامات المخصّصة أو عندما تعرف path تخزينًا محددًا ولا تستخدم كتالوجًا.
استعلم عن بيانات Iceberg مباشرة
أسرع طريقة للبدء — خاصةً للاستعلامات المخصّصة أو عندما لا تستخدم كتالوجًا — هي استخدام دالة الجدول icebergS3(). وجّهها إلى جدول Iceberg في S3 ونفّذ استعلامًا فورًا، من دون أي إعداد.
افحص المخطط:
DESCRIBE icebergS3('https://datasets-documentation.s3.amazonaws.com/lake_formats/iceberg/')نفّذ استعلامًا:
SELECT
url,
count() AS cnt
FROM icebergS3('https://datasets-documentation.s3.amazonaws.com/lake_formats/iceberg/')
GROUP BY url
ORDER BY cnt DESC
LIMIT 5
يقرأ ClickHouse البيانات الوصفية لـ Iceberg مباشرةً من S3 ويستنتج المخطط تلقائيًا. وينطبق النهج نفسه على deltaLake() وhudi() وpaimon().
تعرّف على المزيد: يتناول الاستعلام عن تنسيقات الجداول المفتوحة مباشرةً التنسيقات الأربعة، ومتغيرات cluster للقراءة الموزعة، وخيارات الواجهة الخلفية للتخزين (S3 وAzure وHDFS وlocal).
أنشئ جدولًا دائمًا باستخدام محرك جدول Iceberg
عندما لا تستخدم كتالوجًا ولكنك ستنفّذ استعلامات على المسار نفسه بشكل متكرر، أنشئ جدولًا باستخدام محرك جدول Iceberg حتى لا تحتاج إلى تمرير المسار في كل مرة. تبقى البيانات في S3 — ولا تُنسخ أي بيانات:
CREATE TABLE hits_iceberg
ENGINE = IcebergS3('https://datasets-documentation.s3.amazonaws.com/lake_formats/iceberg/')يمكنك الآن الاستعلام عنه كما تفعل مع أي جدول في ClickHouse:
SELECT
url,
count() AS cnt
FROM hits_iceberg
GROUP BY url
ORDER BY cnt DESC
LIMIT 5
يدعم محرك الجدول التخزين المؤقت للبيانات، والتخزين المؤقت للبيانات الوصفية، وتطوّر المخطط، والسفر عبر الزمن. راجع دليل الاستعلام مباشرةً للحصول على تفاصيل حول ميزات محرك الجدول، ومصفوفة الدعم للاطلاع على مقارنة شاملة للميزات.
الاتصال بكتالوج
إذا كانت مؤسستك تستخدم كتالوج بيانات، فهذا هو مسار التكامل الذي نوصي به. تعمل الكتالوجات على تجميع البيانات الوصفية للجداول واكتشافها في مكان مركزي — وبدلًا من إدارة تعريف جدول لكل مسار تخزين، اتصل مرة واحدة باستخدام محرك قاعدة البيانات DataLakeCatalog. يظهر كل جدول في الكتالوج كجدول ClickHouse، بما في ذلك الجداول التي أُضيفت upstream بعد إنشاء الاتصال.
إليك مثالاً على الاتصال بـ AWS Glue:
CREATE DATABASE my_lake
ENGINE = DataLakeCatalog
SETTINGS
catalog_type = 'glue',
region = '<your-region>',
aws_access_key_id = '<your-access-key>',
aws_secret_access_key = '<your-secret-key>'يتطلب كل نوع من أنواع الكتالوجات إعدادات اتصال خاصة به — راجع أدلة الكتالوجات للاطّلاع على القائمة الكاملة بالكتالوجات المدعومة وخيارات تهيئتها.
تصفّح الجداول ونفّذ استعلامًا:
SHOW TABLES FROM my_lake;SELECT count(*) FROM my_lake.`<database>.<table>`تعرّف على المزيد: يشرح الاتصال بـ Data Catalog إعداد Unity Catalog كاملًا مع أمثلة على Delta وIceberg.
نفِّذ استعلامًا
بصرف النظر عن الطريقة التي استخدمتها أعلاه — دالة الجدول أو محرك الجدول أو DataLakeCatalog — فإن ClickHouse SQL نفسه يعمل في جميعها. وفي بيئة الإنتاج عند استخدام كتالوج، نفِّذ الاستعلام عبر قاعدة البيانات DataLakeCatalog؛ وتظل الأمثلة الأخرى مفيدة للاختبارات السريعة والوصول المستند إلى path:
-- Table function
SELECT url, count() AS cnt
FROM icebergS3('https://datasets-documentation.s3.amazonaws.com/lake_formats/iceberg/')
GROUP BY url ORDER BY cnt DESC LIMIT 5
-- Table engine
SELECT url, count() AS cnt
FROM hits_iceberg
GROUP BY url ORDER BY cnt DESC LIMIT 5
-- Catalog
SELECT url, count() AS cnt
FROM my_lake.`<database>.<table>`
GROUP BY url ORDER BY cnt DESC LIMIT 5صياغة الاستعلام متطابقة — والتغيير الوحيد يكون في عبارة FROM. تعمل جميع الدوال وعمليات JOIN وعمليات التجميع في ClickHouse SQL بالطريقة نفسها بغضّ النظر عن مصدر البيانات.
حمّل مجموعة فرعية إلى ClickHouse
يُعد الاستعلام عن Iceberg مباشرةً أمرًا مناسبًا، لكن الأداء يظل محدودًا بمعدل نقل الشبكة وتخطيط الملفات. بالنسبة إلى أعباء العمل التحليلية، حمّل البيانات إلى جدول MergeTree أصلي.
أولًا، شغّل استعلامًا مُرشَّحًا على جدول Iceberg للحصول على خط أساس:
SELECT
url,
count() AS cnt
FROM hits_iceberg
WHERE counterid = 38
GROUP BY url
ORDER BY cnt DESC
LIMIT 5يفحص هذا الاستعلام مجموعة البيانات بالكامل في S3 لأن Iceberg لا يراعي عامل التصفية counterid — لذا توقّع أن يستغرق ذلك عدة ثوانٍ.

الآن أنشئ جدول MergeTree وحمّل البيانات:
CREATE TABLE hits_clickhouse
(
url String,
eventtime DateTime,
counterid UInt32
)
ENGINE = MergeTree()
ORDER BY (counterid, eventtime);INSERT INTO hits_clickhouse
SELECT url, eventtime, counterid
FROM hits_icebergأعِد تنفيذ الاستعلام نفسه على جدول MergeTree:
SELECT
url,
count() AS cnt
FROM hits_clickhouse
WHERE counterid = 38
GROUP BY url
ORDER BY cnt DESC
LIMIT 5
نظرًا لأن counterid هو العمود الأول في مفتاح ORDER BY، فإن الفهرس الأساسي المتناثر في ClickHouse يتخطّى مباشرةً إلى وحدات granule ذات الصلة، فلا يقرأ إلا الصفوف الخاصة بـ counterid = 38 بدلًا من فحص جميع الصفوف المئة مليون. والنتيجة هي تسارع كبير جدًا.
يمضي دليل تسريع التحليلات إلى ما هو أبعد من ذلك باستخدام الأنواع LowCardinality، وفهارس النص الكامل، ومفاتيح ترتيب محسّنة، مع عرض تحسّن بنحو ~40x على مجموعة بيانات تضم 283 مليون صف.
اعرف المزيد: يغطّي تسريع التحليلات باستخدام MergeTree تحسين المخطط، وفهرسة النص الكامل، ومقارنة كاملة للأداء قبل وبعد.
الكتابة مرة أخرى إلى Iceberg
يمكن لـ ClickHouse أيضًا كتابة البيانات مرة أخرى إلى جداول Iceberg، مما يتيح سير عمل ETL العكسي — من خلال نشر النتائج المُجمَّعة أو مجموعات فرعية لتستخدمها أدوات أخرى (Spark وTrino وDuckDB وغيرها).
أنشئ جدول Iceberg للمخرجات:
CREATE TABLE output_iceberg
(
url String,
cnt UInt64
)
ENGINE = IcebergS3('https://your-bucket.s3.amazonaws.com/output/', 'access_key', 'secret_key')اكتب النتائج المجمَّعة:
SET allow_experimental_insert_into_iceberg = 1;
INSERT INTO output_iceberg
SELECT
url,
count() AS cnt
FROM hits_clickhouse
GROUP BY url
ORDER BY cnt DESCيمكن لأي محرّك متوافق مع Iceberg قراءة جدول Iceberg الناتج.
تعرّف على المزيد: يشرح كتابة البيانات إلى تنسيقات الجداول المفتوحة كيفية كتابة البيانات الخام والنتائج المجمّعة باستخدام مجموعة بيانات UK Price Paid، بما في ذلك اعتبارات المخطط عند مواءمة أنواع ClickHouse مع Iceberg.
الخطوات التالية
بعد أن اطّلعت الآن على سير العمل الكامل، تعمّق أكثر في كل جانب:
- الاتصال بالكتالوجات — موصى به لأعباء العمل المعتمدة على الكتالوج؛ جولة كاملة في Unity Catalog مع Delta وIceberg
- الاستعلام عن البيانات مباشرةً — التنسيقات الأربعة جميعها، خيارات العناقيد، محركات الجداول، التخزين المؤقت
- تسريع التحليلات — تحسين المخطط، الفهرسة، عرض توضيحي لزيادة السرعة بنحو 40x
- الكتابة إلى بحيرات البيانات — كتابة خام، كتابة مُجمّعة، مواءمة الأنواع
- مصفوفة الدعم — مقارنة الميزات عبر التنسيقات وأنظمة التخزين الخلفية
- أفضل الممارسات — اختيار أسلوب الوصول، وإعدادات الأداء، وأنماط أعباء العمل