데이터 웨어하우징Cloud
사전 요구 사항
이 빠른 시작을 시작하기 전에 다음이 준비되어 있어야 합니다:
To successfully follow this guide, you’ll need the following:
- A running ClickHouse Cloud service. If you don’t have one yet, complete the ClickHouse Cloud quick start first.
- Iceberg 호환 데이터 레이크에 대한 액세스
- 데이터 레이크 카탈로그(Data Lake Catalog) (URL + 자격 증명)
- 데이터 레이크 카탈로그 유형에 따라 필요한 객체 스토리지 자격 증명(예: S3 호환 스토리지)
- 카탈로그에 등록된 기존 Iceberg 테이블 1개 이상
Iceberg 카탈로그에 아직 데이터가 없다면 이 데이터셋을 업로드할 수 있습니다. 이 가이드에서는 여기 있는 데이터셋을 사용해 시연합니다.
구축할 내용
이 빠른 시작에서는 다음을 수행합니다:
- ClickHouse Cloud에서 Iceberg REST 카탈로그에 연결
- 해당 카탈로그를 기반으로 하는 ClickHouse 데이터베이스 생성
- ClickHouse에서 기존 Iceberg 테이블에 직접 쿼리 실행
- ClickHouse가 데이터 레이크에서 데이터를 읽고 있는지 확인
이 과정을 마치면 ClickHouse Cloud가 Iceberg 카탈로그에 연결되며, 데이터를 복사하지 않고도 Iceberg 테이블에 대해 SQL 쿼리를 실행할 수 있습니다.
DataLakeCatalog 연결 생성
이 단계에서는 ClickHouse Cloud에서 데이터 레이크 카탈로그에 연결합니다.
-
ClickHouse Cloud 서비스를 엽니다.
-
Data Sources â Connect to your 데이터 레이크 카탈로그로 이동합니다.
-
드롭다운에서 데이터 카탈로그를 선택합니다.
-
자격 증명과 연결 정보를 양식에 입력합니다. Unity Catalog의 경우 다음 항목을 입력합니다:
- Open Table Format (Iceberg)
- ClickHouse 데이터베이스 이름. 이 이름은 Iceberg 테이블을 쿼리할 때 사용할 ClickHouse 데이터베이스 이름이 됩니다.
- 워크스페이스 ID
- Databricks 카탈로그 이름
- Client ID
- Client Secret
이미지 삽입
-
카탈로그를 저장합니다. 이제 Data Sources 페이지에서 데이터베이스에서 사용 가능한 테이블 수와 함께 데이터 카탈로그가 로드된 것을 확인할 수 있습니다.
Iceberg 테이블 쿼리
이 단계에서는 데이터 카탈로그의 Iceberg 테이블을 쿼리합니다.
Show Tables또는SQL Console을 클릭하면 SQL 콘솔로 이동하며, 데이터 레이크에 연결된 새 데이터베이스가 표시됩니다.SQL Console을 통해 이동한 경우 데이터베이스 드롭다운을 Iceberg 데이터베이스로 변경합니다.- 파일 트리에 하나 이상의 Iceberg 테이블이 표시되어야 합니다. 다음 쿼리를 실행합니다:
select * from iceberg_database.`iceberg_db.your_table`- ClickHouse가 Iceberg 테이블의 행을 반환합니다.
다음 단계
이제 데이터 레이크에 연결되었으므로 ClickHouse에서 Iceberg 테이블을 작성해 볼 수 있습니다.
