Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

Integração do Azure Synapse com o ClickHouse

Suportado pelo ClickHouse

Azure Synapse é um serviço integrado de análise que combina big data, ciência de dados e data warehousing para possibilitar análises de dados rápidas e em larga escala. No Synapse, os pools do Spark fornecem clusters Apache Spark escaláveis e sob demanda, permitindo executar transformações de dados complexas, machine learning e integrações com sistemas externos.

Este artigo mostra como integrar o ClickHouse Spark connector ao usar o Apache Spark no Azure Synapse.

Adicione as dependências do conector

O Azure Synapse oferece suporte a três níveis de gerenciamento de pacotes:

  1. Pacotes padrão
  2. Nível do pool do Spark
  3. Nível da sessão

Siga o guia Gerenciar bibliotecas para pools do Apache Spark e adicione as seguintes dependências obrigatórias ao seu aplicativo Spark

  • clickhouse-spark-runtime-{spark_version}_{scala_version}-{connector_version}.jar - Maven oficial
  • clickhouse-jdbc-{java_client_version}-all.jar - Maven oficial

Consulte a nossa documentação da Matriz de Compatibilidade do Spark Connector para entender quais versões melhor atendem às suas necessidades.

Há várias maneiras de adicionar configurações do Spark à sua sessão:

  • Arquivo de configuração personalizado para carregar com a sua sessão
  • Adicione configurações pela UI do Azure Synapse
  • Adicione configurações no seu notebook do Synapse

Siga este guia de Gerenciar a configuração do Apache Spark e adicione as configurações do Spark exigidas pelo conector.

Por exemplo, você pode configurar sua sessão do Spark no notebook com estas configurações:

%%configure -f
{
    "conf": {
        "spark.sql.catalog.clickhouse": "com.clickhouse.spark.ClickHouseCatalog",
        "spark.sql.catalog.clickhouse.host": "<clickhouse host>",
        "spark.sql.catalog.clickhouse.protocol": "https",
        "spark.sql.catalog.clickhouse.http_port": "<port>",
        "spark.sql.catalog.clickhouse.user": "<username>",
        "spark.sql.catalog.clickhouse.password": "password",
        "spark.sql.catalog.clickhouse.database": "default"
    }
}

Certifique-se de que isso esteja na primeira célula, como a seguir:

Definindo configurações do Spark em um notebook

Consulte a página de configurações do Spark para ClickHouse para ver configurações adicionais.

Verificação da configuração

Para verificar se as dependências e configurações foram definidas corretamente, acesse a UI do Spark da sua sessão e vá até a guia Environment. Lá, procure as configurações relacionadas ao ClickHouse:

Verificando as configurações do ClickHouse usando a UI do Spark

Recursos adicionais

Navigation