Azure Synapse é um serviço integrado de análise que combina big data, ciência de dados e data warehousing para possibilitar análises de dados rápidas e em larga escala. No Synapse, os pools do Spark fornecem clusters Apache Spark escaláveis e sob demanda, permitindo executar transformações de dados complexas, machine learning e integrações com sistemas externos.
Este artigo mostra como integrar o ClickHouse Spark connector ao usar o Apache Spark no Azure Synapse.
Adicione as dependências do conector
O Azure Synapse oferece suporte a três níveis de gerenciamento de pacotes:
- Pacotes padrão
- Nível do pool do Spark
- Nível da sessão
Siga o guia Gerenciar bibliotecas para pools do Apache Spark e adicione as seguintes dependências obrigatórias ao seu aplicativo Spark
clickhouse-spark-runtime-{spark_version}_{scala_version}-{connector_version}.jar- Maven oficialclickhouse-jdbc-{java_client_version}-all.jar- Maven oficial
Consulte a nossa documentação da Matriz de Compatibilidade do Spark Connector para entender quais versões melhor atendem às suas necessidades.
Adicione o ClickHouse como um catálogo
Há várias maneiras de adicionar configurações do Spark à sua sessão:
- Arquivo de configuração personalizado para carregar com a sua sessão
- Adicione configurações pela UI do Azure Synapse
- Adicione configurações no seu notebook do Synapse
Siga este guia de Gerenciar a configuração do Apache Spark e adicione as configurações do Spark exigidas pelo conector.
Por exemplo, você pode configurar sua sessão do Spark no notebook com estas configurações:
%%configure -f
{
"conf": {
"spark.sql.catalog.clickhouse": "com.clickhouse.spark.ClickHouseCatalog",
"spark.sql.catalog.clickhouse.host": "<clickhouse host>",
"spark.sql.catalog.clickhouse.protocol": "https",
"spark.sql.catalog.clickhouse.http_port": "<port>",
"spark.sql.catalog.clickhouse.user": "<username>",
"spark.sql.catalog.clickhouse.password": "password",
"spark.sql.catalog.clickhouse.database": "default"
}
}Certifique-se de que isso esteja na primeira célula, como a seguir:

Consulte a página de configurações do Spark para ClickHouse para ver configurações adicionais.
Verificação da configuração
Para verificar se as dependências e configurações foram definidas corretamente, acesse a UI do Spark da sua sessão e vá até a guia Environment.
Lá, procure as configurações relacionadas ao ClickHouse:
