Skip to content
ClickHouse Docs
ClickHouse DocsClickHouse Docs

Мониторинг ClickHouse Cloud

Это руководство предоставляет корпоративным командам, оценивающим ClickHouse Cloud, исчерпывающую информацию о возможностях мониторинга и обсервабилити для развертываний в продакшне. Корпоративные заказчики часто спрашивают о встроенных возможностях мониторинга, интеграции с существующими стеками обсервабилити, включая такие инструменты, как Datadog и AWS CloudWatch, а также о том, как мониторинг ClickHouse соотносится с самоуправляемыми развертываниями.

Расширенная панель обсервабилити

ClickHouse Cloud предоставляет комплексные возможности мониторинга через встроенные интерфейсы панелей мониторинга, доступные в разделе Monitoring. Эти панели мониторинга визуализируют системные метрики и метрики производительности в реальном времени без дополнительной настройки и служат основными инструментами для мониторинга продакшн-среды в реальном времени в ClickHouse Cloud.

  • Advanced Dashboard: основной интерфейс панели мониторинга, доступный через Monitoring → Advanced dashboard, обеспечивает видимость в реальном времени частоты запросов, использования ресурсов, состояния системы и производительности хранилища. Эта панель мониторинга не требует отдельной аутентификации, не мешает инстансам переходить в состояние простоя и не создает дополнительную нагрузку запросами на вашу продакшн-систему. Каждая визуализация строится на основе настраиваемых SQL-запросов, а готовые диаграммы сгруппированы по метрикам, специфичным для ClickHouse, показателям состояния системы и метрикам, специфичным для Cloud. Вы можете расширить возможности мониторинга, создавая пользовательские запросы прямо в SQL Console.
Advanced dashboard

Пользователи, которые хотят расширить эти визуализации, могут использовать функцию dashboards в ClickHouse Cloud, выполняя запросы напрямую к системным таблицам.

  • Native advanced dashboard: альтернативный интерфейс панели мониторинга, доступный по ссылке "You can still access the native advanced dashboard" в разделе Monitoring. Он открывается в отдельной вкладке, требует аутентификации и предоставляет альтернативный интерфейс для мониторинга состояния системы и сервиса. Эта панель мониторинга поддерживает расширенную аналитику: вы можете изменять лежащие в ее основе SQL-запросы.
Advanced dashboard

Обе панели мониторинга обеспечивают мгновенную видимость состояния сервиса и производительности без внешних зависимостей, что отличает их от внешних инструментов, ориентированных на отладку, таких как ClickStack.

Подробное описание возможностей панели мониторинга и доступных метрик см. в документации по advanced dashboard.

Query Insights и мониторинг ресурсов

ClickHouse Cloud предоставляет дополнительные возможности мониторинга:

  • Query Insights: встроенный интерфейс для анализа производительности запросов и устранения неполадок
  • Панель использования ресурсов: отслеживает использование памяти, выделение CPU и динамику передачи данных. Графики использования CPU и памяти показывают максимальное значение метрики использования за определенный период времени. График использования CPU показывает метрику загрузки CPU на уровне системы (а НЕ метрику загрузки CPU ClickHouse).

Подробную информацию см. в документации по Query Insights и использованию ресурсов.

Совместимая с Prometheus конечная точка метрик

ClickHouse Cloud предоставляет конечную точку Prometheus. Это позволяет сохранить текущие рабочие процессы, использовать имеющуюся экспертизу команды и интегрировать метрики ClickHouse в корпоративные платформы мониторинга, включая Grafana, Datadog и другие инструменты, совместимые с Prometheus.

Конечная точка на уровне организации объединяет метрики всех сервисов, а конечные точки отдельных сервисов обеспечивают более детальный мониторинг. Основные возможности:

  • Опция фильтрации метрик: необязательный параметр filtered_metrics=true уменьшает объем передаваемых данных с более чем 1000 доступных метрик до 125 «критически важных» метрик, что помогает оптимизировать затраты и упростить мониторинг
  • Кэшированная выдача метрик: используются materialized views, обновляемые каждую минуту, чтобы минимизировать нагрузку от запросов на системы в продакшн

Примеры интеграции

Внешняя интеграция позволяет организациям сохранять устоявшиеся процессы мониторинга, использовать накопленную в командах экспертизу работы со знакомыми инструментами и встраивать мониторинг ClickHouse в более широкий контур обсервабилити инфраструктуры без нарушения текущих процессов и без необходимости значительных вложений в переобучение. Команды могут применять существующие правила оповещений и процедуры эскалации к метрикам ClickHouse, одновременно сопоставляя производительность базы данных с состоянием приложений и инфраструктуры в рамках единой платформы обсервабилити. Такой подход помогает максимально повысить отдачу от текущих систем мониторинга и ускоряет устранение неполадок за счет консолидированных панелей мониторинга и привычных интерфейсов инструментов.

Мониторинг в Grafana Cloud

Grafana поддерживает мониторинг ClickHouse как через прямую интеграцию с плагином, так и с помощью подходов на основе Prometheus. Интеграция через конечную точку Prometheus позволяет сохранять операционное разделение между мониторингом и производственными рабочими нагрузками, а также визуализировать данные в существующей инфраструктуре Grafana Cloud. Рекомендации по настройке см. в документации Grafana по ClickHouse.

Мониторинг Datadog

Datadog разрабатывает специальную API-интеграцию, которая обеспечит корректный мониторинг облачного сервиса с учетом перехода сервиса в режим простоя. Пока она не готова, команды могут использовать подход с интеграцией OpenMetrics через конечные точки Prometheus ClickHouse, чтобы разграничить эксплуатационные задачи и снизить затраты на мониторинг. Рекомендации по настройке см. в документации Datadog по интеграции Prometheus и OpenMetrics.

ClickStack

ClickStack — рекомендуемое решение ClickHouse для обсервабилити, предназначенное для глубокого анализа системы и отладки. Оно предоставляет единую платформу для журналов, метрик и трассировок, где ClickHouse выступает в качестве движка хранения. Этот подход основан на HyperDX — интерфейсе ClickStack, который напрямую подключается к системным таблицам внутри вашего экземпляра ClickHouse. В HyperDX есть панель мониторинга, ориентированная на ClickHouse, со вкладками Selects, Inserts и Infrastructure. Команды также могут использовать синтаксис Lucene или SQL для поиска по системным таблицам и журналам, а также создавать собственные визуализации через Chart Explorer для детального анализа системы. Этот подход лучше всего подходит для отладки сложных проблем, анализа производительности и глубокого изучения внутреннего состояния системы, а не для оповещений в production в реальном времени.

Варианты развертывания ClickStack

  • HyperDX в ClickHouse Cloud (закрытая предварительная версия): HyperDX можно запустить на любом сервисе ClickHouse Cloud.
  • Helm: Рекомендуется для отладочных сред на базе Kubernetes. Поддерживает интеграцию с ClickHouse Cloud и позволяет настраивать конфигурацию под конкретную среду, лимиты ресурсов и масштабирование через values.yaml.
  • Docker Compose: Развертывает каждый компонент (ClickHouse, HyperDX, OTel collector, MongoDB) отдельно. При интеграции с ClickHouse Cloud вы можете изменить compose-файл и удалить неиспользуемые компоненты, в частности ClickHouse и OpenTelemetry Collector.
  • Только HyperDX: Автономный контейнер HyperDX.

Полный перечень вариантов развертывания и сведения об архитектуре см. в документации ClickStack и руководстве по ингестии данных.

Прямая интеграция с плагином Grafana

Плагин источника данных ClickHouse для Grafana позволяет визуализировать и исследовать данные напрямую из ClickHouse с использованием системных таблиц. Этот подход хорошо подходит для мониторинга производительности и создания пользовательских дашбордов для детального анализа системы. Подробные сведения об установке и настройке плагина см. в плагине источника данных ClickHouse. Полное решение для мониторинга с использованием набора Prometheus-Grafana mix-in с преднастроенными дашбордами и правилами оповещений описано в статье Monitor ClickHouse with the new Prometheus-Grafana mix-in.

Прямая интеграция с Datadog

Datadog предлагает для своего агента плагин ClickHouse Monitoring, который напрямую запрашивает системные таблицы. Эта интеграция обеспечивает комплексный мониторинг базы данных с учетом особенностей кластера благодаря функции clusterAllReplicas.

Непосредственное использование системных таблиц

Вы можете выполнять углубленный анализ производительности запросов, обращаясь напрямую к системным таблицам ClickHouse, в частности к system.query_log. Используя SQL-консоль или клиент ClickHouse, команды могут выявлять медленные запросы, анализировать использование ресурсов и отслеживать закономерности использования в масштабах всей организации.

Анализ производительности запросов

Для анализа производительности запросов можно использовать журнал запросов из системной таблицы.

Пример запроса: найдите 5 самых долгих запросов среди всех реплик кластера:

SELECT
    type,
    event_time, 
    query_duration_ms,
    query,
    read_rows,
    tables
FROM clusterAllReplicas(default, system.query_log)
WHERE event_time >= (now() - toIntervalMinute(60)) AND type='QueryFinish'
ORDER BY query_duration_ms DESC
LIMIT 5
FORMAT VERTICAL

Решения сообщества для мониторинга

Сообщество ClickHouse разработало комплексные решения для мониторинга, интегрируемые с популярными стеками обсервабилити. ClickHouse Monitoring предоставляет полноценное решение для мониторинга с преднастроенными дашбордами. Этот проект с открытым исходным кодом предлагает быстрый старт для команд, которые хотят внедрить мониторинг ClickHouse, опираясь на устоявшиеся лучшие практики и проверенные конфигурации дашбордов.

Влияние на систему

Все описанные выше подходы либо используют конечные точки Prometheus, либо управляются через ClickHouse Cloud, либо напрямую выполняют запросы к системным таблицам. Последний из этих вариантов предполагает выполнение запросов к продакшн-сервису ClickHouse. Это создает дополнительную нагрузку на наблюдаемую систему и не позволяет экземплярам ClickHouse Cloud переходить в неактивное состояние, что ухудшает оптимизацию затрат. Кроме того, если продакшн-система выйдет из строя, мониторинг тоже может пострадать, поскольку они связаны между собой. Этот подход хорошо подходит для глубокого анализа внутреннего состояния системы и отладки, но менее уместен для мониторинга продакшн-среды в реальном времени. При оценке прямой интеграции с Grafana по сравнению с подходами интеграции через внешние инструменты, рассмотренными в следующем разделе, учитывайте этот компромисс между возможностями детального анализа системы и операционными накладными расходами.

Navigation