Это руководство предоставляет корпоративным командам, оценивающим ClickHouse Cloud, исчерпывающую информацию о возможностях мониторинга и обсервабилити для развертываний в продакшне. Корпоративные заказчики часто спрашивают о встроенных возможностях мониторинга, интеграции с существующими стеками обсервабилити, включая такие инструменты, как Datadog и AWS CloudWatch, а также о том, как мониторинг ClickHouse соотносится с самоуправляемыми развертываниями.
Расширенная панель обсервабилити
ClickHouse Cloud предоставляет комплексные возможности мониторинга через встроенные интерфейсы панелей мониторинга, доступные в разделе Monitoring. Эти панели мониторинга визуализируют системные метрики и метрики производительности в реальном времени без дополнительной настройки и служат основными инструментами для мониторинга продакшн-среды в реальном времени в ClickHouse Cloud.
- Advanced Dashboard: основной интерфейс панели мониторинга, доступный через Monitoring → Advanced dashboard, обеспечивает видимость в реальном времени частоты запросов, использования ресурсов, состояния системы и производительности хранилища. Эта панель мониторинга не требует отдельной аутентификации, не мешает инстансам переходить в состояние простоя и не создает дополнительную нагрузку запросами на вашу продакшн-систему. Каждая визуализация строится на основе настраиваемых SQL-запросов, а готовые диаграммы сгруппированы по метрикам, специфичным для ClickHouse, показателям состояния системы и метрикам, специфичным для Cloud. Вы можете расширить возможности мониторинга, создавая пользовательские запросы прямо в SQL Console.

Пользователи, которые хотят расширить эти визуализации, могут использовать функцию dashboards в ClickHouse Cloud, выполняя запросы напрямую к системным таблицам.
- Native advanced dashboard: альтернативный интерфейс панели мониторинга, доступный по ссылке "You can still access the native advanced dashboard" в разделе Monitoring. Он открывается в отдельной вкладке, требует аутентификации и предоставляет альтернативный интерфейс для мониторинга состояния системы и сервиса. Эта панель мониторинга поддерживает расширенную аналитику: вы можете изменять лежащие в ее основе SQL-запросы.

Обе панели мониторинга обеспечивают мгновенную видимость состояния сервиса и производительности без внешних зависимостей, что отличает их от внешних инструментов, ориентированных на отладку, таких как ClickStack.
Подробное описание возможностей панели мониторинга и доступных метрик см. в документации по advanced dashboard.
Query Insights и мониторинг ресурсов
ClickHouse Cloud предоставляет дополнительные возможности мониторинга:
- Query Insights: встроенный интерфейс для анализа производительности запросов и устранения неполадок
- Панель использования ресурсов: отслеживает использование памяти, выделение CPU и динамику передачи данных. Графики использования CPU и памяти показывают максимальное значение метрики использования за определенный период времени. График использования CPU показывает метрику загрузки CPU на уровне системы (а НЕ метрику загрузки CPU ClickHouse).
Подробную информацию см. в документации по Query Insights и использованию ресурсов.
Совместимая с Prometheus конечная точка метрик
ClickHouse Cloud предоставляет конечную точку Prometheus. Это позволяет сохранить текущие рабочие процессы, использовать имеющуюся экспертизу команды и интегрировать метрики ClickHouse в корпоративные платформы мониторинга, включая Grafana, Datadog и другие инструменты, совместимые с Prometheus.
Конечная точка на уровне организации объединяет метрики всех сервисов, а конечные точки отдельных сервисов обеспечивают более детальный мониторинг. Основные возможности:
- Опция фильтрации метрик: необязательный параметр filtered_metrics=true уменьшает объем передаваемых данных с более чем 1000 доступных метрик до 125 «критически важных» метрик, что помогает оптимизировать затраты и упростить мониторинг
- Кэшированная выдача метрик: используются materialized views, обновляемые каждую минуту, чтобы минимизировать нагрузку от запросов на системы в продакшн
Примеры интеграции
Внешняя интеграция позволяет организациям сохранять устоявшиеся процессы мониторинга, использовать накопленную в командах экспертизу работы со знакомыми инструментами и встраивать мониторинг ClickHouse в более широкий контур обсервабилити инфраструктуры без нарушения текущих процессов и без необходимости значительных вложений в переобучение. Команды могут применять существующие правила оповещений и процедуры эскалации к метрикам ClickHouse, одновременно сопоставляя производительность базы данных с состоянием приложений и инфраструктуры в рамках единой платформы обсервабилити. Такой подход помогает максимально повысить отдачу от текущих систем мониторинга и ускоряет устранение неполадок за счет консолидированных панелей мониторинга и привычных интерфейсов инструментов.
Мониторинг в Grafana Cloud
Grafana поддерживает мониторинг ClickHouse как через прямую интеграцию с плагином, так и с помощью подходов на основе Prometheus. Интеграция через конечную точку Prometheus позволяет сохранять операционное разделение между мониторингом и производственными рабочими нагрузками, а также визуализировать данные в существующей инфраструктуре Grafana Cloud. Рекомендации по настройке см. в документации Grafana по ClickHouse.
Мониторинг Datadog
Datadog разрабатывает специальную API-интеграцию, которая обеспечит корректный мониторинг облачного сервиса с учетом перехода сервиса в режим простоя. Пока она не готова, команды могут использовать подход с интеграцией OpenMetrics через конечные точки Prometheus ClickHouse, чтобы разграничить эксплуатационные задачи и снизить затраты на мониторинг. Рекомендации по настройке см. в документации Datadog по интеграции Prometheus и OpenMetrics.
ClickStack
ClickStack — рекомендуемое решение ClickHouse для обсервабилити, предназначенное для глубокого анализа системы и отладки. Оно предоставляет единую платформу для журналов, метрик и трассировок, где ClickHouse выступает в качестве движка хранения. Этот подход основан на HyperDX — интерфейсе ClickStack, который напрямую подключается к системным таблицам внутри вашего экземпляра ClickHouse. В HyperDX есть панель мониторинга, ориентированная на ClickHouse, со вкладками Selects, Inserts и Infrastructure. Команды также могут использовать синтаксис Lucene или SQL для поиска по системным таблицам и журналам, а также создавать собственные визуализации через Chart Explorer для детального анализа системы. Этот подход лучше всего подходит для отладки сложных проблем, анализа производительности и глубокого изучения внутреннего состояния системы, а не для оповещений в production в реальном времени.
Варианты развертывания ClickStack
- HyperDX в ClickHouse Cloud (закрытая предварительная версия): HyperDX можно запустить на любом сервисе ClickHouse Cloud.
- Helm: Рекомендуется для отладочных сред на базе Kubernetes. Поддерживает интеграцию с ClickHouse Cloud и позволяет настраивать конфигурацию под конкретную среду, лимиты ресурсов и масштабирование через
values.yaml. - Docker Compose: Развертывает каждый компонент (ClickHouse, HyperDX, OTel collector, MongoDB) отдельно. При интеграции с ClickHouse Cloud вы можете изменить compose-файл и удалить неиспользуемые компоненты, в частности ClickHouse и OpenTelemetry Collector.
- Только HyperDX: Автономный контейнер HyperDX.
Полный перечень вариантов развертывания и сведения об архитектуре см. в документации ClickStack и руководстве по ингестии данных.
Прямая интеграция с плагином Grafana
Плагин источника данных ClickHouse для Grafana позволяет визуализировать и исследовать данные напрямую из ClickHouse с использованием системных таблиц. Этот подход хорошо подходит для мониторинга производительности и создания пользовательских дашбордов для детального анализа системы. Подробные сведения об установке и настройке плагина см. в плагине источника данных ClickHouse. Полное решение для мониторинга с использованием набора Prometheus-Grafana mix-in с преднастроенными дашбордами и правилами оповещений описано в статье Monitor ClickHouse with the new Prometheus-Grafana mix-in.
Прямая интеграция с Datadog
Datadog предлагает для своего агента плагин ClickHouse Monitoring, который напрямую запрашивает системные таблицы. Эта интеграция обеспечивает комплексный мониторинг базы данных с учетом особенностей кластера благодаря функции clusterAllReplicas.
Непосредственное использование системных таблиц
Вы можете выполнять углубленный анализ производительности запросов, обращаясь напрямую к системным таблицам ClickHouse, в частности к system.query_log. Используя SQL-консоль или клиент ClickHouse, команды могут выявлять медленные запросы, анализировать использование ресурсов и отслеживать закономерности использования в масштабах всей организации.
Анализ производительности запросов
Для анализа производительности запросов можно использовать журнал запросов из системной таблицы.
Пример запроса: найдите 5 самых долгих запросов среди всех реплик кластера:
SELECT
type,
event_time,
query_duration_ms,
query,
read_rows,
tables
FROM clusterAllReplicas(default, system.query_log)
WHERE event_time >= (now() - toIntervalMinute(60)) AND type='QueryFinish'
ORDER BY query_duration_ms DESC
LIMIT 5
FORMAT VERTICALРешения сообщества для мониторинга
Сообщество ClickHouse разработало комплексные решения для мониторинга, интегрируемые с популярными стеками обсервабилити. ClickHouse Monitoring предоставляет полноценное решение для мониторинга с преднастроенными дашбордами. Этот проект с открытым исходным кодом предлагает быстрый старт для команд, которые хотят внедрить мониторинг ClickHouse, опираясь на устоявшиеся лучшие практики и проверенные конфигурации дашбордов.
Влияние на систему
Все описанные выше подходы либо используют конечные точки Prometheus, либо управляются через ClickHouse Cloud, либо напрямую выполняют запросы к системным таблицам. Последний из этих вариантов предполагает выполнение запросов к продакшн-сервису ClickHouse. Это создает дополнительную нагрузку на наблюдаемую систему и не позволяет экземплярам ClickHouse Cloud переходить в неактивное состояние, что ухудшает оптимизацию затрат. Кроме того, если продакшн-система выйдет из строя, мониторинг тоже может пострадать, поскольку они связаны между собой. Этот подход хорошо подходит для глубокого анализа внутреннего состояния системы и отладки, но менее уместен для мониторинга продакшн-среды в реальном времени. При оценке прямой интеграции с Grafana по сравнению с подходами интеграции через внешние инструменты, рассмотренными в следующем разделе, учитывайте этот компромисс между возможностями детального анализа системы и операционными накладными расходами.