Перейти к основному контенту
Tech Path Finder
КурсыИнтервьюКод-ревьюБлог
Tech Path Finder

Персонализированный путеводитель в IT. Квизы, мок-интервью, код ревью и аналитика прогресса.

@potapov_me

Платформа

  • Курсы
  • Прогресс
  • Мок-интервью
  • Код ревью
  • Живое ревью с ИИ
  • Тренажёр переговоров
  • Закладки

Контент

  • Блог
  • Главная
  • Обратная связь

Компания

  • О проекте
  • Тарифы
  • Условия использования
  • Конфиденциальность
  • Согласие на обработку данных
  • Cookie
  • Реквизиты

Аккаунт

  • Войти
  • Зарегистрироваться
  • Профиль

© 2026 Tech Path Finder. Все права защищены.

·ИП Потапов К.С.·Политика конфиденциальности·
Сделано с ❤️ в России
  1. Prometheus и Grafana для Middle
DevOps / Мониторинг·14 тем·74 вопроса·уровень Middle

Prometheus и Grafana для Middle

Углублённый курс по мониторингу для разработчиков и DevOps с опытом работы с Prometheus. Изучите продвинутый PromQL, Recording Rules, сложные сценарии алертинга, Thanos для долгосрочного хранения и масштабирования, мониторинг Kubernetes, микросервисов и распределённых систем. Практические паттерны инструментирования, оптимизация производительности, troubleshooting production-инцидентов.

Начать курс

Prometheus и Grafana для среднего уровня

Первый месяц с Prometheus уходит на восторг от графиков, второй — на попытку понять, почему алерт о нехватке памяти сработал в три часа ночи, когда ничего не происходило. Курс про вторую фазу: PromQL дальше rate(), алерты, которым можно верить, и стек, который переживает рост числа сервисов.

Четырнадцать тем. PromQL разбирается вглубь: подзапросы, корреляция метрик, прогнозирование, стоимость запроса и способы её снизить. Затем recording rules — предрасчёт того, что иначе считается на каждой перерисовке дашборда. Отдельная тема про многоуровневый алертинг: иерархия warning и critical, эскалация, подавление шума и алерты, которые знают о зависимостях, — чтобы падение одной базы не рождало сорок уведомлений.

Дальше инфраструктура. Мониторинг Kubernetes целиком: kube-state-metrics, cAdvisor, node-exporter, service discovery. Распределённая трассировка через Jaeger и Tempo в связке с метриками. Thanos — две темы, архитектура и пошаговое развёртывание с S3, включая проверку, что данные действительно доехали. Loki и оптимизация LogQL, Grafana с provisioning и автоматизацией через API, blackbox exporter для проверки HTTP, TCP, DNS и сроков сертификатов.

Последние темы — практические: паттерны инструментирования приложений (что мерить, какие лейблы не заводить никогда, как тестировать метрики), методика расследования инцидентов по метрикам, логам и трейсам, тюнинг TSDB и памяти, защита самого мониторинга — TLS, RBAC, аудит.

Предполагается, что Prometheus у вас уже работает и базовый PromQL знаком.

  1. 1

    Продвинутый PromQL: сложные запросы и оптимизация

    Глубокое погружение в PromQL: подзапросы, корреляции, прогнозирование, оптимизация производительности запросов

    10 вопросов
  2. 2

    Recording Rules: предрасчёт метрик

    Создание и использование Recording Rules для оптимизации сложных запросов и снижения нагрузки

    10 вопросов
  3. 3

    Многоуровневый алертинг: от warning до critical

    Построение иерархии алертов, эскалация, подавление, dependency-aware alerting

    10 вопросов
  4. 4

    Мониторинг Kubernetes: поды, ноды, кластер

    Полный стек мониторинга K8s: kube-state-metrics, cAdvisor, node-exporter, сервис-дискавери

    4 вопроса
  5. 5

    Трейсинг в микросервисах: Jaeger и Tempo

    Distributed tracing для отладки микросервисов, интеграция с Prometheus и Grafana

    4 вопроса
  6. 6

    Thanos: долгосрочное хранение и масштабирование

    Архитектура Thanos, Sidecar, Store Gateway, Query, Compactor, Bucket Storage

    4 вопроса
  7. 7

    Развёртывание Thanos: практическое руководство

    Пошаговая настройка Thanos с S3/GCS, конфигурация компонентов, верификация

    4 вопроса
  8. 8

    Продвинутый Loki: паттерны и оптимизация

    Оптимизация запросов LogQL, паттерны логирования, многоуровневое хранение

    4 вопроса
  9. 9

    Продвинутая Grafana: кастомизация и автоматизация

    Кастомные панели, плагины, provisioning, API для автоматизации дашбордов

    4 вопроса
  10. 10

    Blackbox Exporter: мониторинг доступности

    Проверка HTTP, TCP, ICMP, DNS эндпоинтов, SSL сертификатов

    4 вопроса
  11. 11

    Паттерны инструментирования: production-ready

    Best practices инструментирования приложений, обработка edge cases, тестирование метрик

    4 вопроса
  12. 12

    Troubleshooting: расследование инцидентов

    Методология расследования production-инцидентов с использованием observability стека

    4 вопроса
  13. 13

    Оптимизация производительности Prometheus

    Настройка TSDB, оптимизация запросов, управление памятью, шардирование

    4 вопроса
  14. 14

    Безопасность мониторинга: auth и authz

    Защита Prometheus и Grafana, TLS, RBAC, аудит, security alerting

    4 вопроса
  15. Зачёт

    Доступен после всех тем (0 из 14)

  16. Экзамен

    Доступен после зачёта

20 / 20

Subquery (Подзапрос)

Продвинутый PromQL

Вложенный запрос в PromQL, позволяющий применять функции к результату другого запроса. Синтаксис: function[resolution:step].

Пример

max_over_time(avg_over_time(cpu[5m])[1h:5m]) — максимум из средних за 5 минут, вычисленный за последний час

Связанные термины

Offset (Сдвиг)

Продвинутый PromQL

Модификатор в PromQL для сравнения с прошлыми периодами. Сдвигает временной диапазон запроса назад.

Пример

rate(http_requests_total[5m] offset 7d) — rate за 5 минут, но 7 дней назад

Связанные термины

Z-score (Стандартное отклонение)

Продвинутый PromQL

Статистическая метрика для обнаружения аномалий. Показывает, на сколько стандартных отклонений значение отличается от среднего.

Пример

(value - avg[24h]) / stddev[24h] > 3 — аномалия (99.7% доверительный интервал)

Связанные термины

Recording Rule (Правило записи)

Recording Rules

Предрасчёт PromQL выражения и сохранение результата как новой метрики. Ускоряет запросы и снижает нагрузку на Prometheus.

Пример

record: service:http_requests:rate5m, expr: sum by (service) (rate(http_requests_total[5m]))

Связанные термины

Evaluation Interval

Recording Rules

Интервал вычисления recording rules и alerting rules. По умолчанию 30 секунд.

Пример

evaluation_interval: 15s — правила вычисляются каждые 15 секунд

Связанные термины

Inhibition (Подавление)

Продвинутый алертинг

Механизм Alertmanager для подавления алертов нижнего уровня при срабатывании критического алерта той же системы.

Пример

Если DatabaseDown сработал, ServiceDown на том же кластере не отправляется

Связанные термины

Escalation (Эскалация)

Продвинутый алертинг

Повышение уровня серьёзности алерта со временем. Например, warning → critical через 2 часа без решения.

Пример

alert:pending_duration > 7200 с severity=critical

Связанные термины

Burn Rate (Скорость сжигания)

Продвинутый алертинг

Насколько быстро «сжигается» error budget относительно SLO. Используется для алертинга на доступность.

Пример

burn_rate = 10x означает сжигание бюджета в 10 раз быстрее нормы

Связанные термины

kube-state-metrics

Kubernetes мониторинг

Сервис для Kubernetes, который генерирует метрики о состоянии объектов K8s (поды, деплои, сервисы, ноды).

Пример

kube_pod_status_phase, kube_deployment_status_replicas_available

Связанные термины

Thanos Sidecar

Thanos и масштабирование

Компонент Thanos, который работает рядом с Prometheus, загружает блоки в объектное хранилище и предоставляет данные для глобальных запросов.

Пример

thanos sidecar --prometheus.url=http://localhost:9090 --objstore.config-file=s3.yml

Связанные термины

Thanos Query

Thanos и масштабирование

Компонент Thanos для выполнения глобальных PromQL запросов across multiple Prometheus instances и bucket storage.

Пример

thanos query --store=sidecar:10901 --store=store-gateway:10901

Связанные термины

Distributed Tracing

Distributed Tracing

Метод наблюдения за распределёнными системами через отслеживание пути запроса (trace) через микросервисы. Состоит из spans.

Пример

Jaeger, Tempo, Zipkin — системы distributed tracing

Связанные термины

Span (Спан)

Distributed Tracing

Единица работы в distributed tracing. Представляет операцию в конкретном сервисе с именем, временем начала, длительностью и тегами.

Пример

Span: GET /api/users, duration: 45ms, tags: {db.query: SELECT...}

Связанные термины

RBAC (Role-Based Access Control)

Безопасность

Модель контроля доступа на основе ролей. Пользователям назначаются роли, роли определяют разрешения.

Пример

Grafana роли: Viewer, Editor, Admin; Prometheus: read-only, admin

Связанные термины

Mutual TLS (mTLS)

Безопасность

Двусторонняя TLS аутентификация, где и клиент, и сервер предъявляют сертификаты. Используется для безопасной связи между сервисами.

Пример

Prometheus → federated Prometheus с client certificate

Связанные термины

Apdex (Application Performance Index)

Продвинутый PromQL

Индекс удовлетворённости пользователей производительностью приложения (0-1). Основан на времени ответа: Satisfied (<250ms), Tolerating (250-1000ms), Frustrated (>1000ms).

Пример

Apdex = (Satisfied + Tolerating/2) / Total = 0.85 (хорошо)

Связанные термины

Blackbox Exporter

Kubernetes мониторинг

Экспортёр Prometheus для проверки доступности внешних эндпоинтов через HTTP, TCP, ICMP, DNS запросы.

Пример

probe_success{target="https://example.com"} = 1 (доступен)

Связанные термины

LogQL Pattern Matcher

Kubernetes мониторинг

Операторы фильтрации логов в Loki: |= (содержит), != (не содержит), =~ (regex совпадение), !~ (regex несовпадение).

Пример

{app="api"} |= "ERROR" |~ "database.*timeout"

Связанные термины

Thanos Compactor

Thanos и масштабирование

Компонент Thanos для компактации и ретеншена блоков в объектном хранилище. Уменьшает количество мелких файлов и удаляет старые данные.

Пример

thanos compact --data-dir=/var/thanos/compact --objstore.config-file=s3.yml

Связанные термины

Sharding (Шардирование)

Thanos и масштабирование

Горизонтальное разделение данных Prometheus на несколько экземпляров. Каждый шард собирает метрики для части targets.

Пример

Prometheus shard 1: job=api, shard 2: job=worker

Связанные термины

Частые вопросы о курсе «Prometheus и Grafana для Middle»

Состав курса, уровни, практика и способы проверки знаний.

Что входит в курс «Prometheus и Grafana для Middle»?

Курс включает 14 тем и 74 вопроса с разбором ответа. Начать можно с первой темы курса.

Для какого уровня рассчитан курс «Prometheus и Grafana для Middle»?

Маршрут охватывает уровни Middle. Темы расположены от основы к более сложным инженерным задачам, поэтому можно начать с подходящего места и не пропускать важные зависимости.

Как проверить, что материал усвоен?

После прохождения тем доступен зачёт по курсу «Prometheus и Grafana для Middle» — 20 случайных вопросов с порогом 80%. После зачёта открывается экзамен с развёрнутыми ответами и автоматической оценкой, приближённый к техническому собеседованию.

Курс «Prometheus и Grafana для Middle» бесплатный?

Да, курс полностью бесплатный: все 14 тем доступны без оплаты.