Перейти к основному контенту
Tech Path Finder
КурсыИнтервьюКод-ревьюБлог
Tech Path Finder

Персонализированный путеводитель в IT. Квизы, мок-интервью, код ревью и аналитика прогресса.

@potapov_me

Платформа

  • Курсы
  • Прогресс
  • Мок-интервью
  • Код ревью
  • Живое ревью с ИИ
  • Тренажёр переговоров
  • Закладки

Контент

  • Блог
  • Главная
  • Обратная связь

Компания

  • О проекте
  • Тарифы
  • Условия использования
  • Конфиденциальность
  • Согласие на обработку данных
  • Cookie
  • Реквизиты

Аккаунт

  • Войти
  • Зарегистрироваться
  • Профиль

© 2026 Tech Path Finder. Все права защищены.

·ИП Потапов К.С.·Политика конфиденциальности·
Сделано с ❤️ в России
  1. Prometheus и Grafana: экспертный уровень
DevOps / Мониторинг·15 тем·78 вопросов·уровень Senior

Prometheus и Grafana: экспертный уровень

Экспертный курс по проектированию и поддержке observability-платформ для high-load и распределённых систем. Глубокое погружение в архитектуру Thanos и Cortex, шардирование Prometheus, глобальные запросы, мульти-тенантность, capacity planning, disaster recovery. Продвинутые паттерны алертинга для микросервисов, security hardening, compliance. Реальные кейсы масштабирования от ведущих технологических компаний.

Начать курс

Prometheus и Grafana: экспертный уровень

Один Prometheus работает ровно до тех пор, пока метрики помещаются в память одной машины, а срок хранения устраивает. Дальше начинается другая инженерия: федерация, шардирование, объектное хранилище, запросы поверх десятка кластеров — и вопрос, во сколько всё это обходится в месяц.

Пятнадцать тем для тех, у кого Prometheus уже стоит и упёрся. Thanos разбирается покомпонентно — Sidecar, Store Gateway, Query, Compactor, Ruler, Receiver — с ответом, зачем нужен каждый и что ломается, если его не поднять. Рядом Cortex и Mimir: другая архитектура той же задачи, и разбор, в каких условиях выбирают их.

Дальше масштабирование: иерархическая федерация, шардирование по job, тенанту и хешу, единая точка PromQL поверх нескольких кластеров, долгосрочное хранение в S3, GCS и Azure с политиками жизненного цикла. Отдельная тема — capacity planning с формулами расчёта CPU, памяти, диска и сети под известное число серий и частоту сбора.

Эксплуатация: бэкап и восстановление TSDB, сценарии отказа, мультитенантность с RBAC и квотами, Loki в микросервисном режиме, Grafana в HA с внешней базой, TLS и аудит доступа к мониторингу, требования SOC 2, GDPR и HIPAA к хранению и retention, снижение затрат на хранение и трафик в облаке.

Последняя тема — разбор опубликованных архитектур мониторинга Uber, Shopify, DigitalOcean и Red Hat: что именно у них сделано иначе и почему.

Предполагается рабочее знание Prometheus, PromQL и alerting: с основ курс не начинается — для них есть отдельные.

  1. 1

    Thanos: глубокий разбор архитектуры

    Детальный разбор компонентов Thanos: Sidecar, Store Gateway, Query, Compactor, Ruler, Receiver

    10 вопросов
  2. 2

    Cortex и Mimir: распределённый Prometheus

    Архитектура Cortex/Mimir, отличие от Thanos, шардирование, мульти-тенантность

    10 вопросов
  3. 3

    Federation: иерархический мониторинг

    Построение иерархии Prometheus через federation, cross-service Prometheus

    10 вопросов
  4. 4

    Шардирование Prometheus: паттерны и практика

    Горизонтальное разделение Prometheus по job, tenant, hash шarding

    4 вопроса
  5. 5

    Глобальные запросы across clusters

    Единый PromQL endpoint для множества кластеров Prometheus/Thanos

    4 вопроса
  6. 6

    Долгосрочное хранение: S3, GCS, Azure

    Настройка bucket storage, оптимизация costs, lifecycle policies

    4 вопроса
  7. 7

    Capacity planning: расчёт ресурсов

    Формулы для расчёта CPU, RAM, disk, network для Prometheus кластеров

    4 вопроса
  8. 8

    Disaster recovery: бэкап и восстановление

    Стратегии бэкапа TSDB, snapshot, replication, failover сценарии

    4 вопроса
  9. 9

    Мульти-тенантность: изоляция команд и клиентов

    Разделение данных по tenant, RBAC, quota, billing

    4 вопроса
  10. 10

    Продвинутая архитектура Loki

    Loki в режиме microservices, scalable write path, read path optimization

    4 вопроса
  11. 11

    Grafana в enterprise: масштабирование

    Grafana Enterprise, HA deployment, database backend, caching

    4 вопроса
  12. 12

    Security hardening мониторинга

    TLS, authentication, authorization, audit logging, security alerting

    4 вопроса
  13. 13

    Compliance monitoring: SOC2, GDPR, HIPAA

    Мониторинг для compliance требований, audit trails, retention policies

    4 вопроса
  14. 14

    Оптимизация costs observability стека

    Снижение затрат на хранение, вычисления, трафик в cloud environments

    4 вопроса
  15. 15

    Real-world кейсы масштабирования

    Разбор архитектур мониторинга от Uber, Shopify, DigitalOcean, Red Hat

    4 вопроса
  16. Зачёт

    Доступен после всех тем (0 из 15)

  17. Экзамен

    Доступен после зачёта

20 / 20

Thanos Sidecar

Thanos

Компонент Thanos, работающий рядом с Prometheus. Отдаёт данные из TSDB для глобальных запросов и загружает блоки в объектное хранилище.

Пример

thanos sidecar --prometheus.url=http://localhost:9090 --objstore.config-file=s3.yml

Связанные термины

Store Gateway

Thanos

Компонент Thanos для чтения блоков из объектного хранилища и предоставления Store API для Query.

Пример

thanos store gateway --objstore.config-file=s3.yml --data-dir=/var/thanos/store

Связанные термины

Thanos Compactor

Thanos

Компонент для компактации мелких блоков в крупные, применения downsampling и retention policy. Должен быть один на bucket.

Пример

thanos compact --data-dir=/var/thanos/compact --retention.resolution-raw=14d

Связанные термины

Downsampling

Thanos

Агрегация сырых данных в более крупные интервалы (5m, 1h) для долгосрочного хранения. Снижает объём данных и ускоряет запросы.

Пример

Raw (14 дней) → 5m агрегация (30 дней) → 1h агрегация (1 год)

Связанные термины

Distributor (Mimir)

Cortex и Mimir

Компонент Mimir/Cortex для приёма метрик от клиентов, валидации, репликации и шардирования на Ingester.

Пример

Distributor принимает remote write, валидирует метрики, реплицирует на 3 Ingester

Связанные термины

Ingester (Mimir)

Cortex и Mimir

Stateful компонент Mimir/Cortex. Принимает данные от Distributor, хранит в памяти (~2 часа), сжимает и flush в bucket.

Пример

3 Ingester с replication_factor: 3 для HA

Связанные термины

Hash Ring

Cortex и Mimir

Механизм consistent hashing для шардирования данных между Ingester. Минимизирует перераспределение при добавлении/удалении узлов.

Пример

hash(series_name) → позиция на ring → конкретный Ingester

Связанные термины

Query Frontend

Cortex и Mimir

Компонент Mimir/Cortex для оптимизации запросов: кэширование, queue, query splitting, prioritization.

Пример

Кэширование результатов в memcached, разделение длинных запросов на части

Связанные термины

Remote Write

Federation

Протокол Prometheus для асинхронной отправки метрик в удалённое хранилище (Thanos Receive, Mimir, Cortex).

Пример

remote_write: [{url: http://mimir:8080/api/v1/push, queue_config: {...}}]

Связанные термины

/federate эндпоинт

Federation

Специальный HTTP эндпоинт Prometheus для federation. Отдаёт метрики в формате Prometheus по запросу с match[] параметрами.

Пример

curl 'http://prometheus:9090/federate?match[]={job="api"}'

Связанные термины

honor_labels

Federation

Параметр scrape_configs в Prometheus. При true сохраняет оригинальные лейблы (instance, job) от target, не перезаписывает.

Пример

honor_labels: true — сохраняет лейблы при federation

Связанные термины

Sharding (Шардирование)

Масштабирование

Горизонтальное разделение данных Prometheus/Mimir на несколько экземпляров. Каждый шард обрабатывает часть targets/series.

Пример

Шардирование по job: shard1=api, shard2=worker; или hash sharding по имени серии

Связанные термины

Replication Factor

Масштабирование

Количество реплик данных в распределённых системах (Mimir, Thanos Receive). Обеспечивает отказоустойчивость.

Пример

replication_factor: 3 — каждая метрика на 3 Ingester

Связанные термины

Active Series

Масштабирование

Количество уникальных временных рядов, по которым есть данные за последний час. Ключевая метрика для capacity planning.

Пример

100M active series требует ~200GB RAM на Ingester (Mimir)

Связанные термины

Object Storage

Хранение данных

Облачное хранилище объектов (S3, GCS, Azure Blob) для долгосрочного хранения блоков Thanos/Mimir.

Пример

AWS S3: bucket: thanos-metrics, endpoint: s3.us-east-1.amazonaws.com

Связанные термины

Bucket Index

Хранение данных

Метаданные блоков в объектном хранилище. Ускоряет обнаружение блоков при запросах.

Пример

Thanos Compactor создаёт bucket-index.json.gz для ускорения Query

Связанные термины

Multi-tenancy

Enterprise

Изоляция данных и конфигурации по tenant (командам, клиентам). Каждый tenant видит только свои данные.

Пример

Mimir: X-Scope-OrgID: tenant-a изолирует данные tenant-a от tenant-b

Связанные термины

Tenant

Enterprise

Изолированная единица в multi-tenant системе (команда, проект, клиент). Имеет свои данные, лимиты, конфигурацию.

Пример

tenant-a: max_series=1M, ingestion_rate=50000; tenant-b: max_series=100K, ingestion_rate=10000

Связанные термины

Query Splitting

Enterprise

Разделение длинного запроса на части для параллельного выполнения. Ускоряет запросы с большим диапазоном.

Пример

Запрос за 7 дней разбивается на 7 запросов по 1 дню, выполняется параллельно

Связанные термины

Streaming Writes

Enterprise

Функция Mimir для потоковой записи данных напрямую в bucket, минуя буферизацию в Ingester. Снижает latency.

Пример

Mimir streaming writes уменьшают задержку до появления данных в запросах

Связанные термины

Частые вопросы о курсе «Prometheus и Grafana: экспертный уровень»

Состав курса, уровни, практика и способы проверки знаний.

Что входит в курс «Prometheus и Grafana: экспертный уровень»?

Курс включает 15 тем и 78 вопросов с разбором ответа. Начать можно с первой темы курса.

Для какого уровня рассчитан курс «Prometheus и Grafana: экспертный уровень»?

Маршрут охватывает уровни Senior. Темы расположены от основы к более сложным инженерным задачам, поэтому можно начать с подходящего места и не пропускать важные зависимости.

Как проверить, что материал усвоен?

После прохождения тем доступен зачёт по курсу «Prometheus и Grafana: экспертный уровень» — 20 случайных вопросов с порогом 80%. После зачёта открывается экзамен с развёрнутыми ответами и автоматической оценкой, приближённый к техническому собеседованию.

Курс «Prometheus и Grafana: экспертный уровень» бесплатный?

Да, курс полностью бесплатный: все 15 тем доступны без оплаты.