← Все навыки

Observability и надёжность (SRE)

курс про то, как сделать систему наблюдаемой и надёжной: не просто «поставить мониторинг», а уметь по сигналам понять, что происходит внутри незнакомого запроса в проде. Разбираем три столпа observability (logs, metrics, traces), методологии RED/USE, SLI/SLO/SLA с error budget, алертинг без alert fatigue, on-call и постмортемы. Уровень Middle+ с прицелом на собеседования по SRE-практикам и реальную эксплуатацию распределённых систем.

Middle+ Индивидуально с ментором

Что разбираем

  • Monitoring vs observability — почему заранее заданных дашбордов недостаточно для неизвестных отказов
  • Три столпа — logs, metrics, traces и их взаимодополнение
  • Структурное логирование — JSON-логи, уровни, correlation ID, связывание логов одного запроса
  • Метрики — типы (counter, gauge, histogram), методологии RED (Rate, Errors, Duration) и USE (Utilization, Saturation, Errors), кардинальность лейблов
  • Стек Prometheus + Grafana — pull-модель, PromQL, экспортеры, дашборды
  • Distributed tracing — OpenTelemetry, trace/span, context propagation через сервисы, поиск источника latency
  • SLI/SLO/SLA — как выбрать индикаторы, поставить цели, посчитать error budget и что делать при его исчерпании
  • Алертинг — SLO-based и symptom-based алерты, borrow rate / burn rate, борьба с alert fatigue, runbooks
  • On-call — ротации, эскалация (PagerDuty), реакция на инцидент
  • Разбор инцидентов и blameless postmortem — таймлайн, root cause, action items
  • Health checks — liveness vs readiness, влияние на трафик и self-healing
  • Graceful degradation и деградация функциональности вместо полного отказа
  • Golden signals и приоритизация того, что мониторить в первую очередь

Как проходит обучение

  • Занятия один на один с ментором под ваш темп и пробелы
  • Материалы курса открываются в личном кабинете, практику разбираете на встречах
  • Программа собирается под цель: подготовка к собеседованию или рабочая задача