О чём курс

Системы мониторинга часто превращаются в источник шума, перегружая инженеров бесполезными уведомлениями — здесь разбирают, как построить рабочую стратегию Observability, которая реально помогает находить и устранять сбои. 11 часов контента охватывают практику внедрения SRE-подходов в крупных компаниях, организацию распределенной трассировки и анализ инцидентов после их завершения. Вы узнаете, как перейти от реактивного исправления ошибок на продакшене к проактивному управлению надежностью, опираясь на опыт экспертов из Google, Tinkoff, Авито, Ozon и Datadog.

Программа обучения

  • Доклад: SRE. Чему нас научил Google (Дмитрий Масленников)
  • Доклад: Какие такие метрики, или как делать не надо (Маргарита Ольшанская)
  • Доклад: Измерение надежности системы (Павел Лакосников)
  • Круглый стол: Как устроено SRE в разных компаниях (Д. Масленников, М. Фесенко, С. Бухаров, М. Гусев)
  • Доклад: Какую (ещё) пользу можно извлечь из распределённых трассировок? (Григорий Кошелев)
  • Доклад: Как мы структурировали хаос в Ozon (Дина Сафина)
  • Интервью: SRE-культура (Максим Гусев)
  • Доклад: SRE: Что это и как выглядит готовое блюдо (Ганна Новикова)
  • Воркшоп: Разбираем Post mortem (Олег Федоткин)
  • Доклад: Когда вы перестанете косячить на проде? (Михаил Дружинин)
Складчина создана 29 января 2023 г. · описание обновлено 23 марта 2026 г.
544 ₽ 3 000 ₽