Перейти к содержанию

Инциденты

Классы инцидентов

  • P1: полная недоступность API/платежного потока.
  • P2: деградация ключевых операций (checkout, выдача ZIP, admin actions).
  • P3: частичные ошибки отдельных endpoint/фильтров/фоновых задач.

Процедура реагирования

  1. Зафиксировать время и масштаб инцидента.
  2. Определить пораженный слой: API, БД, Redis, Celery, Telegram.
  3. Снять логи контейнеров и метрики ошибок.
  4. Применить временное смягчение (rollback, выключение проблемного endpoint, ручная обработка).
  5. Провести RCA и оформить корректирующие действия.

Частые сценарии

  • order_celery не обрабатывает задачи: проверить Redis и worker heartbeat.
  • Невалидные миграции: остановить rollout, восстановить snapshot БД.
  • Ошибки bot payment flow: проверить публичные endpoint order и токен бота.

Коммуникация

  • Оповещение владельца сервиса и тимлида.
  • Ведение таймлайна событий.
  • Пост-инцидентный отчет с задачами на hardening.