Инциденты
Классы инцидентов
P1: полная недоступность API/платежного потока.
P2: деградация ключевых операций (checkout, выдача ZIP, admin actions).
P3: частичные ошибки отдельных endpoint/фильтров/фоновых задач.
Процедура реагирования
- Зафиксировать время и масштаб инцидента.
- Определить пораженный слой: API, БД, Redis, Celery, Telegram.
- Снять логи контейнеров и метрики ошибок.
- Применить временное смягчение (rollback, выключение проблемного endpoint, ручная обработка).
- Провести RCA и оформить корректирующие действия.
Частые сценарии
order_celery не обрабатывает задачи: проверить Redis и worker heartbeat.
- Невалидные миграции: остановить rollout, восстановить snapshot БД.
- Ошибки bot payment flow: проверить публичные endpoint order и токен бота.
Коммуникация
- Оповещение владельца сервиса и тимлида.
- Ведение таймлайна событий.
- Пост-инцидентный отчет с задачами на hardening.