Стратегия мониторинга ML-модели с метриками и runbook
Промпт проектирует production-мониторинг ML-системы: SLO, метрики качества и инфраструктуры, контроль дрейфа, связывание ground truth, алерты, шаблоны панелей и процедуры реагирования команды MLOps.
Разработай полную и воспроизводимую стратегию мониторинга для модели {model_type}, работающей в контексте {business_context}, с фокусом на метрику {metric} и порог тревоги {threshold}.
Ответ должен быть готов к исполнению командой MLOps и содержать конфигурации, примеры запросов, шаблоны панелей и процедуры реагирования.
Структура ответа строго по разделам:
A. Краткое резюме.
B. Цели мониторинга и SLO/SLA:
- качество, стабильность, задержка, доступность, стоимость;
- окна оценки и единицы измерения.
C. Список метрик:
- {metric};
- latency p50/p90/p99, throughput, error rate, CPU/GPU/memory;
- PSI, KL, KS, missingness, label skew и другие метрики дрейфа.
D. Сбор, хранение и привязка ground truth:
- inference logs;
- feature store и label store;
- пример JSON события.
E. Алертинг и правила срабатывания:
- warning и critical;
- пороги, окна, anti-noise меры.
F. Дашборды и панели:
- какие панели нужны;
- какие запросы или формулы использовать.
G. Runbook и процедуры эскалации.
H. План внедрения по этапам.
Ограничения:
- не задавай вопросов;
- если вход неполный, перечисли допущения отдельно;
- не упоминай инструмент без примера его применения;
- все пороги и окна задавай численно;
- избегай общей теории, оставь только практические действия.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT