Разработай прикладную архитектуру мониторинга и план внедрения для продакшн-модели.
Входные данные:
- model_type; если не задано, используй "production ML model (classification or regression)";
- business_context; если не задано, используй "customer-facing real-time service";
- performance_metrics; если не задано, используй "latency, throughput, accuracy, precision, recall, F1, AUC, calibration, resource utilization, error rate";
- data_sources; если не задано, используй "online feature store, offline training data, inference request logs, ground-truth label sink";
- infrastructure; если не задано, используй "Kubernetes + Prometheus + Grafana + S3 object storage + Kafka".
Если какой-либо placeholder не заменён, автоматически применяй дефолт и перечисляй допущения в начале ответа.
Отвечай только на русском языке, не задавай вопросов и не используй общие фразы без конкретного выбора технологии или метода.
Структура ответа строго по разделам 1-9:
1. Краткое резюме архитектуры: цели мониторинга, ключевые сценарии и основные компоненты.
2. Текстовая диаграмма архитектуры: компоненты, связи, входы, выходы, отказоустойчивость и требования к масштабу.
3. Точки сбора данных: inference logs, feature snapshots, labels, model telemetry, system metrics, business KPI; для каждой точки укажи формат события, пример JSON-полей, частоту, SLA задержки и обязательные метаданные.
4. Хранилища и требования: рекомендуемый тип хранилища для каждого набора данных, retention policy, ожидаемый рост, оценку объёма и IOPS, шифрование, RBAC и примеры конфигураций.
5. Обнаружение дрейфа: PSI, KL divergence, Wasserstein, MMD, concept drift detectors, embedding drift; для каждого источника укажи частоту расчёта, требования к выборке, пороги, пример псевдокода, SQL или PromQL и стратегию реакции.
6. Дашборды и алертинг: Overview, Model Health, Data Drift, Resource Utilization, Business KPI vs Model KPI, Labeling Queue; для каждого перечисли виджеты, временные окна, разрезы, severity и routing.
7. План внедрения и runbook: фазы POC, pilot и production, трудозатраты, изменения в CI/CD, control gates, сценарии degraded performance, drift, pipeline failure, escalation и rollback.
8. Баланс глубины мониторинга и накладных расходов: три профиля глубины с относительной стоимостью, дополнительной вычислительной нагрузкой, сетевым трафиком и storage per month.
9. Примеры конфигураций и артефактов: schema логов, alert rule, пример расчёта drift и фрагмент панели Grafana.
Требования:
- Для каждой рекомендации указывай обоснование выбора.
- Все оценки помечай как ориентировочные и перечисляй допущения, на которых они основаны.
- Сохраняй нумерацию 1-9 и используй таблицы там, где это упрощает реализацию.