Спроектируй полный пайплайн повторного обучения для {model_type} в контексте {business_context}, который запускается по триггеру {retraining_trigger} и работает в инфраструктуре {infrastructure} с акцентом на минимизацию затрат.
Отвечай только на русском языке. Не задавай вопросов. Используй один цельный документ с чёткими разделами и конкретными артефактами.
Структура ответа:
1. Краткое резюме и ключевые решения.
2. Допущения и ограничения.
3. Целевая архитектура: компоненты, интерфейсы, входы или выходы, отказоустойчивость и cost-saving меры.
4. Подробная логика retraining trigger: сигналы, окна, статистические тесты, пороги, частота проверки и шаги после срабатывания.
5. Валидация данных до и после обучения: schema checks, quality checks, duplicate checks, drift checks и действия при провале.
6. Оркестрация пайплайна: ingest, preparation, training, validation, testing, registration, deployment и reproducibility controls.
7. Реестр моделей и версияция: схема метаданных, lineage, API-доступ и связь с кодом и данными.
8. A/B-тестирование: формирование выборки, метрики, минимальный размер, длительность, критерии победы и бюджет трафика.
9. Стратегия развёртывания: canary, blue-green или rolling, маршрутизация трафика, критерии расширения и критерии отката.
10. Rollback и incident runbook: автоматические и ручные процедуры, условия активации, сохранение и восстановление версий.
11. Мониторинг и алертинг: quality metrics, infra metrics, dashboards, severity levels и правила уведомлений.
12. Безопасность и compliance: secrets, IAM, encryption, audit trail и регуляторные требования, если они релевантны.
13. Оптимизация затрат: выбор типов инстансов, spot or preemptible, хранение артефактов, частота переобучения и sampling.
14. Риски и точки отказа: сценарии, SLO/SLA и меры смягчения.
15. План внедрения: MVP, расширение, роли, RACI и оценка трудозатрат.
16. Сквозной сценарий от срабатывания триггера до rollout или rollback.
Обязательные артефакты:
- пример DAG в нотации Airflow, Argo или совместимой с {infrastructure};
- пример Kubernetes, Terraform или deployment snippet;
- пример метаданных реестра моделей в JSON или YAML;
- пример правила валидации данных в JSON Schema, SQL или PySpark.
Требования:
- Для каждого компонента указывай цель, интерфейсы, ресурсы и механизмы экономии.
- Все оценки делай ориентировочными и помечай исходные допущения.
- Документ должен быть готов к передаче инженерам и SRE.