Ты — инженер-эксперт по аналитике облачных расходов, данным, ML и DevOps. Подготовь воспроизводимое проектное описание системы, которая обнаруживает аномалии в расходах на облачные ресурсы: неэффективность, неверную конфигурацию и неавторизованное использование. Система должна поддерживать compute, storage, networking и databases, а также мультиоблачные среды.
Если каких-то входных данных не хватает, делай разумные допущения и явно перечисляй их в отдельном блоке assumptions. Не задавай уточняющих вопросов. Не выходи за рамки перечисленных требований.
Обязательный порядок содержания:
1. Краткое резюме: 3–5 предложений о цели системы, режиме работы, мультиоблачности, масштабируемости и безопасности.
2. Описание входных данных: источники, детализация, обязательные поля, нормализация валют и цен, объём истории 6–12 месяцев, таблица schema с типами и примерами.
3. План предобработки и обогащения: очистка, нормализация, пропуски, аномальные точки, агрегации по resource/service/project/account/region, окна hour/day/week/month, правила обработки возвратов и отрицательных записей, метаданные и внешние источники.
4. План фиче-инжиниринга: признаки для обнаружения аномалий, формулы, описания и лаги.
5. Подход к базовой линии: seasonal decomposition, moving windows, percentile baselines, учёт сезонности и тренда, примеры параметров.
6. Методы обнаружения аномалий: статистические, ML и временные ряды. Для каждого метода укажи назначение, рекомендуемые гиперпараметры по умолчанию и критерии выбора. Добавь стратегию ensemble/hybrid и логику голосования.
7. Динамические пороги и адаптация: percentile-based, quantile regression, корректировка порогов, suppression шумных алертов.
8. Оповещения и уведомления: формат алерта, каналы доставки, кастомизация, пример JSON payload.
9. RCA и рекомендации: автоматизированная логика RCA, типовые причины, практические действия, приоритеты, estimated monthly saving и confidence score.
10. Визуализация и отчётность: обязательные дашборды, интерактивность, weekly/monthly reports.
11. Оценка качества и метрики: precision, recall, F1, false positive rate, false negative rate, detection latency, business impact, AUC при наличии меток, plus validation procedures.
12. Непрерывное улучшение и эксплуатация: feedback loop, labeling, retraining cadence, triggers, мониторинг моделей и пайплайнов.
13. Интеграция, безопасность и масштабируемость: API/ETL patterns, recommended endpoints and webhook patterns, RBAC, encryption, PII handling, stream vs batch, queueing, storage, compute, 1–2 подходящие технологии на задачу без привязки к одному вендору.
14. Тестирование и развёртывание: unit, integration, regression, synthetic anomalies, генерация синтетических аномалий, CI/CD для моделей и ETL.
15. План внедрения: MVP + 3 итерации, задачи по этапам, сложность и сроки.
16. Примеры и артефакты: 2–3 сценария с sample input, expected JSON alert, кратким RCA и рекомендацией; плюс один SQL/Pandas query или псевдокод для ключевого признака.
17. Допущения.
Верни строго один JSON-объект в UTF-8 с полями:
summary, data_sources, schema, preprocessing, features, baseline, detection_methods, thresholds, alerting_schema, rca, dashboards_reports, metrics, ops, integration_security, testing_deployment, roadmap, examples, assumptions.
Правила:
- Для текстовых блоков используй строки; для сложных сущностей — вложенные объекты и массивы.
- Формат держи компактным, но информативным.
- Где уместно, указывай конкретные параметры по умолчанию.
- Если предлагаешь технологии и библиотеки, давай 1–2 конкретных примера на задачу.
- Максимальная длина ответа: не более 5000 слов.
- Не добавляй текст вне итогового JSON.