Ты — старший ML-инженер и продуктовый архитектор.
Составь исчерпывающий и воспроизводимый план разработки чат-бота на базе ChatGPT, который выдаёт вероятностные прогнозы исходов игры Aviator и объясняет неопределённость. Никаких обещаний выигрыша и никакого обхода правил быть не должно.
## Обязательные принципы
- Всегда подчёркивай, что прогнозы не гарантируют выигрыш.
- Представляй вывод только как вероятности и диапазоны неопределённости.
- Включай меры снижения вреда, предотвращения азартной зависимости и финансовых рисков.
- Не давай инструкций по мошенничеству, взлому, обходу правил или гарантированному обогащению.
- Учитывай законность сбора данных и соответствие условиям платформы.
## Формат ответа
- Пиши только на русском языке.
- Используй разделы и нумерацию строго в указанном порядке.
- Для временных оценок покажи фазы, длительность в неделях и роли.
- Для API приведи пример JSON-ответа.
- Примеры кода давай как псевдокод или короткие сниппеты не длиннее 40 строк.
- Ориентир по объёму: 1000-2000 слов, но приоритет — полнота.
## Обязательная структура
1. Краткий обзор и цель проекта.
2. Обзор игры Aviator.
3. Оценка реализуемости прогнозирования.
4. Стратегия данных.
5. Анализ данных и инженерия признаков.
6. Подходы к моделированию.
7. Интеграция с ChatGPT и логика чат-бота.
8. Инфраструктура и внедрение.
9. Оценка и мониторинг в продакшене.
10. Правовые и этические соображения.
11. Риски проекта и план их снижения.
12. План внедрения и временная оценка.
13. Ожидаемые артефакты и deliverables.
14. Приложения.
## Что должно быть внутри разделов
### 3. Оценка реализуемости
- статистические тесты на случайность;
- критерии пригодности данных;
- signal-to-noise;
- ограничения интерпретации результатов.
### 4. Данные
- какие данные нужны;
- легальные способы сбора: логирование, API, scraping только при соблюдении правил;
- схема и хранение;
- очистка, дедупликация, синхронизация времени, пропуски, аномалии;
- синтетические данные и их валидация.
### 5. EDA и признаки
- графики и статистики;
- лаги, скорости изменения, агрегаты, оконные признаки, признаки сессии;
- автокорреляция, сезонность, структурные разрывы.
### 6. Модели
- базовые модели;
- последовательные модели;
- вероятностные и байесовские подходы;
- метрики: AUC, log loss, Brier score, calibration, precision, recall;
- временная валидация, walk-forward, backtesting;
- гиперпараметры и регуляризация;
- объяснимость через SHAP, LIME или правила.
### 7. Интеграция с ChatGPT
- роли ChatGPT;
- архитектура: пользователь → модель прогнозирования → агрегатор или калибратор → ChatGPT;
- примеры шаблонов ответов с вероятностями, ошибками и рекомендациями по управлению риском;
- UX: согласие пользователя, показ неопределённости, персонализация уведомлений.
### 8. Инфраструктура
- рекомендуемый стек;
- деплой;
- CI/CD;
- версии моделей;
- latency, масштабируемость, откат;
- логи и аудит.
### 9. Мониторинг
- drift;
- degradation;
- calibration;
- latency;
- throughput;
- retraining;
- A/B-тесты;
- controlled rollout;
- rollback plan.
### 10. Этика и право
- соответствие законодательству;
- правила платформы и API;
- приватность;
- минимизация данных;
- анонимизация;
- срок хранения;
- предупреждения;
- лимиты;
- маршрутизация на помощь при признаках зависимости;
- отказ от агрессивного языка;
- прозрачность и журнал решений.
### 12. План внедрения
- минимум 3 фазы: MVP, масштабирование, продуктовый релиз;
- задачи по фазам;
- роли: PM, ML engineer, data engineer, backend, frontend, QA, юрист по комплаенсу;
- сроки в неделях;
- оценка человеко-недель.
### 14. Приложения
- пример API-спецификации;
- псевдокод запросов к модели и ChatGPT;
- пример отчёта о валидации;
- короткий пример диалога бота.
## Ограничения
- Не используй приватные данные без явного согласия.
- Не обещай стопроцентную точность.
- Не упускай меры снижения вреда и комплаенс.
- Не добавляй советы, которые подталкивают к рискованному поведению.