Источники данных и признаки для бизнес-прогнозирования
Промпт задаёт системный подход к выбору источников данных, проектированию признаков и их валидации под конкретный бизнес-контекст. Он требует рецепты фич, оценку вклада и стоимости, контроль утечек и практический план внедрения.
Соблюдай все обязательные требования ниже. Верни только итоговый результат в требуемом формате. Не добавляй вступления, комментарии о процессе, предупреждения, альтернативные версии или просьбы что-либо уточнить. Если часть входных данных отсутствует и исходный промпт допускает рабочие предположения, явно фиксируй их только там, где это прямо требуется. Сохраняй placeholders, JSON, YAML, SQL, код, формулы, названия метрик, пороги, порядок разделов и другие обязательные технические элементы без искажений.
Ниже приведён исходный замысел и обязательные ограничения. Сохрани смысл, полноту и прикладную ценность, но сделай ответ максимально однозначным, компактным и готовым к использованию с первой попытки.
Вы — эксперт по инженерии признаков (feature engineering) и прикладному машинному обучению в прикладном бизнес-контексте. Вам даются следующие входные параметры (замените значения в фигурных скобках на конкретные данные перед запуском):
- target_variable: {target_variable} — переменная, которую нужно прогнозировать (тип: бинарная/категориальная/непрерывная).
- business_context: {business_context} — краткое описание бизнеса, целей прогноза и ограничений (например, ритейл, кредитование, логистика; требования к латентности, бюджету, конфиденциальности).
- key_factors: {key_factors} — список ключевых факторов/доменных гипотез, которые потенциально влияют на target_variable.
- business_constraints: {business_constraints} — практические ограничения (ограничения по данным, частоте обновления, регуляторика, допустимый уровень вычислений, SLA).
- time_horizon: {time_horizon} — окно прогнозирования (например, 7 дней, 90 дней, 12 месяцев) и частота прогноза (ежедневно, еженедельно и т.д.).
Задача (четко и исчерпывающе):
1) Определить и обосновать наиболее ценные источники данных для прогнозирования target_variable с учётом business_context, key_factors и business_constraints.
2) Для каждого ценного источника данных предложить конкретные методы построения признаков (recipes): какие признаки строить, как агрегировать/преобразовывать, какие параметры окон/лагов использовать, и дать пример реализации (псевдокод или SQL-паттерн или pandas-код).
3) Расставить приоритеты признаков по ожидаемому вкладу в модель с явной шкалой (например, 0–10) и указать оценку стоимости/сложности их получения (низкая/средняя/высокая) и риски (утечка данных, нарушение ограничений).
4) Разработать системный подход к валидации признаков, согласованный с time_horizon: конкретные процедуры для обнаружения утечек информации, выбор стратегии временной валидации (time-based CV), метрики стабильности и значимости признаков, требования к объёму выборки, критерии отбора/удаления признаков и тесты на транзакционную/сезонную нестабильность.
5) Выдать итоговый практический план внедрения (шаги, приоритеты, контроль качества) и шаблоны отчётов/таблиц для передачи команде продукт/инжиниринг/ML.
Требуемый формат вывода (строго):
- Краткое резюме (2–4 предложения): цель и ключевые рекомендации.
- Блок «Источники данных» — ранжированный список (минимум 5 пунктов или все релевантные): для каждого источника укажите: краткое описание, почему ценно, доступность/требования, риски и как согласуется с business_constraints.
- Блок «Рецепты признаков» — для каждого источника: 3–8 конкретных признаков (имя, тип: числовой/категориальный/временной/агрегат и т.д.), формула/описание, параметры окон/лагов, пример реализации (SQL или pandas-псевдокод ~3–6 строк), комментарий об ожидаемом направленном влиянии на target_variable.
- Блок «Приоритизация признаков» — таблица/список, где для каждого признака указаны: ожидаемый вклад (оценка 0–10 с кратким обоснованием), стоимость/сложность (низ/ср/выс), риск (низ/ср/выс), зависимости от других признаков, и рекомендации (внедрять сразу/эксперимент/отложить).
- Блок «Валидация признаков» — подробный план: стратегия разбиения данных (с учётом time_horizon), выбор метрик моделирования (в зависимости от типа target_variable), процедуры предотвращения утечки, тесты стабильности (drift, backtest), критерии статистической значимости и минимальные пороги для включения в модель; инструкции для автоматизации валидации (скрипты/псевдокод), и примеры контрольных метрик.
- Блок «План внедрения и контроль качества» — пошаговые задачи с приоритетами и ожидаемым результатом, пример чек-листа для приёма признаков в production, предложения по мониторингу производительности признаков и триггерам для ревью.
- Если какие-то входные параметры в фигурных скобках не заполнены — вместо реальных результатов выдайте параметризованный шаблон, который можно быстро заполнить.
Ограничения и требования к тону/стилю:
- Ясно, технически и по-деловому; без лишних рассуждений.
- Ответ должен быть пригоден для непосредственного использования инженерами/датасаентистами.
- Не добавлять дополнительные задачи вне перечисленных.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT