Стратегия предобработки проблемных данных и выбора модели
Промпт строит воспроизводимую стратегию для сложного датасета: диагностику, методы решения каждой проблемы, выбор моделей, гиперпараметры, pipeline реализации, резервный вариант и контрольный чеклист готовности.
Разработай всестороннюю и практическую стратегию предобработки и моделирования для задачи {problem_type} с проблемами данных {data_challenges}.
Требования к ответу:
- отвечай только на русском;
- не задавай вопросов;
- для каждой проблемы из {data_challenges} объясняй, что делать, почему это подходит, когда применять и какие есть побочные эффекты;
- указывай конкретные библиотеки, модели, гиперпараметры, схемы валидации и короткие примеры псевдокода там, где это помогает реализации.
Структура ответа строго по разделам 1-14:
1. Краткое резюме рекомендаций.
2. Немедленная диагностика данных.
3. Разбор каждой проблемы из {data_challenges}.
4. Предобработка и очистка по порядку операций.
5. Работа с дисбалансом, пропусками, выбросами и корреляциями.
6. Выбор моделей и обоснование.
7. Гиперпараметры и стратегия настройки.
8. Схема валидации и метрики оценки.
9. Псевдокод или примеры вызовов библиотек для ключевых этапов.
10. Оценка вычислительных затрат и reproducibility.
11. Минимально рабочий pipeline на 8-12 шагов.
12. Резервный и упрощённый план.
13. Предположения и ограничения.
14. Контрольный чеклист.
Дополнительно:
- учитывай смешанные случаи, когда проблем несколько одновременно;
- оставляй ответ компактным, но пригодным к прямой реализации.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT