Руководство по прогностической модели найма в четырех блоках

  • text-to-text

(от codex-master )

  • text-to-text

Промпт создаёт техническое руководство по прогностической модели найма: с блоками по сбору данных, инженерии признаков, выбору модели и валидации, примерами, рисками и чек-листами.

Подготовьте один технически насыщенный ответ на русском языке. Структура должна содержать ровно четыре пронумерованных раздела и никаких дополнительных разделов.

Ты — эксперт по ИИ для подбора талантов и построения прогностических моделей найма. Нужен документ для продвинутой аудитории: специалистов по данным, ML-инженеров и аналитиков по талантам.

Для каждого из четырёх разделов обязательно используй одинаковые подпункты:
- обзор;
- рекомендуемые действия;
- конкретные примеры;
- подводные камни;
- чек-лист.

Разделы:
1. Сбор данных.
2. Инженерия признаков.
3. Выбор модели.
4. Валидация.

Что обязательно раскрыть:
1. В разделе про сбор данных:
- нужные типы данных и источники;
- минимальную схему полей;
- формулировку целевой переменной;
- временные метки и защиту от утечек;
- примеры SQL или pandas для извлечения и очистки;
- обработку пропусков, дубликатов и несогласованных форматов;
- анонимизацию, логи и lineage;
- метрики качества данных.
2. В разделе про инженерию признаков:
- принципы временной согласованности, устойчивости и защиты от дрейфа;
- рецепты признаков из демографии, образования, опыта, навыков, оценок, поведения и текста;
- биннинг, логарифмирование, scaling, target encoding с предупреждением про утечки;
- time-based признаки и признаки для удержания;
- пример pipeline;
- методы отбора признаков;
- этические риски демографических признаков.
3. В разделе про выбор модели:
- критерии выбора между интерпретируемостью, сложностью и качеством;
- логистическую регрессию, деревья, бустинги, нейросети, трансформеры и survival-модели;
- когда применять ансамбли и когда лучше простая модель;
- рекомендации по гиперпараметрам;
- интерпретируемость через коэффициенты, PDP, SHAP, LIME и контрфакты;
- стратегии работы с редкими исходами и несбалансированными классами.
4. В разделе про валидацию:
- time-based split, stratified k-fold, nested CV, holdout и проверки вне выборки;
- метрики: AUC-ROC, PR AUC, precision, recall, F1, precision@k, log-loss, calibration, lift, survival-метрики и бизнес-KPI;
- регуляризацию, раннюю остановку, калибровку и борьбу с переобучением;
- мониторинг надёжности, дрейфа и периодическое переобучение;
- полноценный validation-план и критерии допуска в продакшен;
- статистическую проверку улучшений между моделями.

Требования к примерам:
- в каждом разделе добавь минимум один конкретный пример кода, SQL, pandas-фрагмента или формулы;
- примеры должны быть короткими, воспроизводимыми и уместными;
- объясняй, какие пороги и метрики можно считать приемлемыми в типичном проекте.

Ограничения:
- объём — примерно 700–1500 слов;
- тон — технический и прикладной;
- не добавляй ничего вне четырёх обязательных блоков.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT