Руководство по прогностической модели найма в четырех блоках
Промпт создаёт техническое руководство по прогностической модели найма: с блоками по сбору данных, инженерии признаков, выбору модели и валидации, примерами, рисками и чек-листами.
Подготовьте один технически насыщенный ответ на русском языке. Структура должна содержать ровно четыре пронумерованных раздела и никаких дополнительных разделов. Ты — эксперт по ИИ для подбора талантов и построения прогностических моделей найма. Нужен документ для продвинутой аудитории: специалистов по данным, ML-инженеров и аналитиков по талантам. Для каждого из четырёх разделов обязательно используй одинаковые подпункты: - обзор; - рекомендуемые действия; - конкретные примеры; - подводные камни; - чек-лист. Разделы: 1. Сбор данных. 2. Инженерия признаков. 3. Выбор модели. 4. Валидация. Что обязательно раскрыть: 1. В разделе про сбор данных: - нужные типы данных и источники; - минимальную схему полей; - формулировку целевой переменной; - временные метки и защиту от утечек; - примеры SQL или pandas для извлечения и очистки; - обработку пропусков, дубликатов и несогласованных форматов; - анонимизацию, логи и lineage; - метрики качества данных. 2. В разделе про инженерию признаков: - принципы временной согласованности, устойчивости и защиты от дрейфа; - рецепты признаков из демографии, образования, опыта, навыков, оценок, поведения и текста; - биннинг, логарифмирование, scaling, target encoding с предупреждением про утечки; - time-based признаки и признаки для удержания; - пример pipeline; - методы отбора признаков; - этические риски демографических признаков. 3. В разделе про выбор модели: - критерии выбора между интерпретируемостью, сложностью и качеством; - логистическую регрессию, деревья, бустинги, нейросети, трансформеры и survival-модели; - когда применять ансамбли и когда лучше простая модель; - рекомендации по гиперпараметрам; - интерпретируемость через коэффициенты, PDP, SHAP, LIME и контрфакты; - стратегии работы с редкими исходами и несбалансированными классами. 4. В разделе про валидацию: - time-based split, stratified k-fold, nested CV, holdout и проверки вне выборки; - метрики: AUC-ROC, PR AUC, precision, recall, F1, precision@k, log-loss, calibration, lift, survival-метрики и бизнес-KPI; - регуляризацию, раннюю остановку, калибровку и борьбу с переобучением; - мониторинг надёжности, дрейфа и периодическое переобучение; - полноценный validation-план и критерии допуска в продакшен; - статистическую проверку улучшений между моделями. Требования к примерам: - в каждом разделе добавь минимум один конкретный пример кода, SQL, pandas-фрагмента или формулы; - примеры должны быть короткими, воспроизводимыми и уместными; - объясняй, какие пороги и метрики можно считать приемлемыми в типичном проекте. Ограничения: - объём — примерно 700–1500 слов; - тон — технический и прикладной; - не добавляй ничего вне четырёх обязательных блоков.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT