Используй только переданные placeholders и значения в фигурных скобках. Если данных не хватает, явно помечай допущения вместо выдуманных значений.
Вы — специалист по данным, анализирующий результаты {number_of_experiments} экспериментов по задаче "{problem_type}" с различными значениями {hyperparameter_category}. Вам на вход даются данные по каждому эксперименту; минимальный требуемый набор полей для каждого эксперимента:
- experiment_id (строка/число)
- hyperparameters (краткое перечисление значимых гиперпараметров)
- primary_metric_mean (число) — среднее значение основной метрики по нескольким запускам
- primary_metric_std или primary_metric_CI (число или интервал) — стандартное отклонение или доверительный интервал
- secondary_metric_mean (число)
- secondary_metric_std или secondary_metric_CI (число или интервал)
- training_time_sec (число) — общее время обучения
- compute_cost (число, условная денежная/энергетическая метрика или GPU-hours)
- model_size_params (число) — количество параметров или размер модели
- reproducibility_info (число запусков, random seeds)
- опционально: per-run raw results (для бутстрэп/тестов)
Задача: создать самоокупаемую, пошаговую, воспроизводимую схему сравнения моделей, которая:
a) оценивает и ранжирует модели по {primary_metric}, {secondary_metric} и эффективности обучения;
b) генерирует шаблон матрицы принятия решений в машинно-читаемом виде (CSV/TSV заголовок + описание колонок);
c) даёт чёткие критерии выбора итоговой модели в случае близких/статистически сопоставимых результатов.
Требования к схеме (чётко, шаг за шагом):
1. Предобработка входных данных:
- Проверка на полноту полей; приведение единиц измерения (время в секундах, стоимость в одном формате).
- Если доступны per-run данные — рассчитать mean, std, 95% CI (бутстрэп или t-распределение в зависимости от n).
2. Нормализация метрик для объединения:
- Предложить и обосновать один метод нормализации (min-max или z-score). Привести формулы.
- Для каждой метрики дать направление (чем больше лучше / меньше лучше) и при необходимости инвертировать.
3. Определение показателя эффективности обучения:
- Предложить вычисление efficiency_score как комбинации: (нормализованная обратная training_time) и (нормализованная обратная compute_cost), возможно с учётом model_size_params.
- Привести формулу расчёта efficiency_score и способ нормировки компонентов.
4. Комбинированный скор:
- Предложить формулу combined_score = w1 * primary_norm + w2 * secondary_norm + w3 * efficiency_score.
- Указать дефолтные веса w1,w2,w3 (напр., w1=0.6, w2=0.2, w3=0.2) и способ их изменения пользователем.
5. Статистическая проверка различий:
- Рекомендовать тесты для сравнения топ-N моделей по primary_metric (paired t-test если n достаточен и данные нормальны; Wilcoxon signed-rank при ненормальности; бутстрэп доверительные интервалы).
- Указать порог значимости (по умолчанию p < 0.05) и рекомендации по корректировке множественных сравнений (Bonferroni или Benjamini-Hochberg).
6. Правила ранжирования и фильтрации:
- Чётко описать порядок принятия решения: сначала по значимости и величине разницы в primary_metric, затем secondary_metric, затем efficiency, затем устойчивость (std/CIs), затем простота (меньше params) и reproducibility.
7. Критерии "близких результатов" (точное определение):
- Дать минимум два формальных правила, например: A и B считаются близкими, если |mean_A - mean_B| < delta_abs (задан по умолчанию, напр. 1–2% абсолютной метрики) И/ИЛИ 95% CI пересекаются.
- Описать процедуру при близких результатах (см. ниже).
8. Процедура при близких/неоднозначных результатах:
- Выполнить статтесты на значимость. Если разница не значима — выбирать модель по следующей приоритетной шкале: стабильность (меньшая std/CV) → эффективность обучения (ниже время/стоимость) → простота/меньше params → воспроизводимость (больше-seeds) → предпочтение модели с лучшей secondary_metric, если важно.
- Если всё ещё сопоставимо — рекомендовать дополнительные действия: больше запусков/seedов, проверка на отложенной валидации, ансамблирование лучших моделей.
9. Отчёт и визуализации:
- Перечислить обязательные графики/таблицы: коробчатые диаграммы per-run primary_metric для топ-K, scatter primary vs efficiency, bar of combined_score, CI-ленты.
- Сформатировать итоговый вывод с указанием выбранной модели и мотивировки по пунктам.
Требования к формату вывода (в точности):
- Выдать четыре секции в тексте (в этом порядке):
1) "Схема сравнения" — пошаговые инструкции и формулы;
2) "Шаблон матрицы принятия решений (CSV заголовок + описание колонок)" — одна строка CSV-заголовка и последующие строки кратких описаний колонок;
3) "Критерии выбора при близких результатах" — чёткие правила и порядок приоритета;
4) "Дополнительные рекомендации (тесты, визуализации, параметры по умолчанию)" — список рекомендуемых тестов, значений по умолчанию (веса, delta_abs, p-value), и короткие рекомендации по интерпретации.
- CSV-заголовок должен включать минимально следующие колонки (в таком или расширенном виде): experiment_id,hyperparameters,primary_metric_mean,primary_metric_CI,primary_metric_std,secondary_metric_mean,secondary_metric_CI,secondary_metric_std,training_time_sec,compute_cost,model_size_params,reproducibility_runs,primary_norm,secondary_norm,efficiency_score,combined_score,rank,notes
- Формулы и шаги должны быть выражены в виде точных вычислений (без двусмысленностей), пригодных для автоматизации.
- Указать все используемые по умолчанию параметры (w1,w2,w3,delta_abs,p_threshold) и способ их изменения пользователем.
Не добавляйте примеры данных и не выполняйте расчёты — только схема, шаблон и критерии, готовые для применения к набору данных.