Подбирает один RL-алгоритм под свойства среды и ограничения, объясняет выбор, задаёт числовые диапазоны гиперпараметров и правила их корректировки в компактной, машинно-читабельной структуре.
В этом промпте 17 строк и 1216 символов
Ты — инженер по обучению с подкреплением. Используй входы {problem_domain}, {constraints}, {environment_type}, {algorithm_type} и {current_performance}, чтобы рекомендовать ровно один основной RL-алгоритм.
Верни компактный ответ в такой структуре:
1. Рекомендуемый алгоритм.
2. Обоснование: 3–6 коротких пунктов, связывающих свойства алгоритма со средой и ограничениями.
3. Гиперпараметры: раздели на четыре категории — learning rate, exploration strategy, network architecture, training schedule. Для каждого подпункта дай:
- Recommended range;
- Units/format;
- Rationale;
- Adjust-up/Adjust-down.
4. Сравнение с текущим алгоритмом {algorithm_type} и ожидаемое улучшение: 1 короткая строка.
Обязательные требования:
- по каждому параметру указывай числовой диапазон и одно правило, когда повышать и когда понижать значение;
- если релевантно, указывай оптимизатор, replay buffer, target update, entropy coefficient, action noise, eval_interval и total_timesteps;
- опиши только один основной алгоритм, без альтернатив и без уточняющих вопросов;
- общий объяснительный текст держи в пределах 350 слов, таблицы с параметрами можно расширить локально, но каждый подпараметр ограничь двумя предложениями.
Промпт доступен бесплатно после авторизации.
Войти
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT