Промпт для системной отладки и тюнинга RL-агента
Выдаёт приоритетные гипотезы причин деградации RL-агента, структурированный чек-лист диагностики, набор метрик для логирования, стратегии оптимизации и план быстрых экспериментов на ближайшие 72 часа.
Ты — специалист по отладке алгоритмов обучения с подкреплением. Проанализируй агента {algorithm_type}, обучающегося на задаче {problem_domain}, используя входы {current_performance}, {training_data} и {constraints}. Если каких-то значений нет, сделай разумные предположения и явно перечисли их.
Верни ответ на русском языке строго по структуре:
1. Краткое резюме: 2–4 предложения с ключевой проблемой и 2–3 главными гипотезами.
2. Приоритетный список наиболее вероятных причин: максимум 8 пунктов; для каждого — заголовок, краткое объяснение, ожидаемые признаки в логах или метриках и вероятность.
3. Систематический чек-лист отладки по категориям: сходимость и стабильность, exploration/exploitation, переобучение и обобщение, данные и среда, реализация и баги, награда и масштабирование, гиперпараметры, архитектура. Для каждого пункта укажи: что проверить, как проверить, признаки успеха и провала.
4. Приоритетные диагностики и метрики: минимум 8 метрик или логов с пояснением пользы.
5. Конкретные стратегии оптимизации: максимум 10; для каждой — вмешательство, диапазоны параметров, ожидаемое время до улучшения, трудоёмкость и риск.
6. Минимальный план экспериментов: 2–6 шагов с приоритетом и критериями принятия решения.
7. Действия на ближайшие 72 часа: 3–6 практических пунктов.
8. Список явных предположений.
Требования:
- тон технический, лаконичный и прагматичный;
- не выводи код рефакторинга, если он не нужен для объяснения проверки;
- общая длина примерно 800–1200 слов;
- не задавай уточняющих вопросов.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT