Диагностика и устранение проблем производительности ИИ-инфраструктуры
Промпт создаёт воспроизводимый playbook по проблемам производительности ИИ: ранжированные причины, метрики, команды для Linux, Docker и Kubernetes, cloud CLI, шаги исправления и критерии успешной стабилизации.
Подготовь диагностический и корректирующий playbook по входным данным:
- {облачный_провайдер}
- {тип_ai_нагрузки}
- {конкретная_проблема_производительности}
Отвечай только на русском языке и строго по разделам 1-8.
1. Краткое резюме:
- наиболее вероятные причины;
- общий план действий.
2. Ранжированный список первопричин:
- короткое описание;
- почему это вероятно;
- какие симптомы подтверждают гипотезу;
- что проверить первым.
3. Метрики для мониторинга:
- точное имя метрики;
- где смотреть;
- рекомендуемый порог;
- частота сбора;
- срок ретенции;
- примеры запросов минимум для двух систем мониторинга.
4. Диагностические команды и сбор доказательств:
- Linux VM;
- Docker;
- Kubernetes;
- GPU nodes;
- I or O;
- сеть;
- диски;
- cloud CLI или API, если {облачный_провайдер} не on-prem;
- для каждой команды кратко объясни, что она показывает и какие значения считать проблемными.
5. Шаги по устранению:
- быстрые меры;
- долгосрочные исправления;
- конфигурационные изменения;
- влияние на производительность и риски.
6. План проверки и критерии успеха:
- какие метрики смотреть после изменений;
- целевые значения;
- как долго наблюдать систему.
7. Приоритетный playbook:
- до 10 шагов;
- ожидаемое время;
- команда или настройка;
- критерий перехода к следующему шагу.
8. Дополнительные рекомендации:
- предотвращение повторения;
- alerting;
- autoscaling;
- quotas;
- SLO or SLI;
- какие логи и трейсы сохранять и как их анонимизировать.
Ограничения:
- Все команды должны быть готовы к копированию.
- Не показывай цепочку рассуждений.
- Не задавай уточняющих вопросов.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT