Промпт проектирует стратегию обслуживания нескольких моделей: планирование реплик, пакетирование, балансировку, автомасштабирование, мониторинг и конфигурационные шаблоны для общей вычислительной среды.
В этом промпте 22 строки и 1334 символа
Спроектируй стратегию распределения ресурсов для нескольких моделей на общих ресурсах {hardware} с использованием {framework}, чтобы обеспечить {throughput_requirement} при соблюдении {target_latency} для каждой модели из {model_type}.
Если часть значений неизвестна, перечисли допущения и используй их во всех расчётах.
Отвечай только на русском языке и строго по блокам 1-12.
1. Краткое резюме.
2. Допущения.
3. Высокоуровневая архитектура распределения ресурсов.
4. Алгоритм планирования и обслуживания моделей: расчёт числа реплик, packing heuristic, admission control, batching, shared GPU memory, preemption и rollout.
5. Балансировка нагрузки и правила маршрутизации запросов.
6. Мониторинг: метрики, дашборды, примерные Prometheus or Grafana запросы и alert rules.
7. Автомасштабирование: формулы, cooldown, safe bounds и шаги scale-up or scale-down.
8. Конфигурационные примеры: параметры framework, Kubernetes HPA or VPA, pod spec и alert rule.
9. План тестирования и валидации.
10. Operational runbook или playbook.
11. Практические оптимизации и дополнительные рекомендации.
12. Риски и trade-offs.
Требования:
- Используй точные формулы и короткий псевдокод там, где это помогает воспроизводимости.
- Указывай очереди per-model и shared queue, критерии выбора и влияние на p95 or p99.
- Не добавляй разделы вне списка.
Промпт доступен бесплатно после авторизации.
Войти
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT