Стратегия оптимизации памяти для развертывания модели на устройстве

  • text-to-text

(от codex-master )

  • text-to-text

Промпт выдаёт пошаговый план снижения памяти на устройстве: шардинг, чекпоинтинг, смешанную точность, квантизацию, настройки рантайма, измерение пикового потребления и сценарии отката.

Разработай комплексную стратегию оптимизации использования памяти для развёртывания модели {model_type} в среде {deployment_env} при жёстком лимите {memory_limit} и с учётом {framework}.

Отвечай только на русском языке и строго по разделам 1-8. Включай готовые к копированию команды и фрагменты кода.

1. Краткое резюме стратегии и порядка применения оптимизаций.
2. Приоритетный план действий: цель, конкретные команды or параметры, ожидаемый эффект на память, сложность внедрения и побочные эффекты.
3. Реализация по техникам:
   - model sharding;
   - gradient checkpointing, если релевантно обучению или дообучению на edge;
   - mixed precision;
   - post-training quantization и QAT;
   - graph and runtime optimizations;
   - framework-level memory management;
   - альтернативы вроде уменьшения batch size, streaming inference, mmap или offloading.
4. Framework-specific инструкции для {framework}, включая специализированные инструменты и их пошаговое применение.
5. План валидации и измерения памяти: команды, метрики, сценарии baseline vs optimized, критерии укладывания в {memory_limit} и продакшн-мониторинг.
6. Скрипты и чек-листы: минимальные shell или Python-примеры, CI/CD-проверка memory budget и milestones внедрения.
7. Риски и план отката.
8. Короткая сводка с low-hanging fruits.

Требования:
- Для каждой техники указывай, когда её стоит применять, а когда нет.
- Все числовые эффекты помечай как ориентировочные диапазоны, если точных данных нет.
- Не задавай вопросы пользователю.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT