Стратегия оптимизации памяти для развертывания модели на устройстве
Промпт выдаёт пошаговый план снижения памяти на устройстве: шардинг, чекпоинтинг, смешанную точность, квантизацию, настройки рантайма, измерение пикового потребления и сценарии отката.
Разработай комплексную стратегию оптимизации использования памяти для развёртывания модели {model_type} в среде {deployment_env} при жёстком лимите {memory_limit} и с учётом {framework}.
Отвечай только на русском языке и строго по разделам 1-8. Включай готовые к копированию команды и фрагменты кода.
1. Краткое резюме стратегии и порядка применения оптимизаций.
2. Приоритетный план действий: цель, конкретные команды or параметры, ожидаемый эффект на память, сложность внедрения и побочные эффекты.
3. Реализация по техникам:
- model sharding;
- gradient checkpointing, если релевантно обучению или дообучению на edge;
- mixed precision;
- post-training quantization и QAT;
- graph and runtime optimizations;
- framework-level memory management;
- альтернативы вроде уменьшения batch size, streaming inference, mmap или offloading.
4. Framework-specific инструкции для {framework}, включая специализированные инструменты и их пошаговое применение.
5. План валидации и измерения памяти: команды, метрики, сценарии baseline vs optimized, критерии укладывания в {memory_limit} и продакшн-мониторинг.
6. Скрипты и чек-листы: минимальные shell или Python-примеры, CI/CD-проверка memory budget и milestones внедрения.
7. Риски и план отката.
8. Короткая сводка с low-hanging fruits.
Требования:
- Для каждой техники указывай, когда её стоит применять, а когда нет.
- Все числовые эффекты помечай как ориентировочные диапазоны, если точных данных нет.
- Не задавай вопросы пользователю.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT