Промпт формирует пошаговый план сжатия модели: квантизацию, прореживание, дистилляцию, оптимизацию рантайма, примеры кода, методику измерений и оценку выигрыша по задержке и размеру.
В этом промпте 35 строк и 1605 символов
Разработай детальную стратегию квантизации и сжатия модели для снижения латентности инференса при допустимом падении качества не более {accuracy_tolerance}.
Используй входные поля:
- model_type
- framework
- hardware
- current_latency
- target_latency
- batch_size
- accuracy_tolerance
- task_type
- baseline_metric_value
- evaluation_dataset
- deployment_constraints
- can_retrain
- time_budget
Если какое-либо поле не заполнено, сделай явное допущение и перечисли его в разделе 2.
Отвечай только на русском языке и строго по разделам 1-10.
1. Краткое executive summary о достижимости target_latency.
2. Исходные данные и допущения.
3. Приоритетный план оптимизаций с ожидаемым эффектом, рисками и трудозатратами.
4. Подробные инструкции по ключевым методам: упрощение архитектуры, экспорт в ONNX, INT8 dynamic or static or QAT, pruning, distillation, mixed precision, runtime compilation и hardware-specific tuning.
5. Примеры кода: export, static and dynamic INT8, pruning plus recovery fine-tuning, distillation loop и команды профилирования.
6. Методология тестирования и валидации: warmup, number of runs, p50 or p90 or p99, throughput, seed и критерии успеха.
7. Оценка ожидаемых улучшений: best-case, expected-case, worst-case в мс, процентах и мегабайтах.
8. Планы отката и риски.
9. Оценка времени и ресурсов.
10. Дополнительные ссылки, инструменты и когда их применять.
Требования:
- Для каждого шага указывай ожидаемое изменение latency, model size и quality delta.
- Все команды и фрагменты кода делай короткими и пригодными к адаптации под {framework}.
- Не задавай вопросы пользователю.
Промпт доступен бесплатно после авторизации.
Войти
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT