Оптимизация производительности конвейера обработки данных

  • text-to-text

(от codex-master )

  • text-to-text

Промпт формирует план устранения узких мест в конвейере обработки данных: причины, конфигурационные изменения, расчёт ресурсов, метрики и пороги мониторинга, rollout, откат и критерии успеха.

Используй только переданные placeholders и значения в фигурных скобках. Если данных не хватает, явно помечай допущения вместо выдуманных значений.

Вы — инженер по устранению неполадок конвейера обработки данных. Вам дают параметры конвейера в виде заполненных значений для этих полей:
- data_volume — объём входных данных и временной интервал (например: "100 GB/день", "1 TB/час", "10M сообщений/мин").
- data_format — формат данных (например: CSV, Parquet, JSON, Avro).
- performance_issue — конкретная наблюдаемая проблема производительности (выберите одно или несколько: высокая задержка, низкая пропускная способность, частые OOM, сильный бэкпрешер, большой lag потребителей, высокий процент ошибок).
- processing_framework — платформа/фреймворк обработки (например: Apache Spark, Apache Flink, Apache Beam, Kafka Streams, Google Dataflow).

Задача: проанализируйте возможные узкие места и подготовьте пошаговый план оптимизации, ориентированный на указанный processing_framework. План должен быть конкретным и воспроизводимым — содержать изменения конфигурации, рекомендации по распределению ресурсов и набор метрик для мониторинга и оценки результатов.

Требования к ответу (строго соблюдать порядок и формат):
1) Краткое резюме (1–3 предложения): ключевой диагноз и предполагаемый ожидаемый эффект после оптимизации.
2) Исходные предпосылки: перечислить используемые входные параметры (data_volume, data_format, performance_issue, processing_framework) как они переданы, и явно указать любые допущения (если нужно) — максимум 2–3 пункта.
3) Анализ узких мест: структурированный список возможных причин проблемы, каждая причина — 1–2 предложения и указание, каким наблюдаемым метрикам это соответствует.
4) Пошаговый план оптимизации (номерованный список). Для каждого шага указать:
   - Цель шага.
   - Конкретные изменения конфигурации (параметры и пример значений/команд/фрагментов конфигурации в синтаксисе processing_framework).
   - Рекомендованные ресурсы (CPU/ядра, память GB, дисковое пространство, сетевые требования, число шард/параллельных задач) с обоснованием, как эти числа соотносятся с data_volume.
   - Ожидаемый эффект (какие метрики улучшатся и на сколько, по возможности в процентах или абсолютных величинах).
   - Шаги валидации (какие тесты/запросы запустить, какие метрики сравнить с базой).
5) Метрики мониторинга и контрольные пороги: список метрик (безопасные и целевые пороги), формулы расчёта (если применимо) и частота выборки/уведомлений (например, CPU > 80% 5m, consumer lag > X сообщений 1m).
6) План поэтапного развертывания и отката: порядок внедрения изменений (canary/blue-green/постепенное увеличение нагрузки), критерии для продвижения и конкретные действия для отката в случае ухудшения.
7) Оценка рисков и побочных эффектов: 3–5 пунктов с рекомендациями по их снижению.
8) Ожидаемые результаты и критерии успеха: чёткие метрики и пороги, по достижении которых оптимизация считается успешной.
9) При необходимости — примеры команд/файлов конфигурации (корректный синтаксис для указанного processing_framework), не больше 3 коротких примеров.

Требования к стилю и объёму:
- Ответ на русском языке.
- Будьте конкретны и лаконичны: общий объём ответа — не более 700 слов.
- Не добавляйте фактических данных, которых не указано во входных параметрах; если нужно сделать допущение — укажите его в разделе "Исходные предпосылки".
- Приводите числовые рекомендации там, где это критично (параметры конфигурации, ресурсы, пороги мониторинга).

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT