План автоматизированного пайплайна данных из нескольких источников

  • text-to-text

(от codex-master )

  • text-to-text

Промпт помогает собрать воспроизводимый план пайплайна данных для нескольких источников, включая трансформации, безопасность, диаграмму потока, расписание, выходные слои и проверку одного критичного допущения.

Ты — архитектор данных. Подготовь один законченный технический план автоматизированного пайплайна данных для специалистов по данным компании [НАЗВАНИЕ_КОМПАНИИ].

Используй входные данные:
- [НАЗВАНИЕ_КОМПАНИИ]. Если значение не передано, используй `ExampleCorp`.
- [ИСТОЧНИКИ_ДАННЫХ]: массив объектов с полями `name`, `type`, `owner`, `schema_sample`, `cadence`, `sensitivity`, `connection_method`, `expected_volume`.
- [ОПИСАНИЕ_РАБОЧЕГО_ПРОЦЕССА]: бизнес-логика или назначение набора данных. Если не передано, используй общее назначение: аналитика, ML или отчётность.
- [ИНСТРУМЕНТЫ_В_ИСПОЛЬЗОВАНИИ]: ETL/ELT, оркестратор, хранилище, стриминг, KMS. Если блок пуст, предложи стандартный стек и явно пометь его как допущение.
- [СОБЫТИЯ_ТРИГГЕРЫ]: cron, arrival, webhook, new file, stream watermark. Если блок пуст, предложи разумные значения по умолчанию и укажи их явно.
- [ВЫХОДНЫЕ_НАЗНАЧЕНИЯ]: data warehouse, feature store, BI layer, downstream API. Если блок пуст, используй типовые назначения и пометь это как допущение.

Что нужно сделать:
1. Кратко резюмируй цель решения и основной подход.
2. В разделе «Входные предположения» перечисли фактически использованные значения для всех входных блоков и явно отметь, что было подставлено по умолчанию.
3. Составь таблицу источников данных с полями: `name`, `type`, `owner`, `schema_sample`, `cadence`, `sensitivity`, `connection_method`, `expected_volume`, `constraints`.
4. Для каждого источника опиши правила преобразования:
   - явный mapping `source_field -> canonical_field`;
   - целевые типы данных;
   - нормализацию дат и timezone;
   - единицы измерения, дедупликацию, enrichment, обработку `NULL`;
   - проверки качества, метрики качества и реакции на ошибки;
   - короткий пример SQL, псевдокода или конфигурации.
5. Опиши протоколы безопасности: шифрование in-transit и at-rest, KMS/CMK, секреты, RBAC, сеть, DLP, аудит, ретеншн и соответствие, только если оно вытекает из входных данных и уровней чувствительности.
6. Дай диаграмму потока данных в двух видах:
   - `mermaid` flowchart;
   - краткая ASCII или текстовая схема.
   Для каждого узла опиши назначение, вход, выход, буферизацию, гарантию доставки, retry/DLQ, idempotency и мониторинг.
7. Составь план расписаний и триггеров: `workflow`, `trigger`, `frequency`, `SLA`, `backfill policy`, зависимости и приоритеты. Если есть near-real-time требования, явно обоснуй выбор streaming или micro-batch.
8. Покажи роль каждого инструмента из [ИНСТРУМЕНТЫ_В_ИСПОЛЬЗОВАНИИ] в конкретных шагах пайплайна.
9. Опиши выходные назначения и форматы: схема, partitioning, retention, access pattern.
10. Дай короткий операционный чеклист: deploy steps, IaC ориентиры, мониторинг, alerting, runbook.
11. В финале укажи:
   - одно единственное самое слабое допущение;
   - пошаговый способ его проверки с примерами команд или SQL;
   - один реалистичный сценарий потери, искажения или дублирования данных и конкретные mitigation.

Формат ответа:
1. Краткое техническое резюме
2. Входные предположения
3. Таблица источников данных
4. Правила преобразования для каждого источника
5. Протоколы безопасности
6. Диаграмма потока данных
7. План расписаний и триггеров
8. Инструменты и их роль
9. Выходные назначения и форматы
10. Операционный чеклист
11. Самое слабое допущение, метод проверки и сценарий проблем целостности

Ограничения:
- Дай одну завершённую архитектуру, без альтернативных вариантов.
- Не задавай уточняющих вопросов.
- Не делай скрытых допущений.
- Пиши технически, конкретно и по-русски.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT