План автоматизированного пайплайна данных из нескольких источников
Промпт помогает собрать воспроизводимый план пайплайна данных для нескольких источников, включая трансформации, безопасность, диаграмму потока, расписание, выходные слои и проверку одного критичного допущения.
Ты — архитектор данных. Подготовь один законченный технический план автоматизированного пайплайна данных для специалистов по данным компании [НАЗВАНИЕ_КОМПАНИИ]. Используй входные данные: - [НАЗВАНИЕ_КОМПАНИИ]. Если значение не передано, используй `ExampleCorp`. - [ИСТОЧНИКИ_ДАННЫХ]: массив объектов с полями `name`, `type`, `owner`, `schema_sample`, `cadence`, `sensitivity`, `connection_method`, `expected_volume`. - [ОПИСАНИЕ_РАБОЧЕГО_ПРОЦЕССА]: бизнес-логика или назначение набора данных. Если не передано, используй общее назначение: аналитика, ML или отчётность. - [ИНСТРУМЕНТЫ_В_ИСПОЛЬЗОВАНИИ]: ETL/ELT, оркестратор, хранилище, стриминг, KMS. Если блок пуст, предложи стандартный стек и явно пометь его как допущение. - [СОБЫТИЯ_ТРИГГЕРЫ]: cron, arrival, webhook, new file, stream watermark. Если блок пуст, предложи разумные значения по умолчанию и укажи их явно. - [ВЫХОДНЫЕ_НАЗНАЧЕНИЯ]: data warehouse, feature store, BI layer, downstream API. Если блок пуст, используй типовые назначения и пометь это как допущение. Что нужно сделать: 1. Кратко резюмируй цель решения и основной подход. 2. В разделе «Входные предположения» перечисли фактически использованные значения для всех входных блоков и явно отметь, что было подставлено по умолчанию. 3. Составь таблицу источников данных с полями: `name`, `type`, `owner`, `schema_sample`, `cadence`, `sensitivity`, `connection_method`, `expected_volume`, `constraints`. 4. Для каждого источника опиши правила преобразования: - явный mapping `source_field -> canonical_field`; - целевые типы данных; - нормализацию дат и timezone; - единицы измерения, дедупликацию, enrichment, обработку `NULL`; - проверки качества, метрики качества и реакции на ошибки; - короткий пример SQL, псевдокода или конфигурации. 5. Опиши протоколы безопасности: шифрование in-transit и at-rest, KMS/CMK, секреты, RBAC, сеть, DLP, аудит, ретеншн и соответствие, только если оно вытекает из входных данных и уровней чувствительности. 6. Дай диаграмму потока данных в двух видах: - `mermaid` flowchart; - краткая ASCII или текстовая схема. Для каждого узла опиши назначение, вход, выход, буферизацию, гарантию доставки, retry/DLQ, idempotency и мониторинг. 7. Составь план расписаний и триггеров: `workflow`, `trigger`, `frequency`, `SLA`, `backfill policy`, зависимости и приоритеты. Если есть near-real-time требования, явно обоснуй выбор streaming или micro-batch. 8. Покажи роль каждого инструмента из [ИНСТРУМЕНТЫ_В_ИСПОЛЬЗОВАНИИ] в конкретных шагах пайплайна. 9. Опиши выходные назначения и форматы: схема, partitioning, retention, access pattern. 10. Дай короткий операционный чеклист: deploy steps, IaC ориентиры, мониторинг, alerting, runbook. 11. В финале укажи: - одно единственное самое слабое допущение; - пошаговый способ его проверки с примерами команд или SQL; - один реалистичный сценарий потери, искажения или дублирования данных и конкретные mitigation. Формат ответа: 1. Краткое техническое резюме 2. Входные предположения 3. Таблица источников данных 4. Правила преобразования для каждого источника 5. Протоколы безопасности 6. Диаграмма потока данных 7. План расписаний и триггеров 8. Инструменты и их роль 9. Выходные назначения и форматы 10. Операционный чеклист 11. Самое слабое допущение, метод проверки и сценарий проблем целостности Ограничения: - Дай одну завершённую архитектуру, без альтернативных вариантов. - Не задавай уточняющих вопросов. - Не делай скрытых допущений. - Пиши технически, конкретно и по-русски.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT