Архитектура производственного конвейера данных для ML и feature store

  • text-to-text

(от codex-master )

  • text-to-text

Промпт описывает производственный ETL или ELT-конвейер для ML: слои хранения, проверки качества, feature engineering, оркестрацию, lineage, схему ошибок, безопасность, стоимость и план запуска MVP.

Спроектируй производственный конвейер данных для ML по входным данным:
- {тип_модели}
- {тип_use_case}
- {источники_данных}
- {объём_данных_в_сутки}
- {требования_к_качеству_данных}
- {облачный_провайдер}

Отвечай только на русском языке и строго по нумерованным разделам.
План должен быть достаточно конкретным, чтобы инженерная команда могла реализовать MVP без дополнительных уточнений.

1. Краткое резюме архитектуры:
   - 2-4 предложения;
   - ключевые решения и приоритеты.
2. Архитектурная схема высокого уровня:
   - поток от ingest до serving;
   - текстовая или ASCII-диаграмма.
3. Компоненты и слои хранения:
   - raw or ingest;
   - bronze or cleansed;
   - silver or enriched;
   - gold or features or serving;
   - форматы хранения;
   - партиционирование;
   - ретенция.
4. Валидация данных:
   - проверки схемы, типов, диапазонов, дублей, ссылочной целостности;
   - где они выполняются;
   - инструменты;
   - пример правила в JSON, SQL или псевдокоде.
5. Трансформации и выделение признаков:
   - staging -> standardization -> enrichment -> aggregation;
   - batch и stream-паттерны;
   - пример SQL или Python-фрагмента.
6. Оркестрация:
   - совместимые с {облачный_провайдер} инструменты;
   - пример DAG или pipeline;
   - расписание, триггеры и зависимости.
7. Обработка ошибок и повторные попытки:
   - идемпотентность;
   - дедупликация;
   - компенсационные действия;
   - DLQ;
   - retry и backoff для типовых ошибок.
8. Эволюция схемы:
   - versioning;
   - миграции;
   - обратная совместимость;
   - schema registry или облачные аналоги.
9. Data lineage и аудит:
   - инструменты;
   - какие метаданные собирать;
   - пример lineage-события для одного pipeline.
10. Наблюдаемость, безопасность и доступ:
   - throughput, latency, freshness, error rate, skew;
   - алерты и пороги;
   - шифрование, IAM, секреты, разделение прав по слоям.
11. Производительность, масштабирование и стоимость:
   - оценка ресурсов;
   - partition pruning;
   - compaction;
   - separation of compute and storage;
   - рекомендации под {объём_данных_в_сутки}.
12. План внедрения:
   - MVP;
   - расширение;
   - production readiness;
   - критерии перехода.
13. Рекомендуемый стек и примеры:
   - основной стек;
   - альтернативы;
   - 1-2 коротких конфигурационных или кодовых фрагмента.

Ограничения:
- Предлагай только варианты, совместимые с {облачный_провайдер}, или явно указывай замену.
- Каждый кодовый пример: не более 40 строк.
- Избегай абстрактных советов без параметров и порогов.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT