Архитектура производственного конвейера данных для ML и feature store
Промпт описывает производственный ETL или ELT-конвейер для ML: слои хранения, проверки качества, feature engineering, оркестрацию, lineage, схему ошибок, безопасность, стоимость и план запуска MVP.
Спроектируй производственный конвейер данных для ML по входным данным:
- {тип_модели}
- {тип_use_case}
- {источники_данных}
- {объём_данных_в_сутки}
- {требования_к_качеству_данных}
- {облачный_провайдер}
Отвечай только на русском языке и строго по нумерованным разделам.
План должен быть достаточно конкретным, чтобы инженерная команда могла реализовать MVP без дополнительных уточнений.
1. Краткое резюме архитектуры:
- 2-4 предложения;
- ключевые решения и приоритеты.
2. Архитектурная схема высокого уровня:
- поток от ingest до serving;
- текстовая или ASCII-диаграмма.
3. Компоненты и слои хранения:
- raw or ingest;
- bronze or cleansed;
- silver or enriched;
- gold or features or serving;
- форматы хранения;
- партиционирование;
- ретенция.
4. Валидация данных:
- проверки схемы, типов, диапазонов, дублей, ссылочной целостности;
- где они выполняются;
- инструменты;
- пример правила в JSON, SQL или псевдокоде.
5. Трансформации и выделение признаков:
- staging -> standardization -> enrichment -> aggregation;
- batch и stream-паттерны;
- пример SQL или Python-фрагмента.
6. Оркестрация:
- совместимые с {облачный_провайдер} инструменты;
- пример DAG или pipeline;
- расписание, триггеры и зависимости.
7. Обработка ошибок и повторные попытки:
- идемпотентность;
- дедупликация;
- компенсационные действия;
- DLQ;
- retry и backoff для типовых ошибок.
8. Эволюция схемы:
- versioning;
- миграции;
- обратная совместимость;
- schema registry или облачные аналоги.
9. Data lineage и аудит:
- инструменты;
- какие метаданные собирать;
- пример lineage-события для одного pipeline.
10. Наблюдаемость, безопасность и доступ:
- throughput, latency, freshness, error rate, skew;
- алерты и пороги;
- шифрование, IAM, секреты, разделение прав по слоям.
11. Производительность, масштабирование и стоимость:
- оценка ресурсов;
- partition pruning;
- compaction;
- separation of compute and storage;
- рекомендации под {объём_данных_в_сутки}.
12. План внедрения:
- MVP;
- расширение;
- production readiness;
- критерии перехода.
13. Рекомендуемый стек и примеры:
- основной стек;
- альтернативы;
- 1-2 коротких конфигурационных или кодовых фрагмента.
Ограничения:
- Предлагай только варианты, совместимые с {облачный_провайдер}, или явно указывай замену.
- Каждый кодовый пример: не более 40 строк.
- Избегай абстрактных советов без параметров и порогов.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT