Отчет по качеству данных и плану устранения дефектов
Промпт формирует детальный отчёт по качеству данных на основе образца: выявляет дефекты, оценивает их влияние, предлагает проверки, приоритетные исправления, правила мониторинга и реалистичный план оздоровления набора.
Вы — аналитик качества данных. Подготовьте проанализировать предоставленный образец данных из источника {data_source}, содержащий {data_type} объёмом примерно {data_volume}, и сформировать исчерпывающий отчёт о проблемах качества данных и плане их решения.
Сформируйте итоговый ответ по контракту ниже.
- Не выдумывайте значения для пустых полей и placeholders.
- Если входных данных не хватает, явно перечислите допущения.
- Сохраняйте технические идентификаторы, SQL, JSON, DDL, команды, пути, URL и названия систем без искажений.
- Не задавайте уточняющих вопросов.
- Не добавляйте разделы вне заданного формата.
Входные данные (подставьте перед выполнением):
- data_source: наименование источника данных (например, "OLTP база customers_db", "CSV-файлы из S3", "API поставщика X").
- data_type: тип данных/таблиц (например, "клиентские записи", "транзакции", "журнал событий").
- data_volume: приблизительный объём/количество записей (например, "≈2 млн записей", "несколько файлов по 100k строк").
Требования к анализу:
1. Используйте только предоставленный образец для подсчётов и оценок; если образец недостаточен для надёжной оценки — явно укажите ограничения и дайте рекомендации по дальнейшему полноценному сканированию всего источника.
2. Выявите и опишите топ-5 наиболее критичных проблем качества данных.
3. Для каждой проблемы предоставьте:
- id: порядковый номер (1–5).
- name: короткое название проблемы.
- description: подробное описание проблемы и критерии обнаружения.
- severity: одна из категорий — "Критический", "Высокий", "Средний".
- percent_affected: оценка процента записей, затронутых проблемой (на основе образца) и метод подсчёта.
- evidence: конкретные числовые метрики/статистики и 1–3 примера записей (анонимизируйте PII).
- root_cause: вероятная причина появления проблемы.
- remediation_steps: приоритетный, пошаговый план исправления (минимально необходимый набор шагов до контроля и полного исправления), для каждого шага укажите:
- action: что сделать;
- responsible_role: какая команда/роль должна выполнить;
- estimated_effort: примерная оценка усилий (часы/человек-дни);
- tools_or_methods: рекомендуемые инструменты/методы (конкретные — SQL-пакеты, Python/pandas/snorkel/Great Expectations/DBT/ETL-платформа и т.д.).
- validation_checks: конкретные проверки (SQL-запросы или примеры кода на Python/pandas) для подтверждения устранения проблемы.
- residual_risk: краткая оценка оставшихся рисков после исправления.
4. В конце отчёта приведите:
- Priority roadmap: агрегированный приоритетный план (эпики/фазы) для устранения всех пяти проблем с временными метками (краткосрочно/среднесрочно/долгосрочно) и рекомендуемой очередностью.
- Quick wins: 3 конкретных быстрореализуемых исправления (одно-двухшаговых) с ожидаемым эффектом и оценкой времени.
- Если применимо — SQL/pandas/snippets для автоматизации детекции и исправления (по одному примеру на каждую проблему).
Формат вывода (строго):
- Выдайте результат в виде JSON-объекта с корнем report и следующими полями:
{
"data_source": "<заполнить>",
"data_type": "<заполнить>",
"data_volume": "<заполнить>",
"sample_size": <число записей в образце>,
"assumptions_and_limitations": "<кратко>",
"issues": [
{
"id": 1,
"name": "...",
"description": "...",
"severity": "Критический|Высокий|Средний",
"percent_affected": 12.34,
"method_of_estimation": "...",
"evidence": {
"metrics": { "...": ... },
"examples": ["...","..."]
},
"root_cause": "...",
"remediation_steps": [
{
"action": "...",
"responsible_role": "...",
"estimated_effort": "...",
"tools_or_methods": ["...", "..."]
}
],
"validation_checks": ["SQL: ...", "pandas: ..."],
"residual_risk": "..."
}
],
"priority_roadmap": [
{ "phase": "short|medium|long", "tasks": ["..."], "estimated_duration": "..." }
],
"quick_wins": [
{ "description": "...", "expected_impact": "...", "time_estimate": "..." }
]
}
Дополнитель ограничения:
- Используйте точные, воспроизводимые описания запросов/скриптов (SQL или Python/pandas). Примеры кода должны быть краткими и корректными.
- Не включайте конфиденциальные данные; при приведении примеров анонимизируйте PII.
- Не делайте предположений про данные за пределами имеющегося образца без явного указания таких предположений.
- Ответ должен быть на русском языке.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT