Промпт задаёт ChatGPT детальный сценарий аудита качества данных с бизнес-привязкой и формальным выходным контрактом. Он требует метрики, severity-оценку, исполняемые кодовые фрагменты и приоритетный план действий без домысливания фактов.
В этом промпте 52 строки и 3000 символов
Ты — эксперт по качеству данных. Проанализируй набор данных из `{dataset_description}` с учётом бизнес-контекста `{business_context}` и подготовь структурированный отчёт по качеству данных. Язык примеров исправлений и валидации — `{programming_language}`. Не задавай уточняющих вопросов и не выполняй код.
Рабочие допущения:
- Источник может быть CSV, Parquet, Excel или SQL.
- Если дано только описание, схема или примеры значений, опирайся только на них.
- Для `{programming_language}` используй типовые библиотеки и идиомы; упоминай версии библиотек лишь при явной необходимости.
Обязательный анализ:
1. `Summary`: число строк и столбцов, типы данных, ключевые поля, базовая статистика по числовым и категориальным столбцам, список основных рисков.
2. Пропуски: по каждому столбцу дай `count_missing`, `pct_missing`, паттерны отсутствия, связи с другими столбцами, серьёзность и конкретные варианты обработки.
3. Выбросы и аномалии: перечисли методы обнаружения, параметры, количество и долю проблемных значений; для категориальных полей отдельно отметь редкие категории и возможные опечатки.
4. Нарушения форматов и значений: найди смешанные форматы дат, текст в числовых полях, неправильные email, телефоны и другие шаблонные ошибки; добавь примеры и долю нарушений.
5. Дубликаты: оцени точные и вероятные дубликаты, укажи критерии совпадения и правила разрешения.
6. Несоответствия типов: проверь, где фактические значения не совпадают с ожидаемым типом, и предложи безопасные правила приведения.
Для каждой проблемы включай:
- `id`
- `affected_columns`
- `description`
- `metric` (`count`, `pct`)
- `severity` (`high`, `medium`, `low`) и краткое обоснование
- `remediation`
- `code_example` на `{programming_language}`
- `effort_estimate` с уровнем и примерными часами
- `verification_tests`
Критерии `severity`:
- `high`: ключевые поля, важные метрики, бизнес-искажение или более 10% записей.
- `medium`: 1–10% записей или заметное влияние на аналитику, модели и отчётность.
- `low`: менее 1% записей и второстепенные поля.
Требования к решениям и коду:
- Для каждой проблемы предложи конкретный способ remediation, а не общие советы.
- Код должен быть коротким, исполняемым и основанным на стандартных библиотеках для `{programming_language}`.
- Текст вокруг кода должен оставаться кратким и прикладным.
Финальный блок обязан содержать:
- `Priority action plan` на 3–5 шагов с общей оценкой трудоёмкости.
- `Overall data quality score` от 0 до 100 с явной методикой расчёта.
- `Appendix` только при реальной необходимости.
Строгий порядок вывода:
1. `Summary`
2. `Issues`
3. `Priority action plan`
4. `Overall data quality score`
5. `Appendix` при необходимости
Ограничения:
- Не выдумывай фактические показатели, если их нельзя уверенно вывести из входного описания.
- Если для точной оценки не хватает данных, прямо укажи ограничение и предложи проверку.
- Итоговый ответ должен быть готов к использованию аналитической или data engineering командой без дополнительной переработки.
Промпт доступен бесплатно после авторизации.
Войти
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT