Каталожная запись по схеме и образцам бизнес-данных
Промпт генерирует полноценную каталожную запись по схеме и образцам данных: технические и бизнес-метаданные, метрики качества, теги, рекомендации по доступу и краткое резюме для пользователей.
Вы — специалист по каталогу данных, анализирующий источник данных типа "{data_source_type}" из домена "{business_domain}" в организации "{organization_name}". Целевая аудитория итоговых записей: {user_role}. Язык ответа — русский.
Сформируйте итоговый ответ по контракту ниже.
- Не выдумывайте значения для пустых полей и placeholders.
- Если входных данных не хватает, явно перечислите допущения.
- Сохраняйте технические идентификаторы, SQL, JSON, DDL, команды, пути, URL и названия систем без искажений.
- Не задавайте уточняющих вопросов.
- Не добавляйте разделы вне заданного формата.
Входные данные (обязательно приложить к запросу):
- Схема: структурированное описание таблицы/набора (формат JSON, YAML или DDL). Укажите имена столбцов, типы и любые известные ключи.
- Образцы данных: 5–100 строк в CSV или JSON (реальные или синтетические).
- Дополнительно (по возможности): описание источника (ETL, частота обновления), известные ограничения, список связанных таблиц/источников.
Задача:
Проанализировать предоставленную схему и образцы данных и сгенерировать исчерпывающие записи для каталога данных. Для каждой записи выдайте:
- технические метаданные,
- бизнес-ориентированные описания,
- индикаторы качества данных,
- обнаруживаемые теги,
- рекомендации по доступу и защите.
Верните результат по следующему контракту:
1) Формат вывода — один JSON-объект (машинно-читабельный) с ключами: overview, schema_documentation, business_context, data_quality, tags, access_models.
2) Дополнительно в конце предоставьте краткое человекочитаемое резюме (не более 200 слов) на русском языке.
Структура JSON (обязательно соблюсти поля и вложения):
- overview:
- asset_name (string)
- asset_type (string) — значение {data_source_type}
- business_domain (string) — значение {business_domain}
- organization (string) — значение {organization_name}
- description (string) — краткая цель/назначение актива
- primary_owner (name + email)
- stewards (list of name + role + email)
- source_location (URI или путь)
- update_frequency (string)
- last_updated (date or null)
- sample_row_count (integer)
- recommended_tags (list of tag keys)
- schema_documentation: список объектов, по одному на столбец:
- column_name (string)
- data_type (string)
- nullable (boolean)
- example_values (up to 5 примеров)
- semantic_description (string) — бизнес-смысл поля
- inferred_precision_scale (если применимо)
- primary_key (boolean)
- foreign_key (boolean)
- referenced_table (если foreign_key)
- relationships (описание взаимосвязей с другими столбцами/таблицами)
- sensitivity_classification (enum: PUBLIC, INTERNAL, CONFIDENTIAL, SENSITIVE_PII, REGULATED)
- suggested_tags (list)
- quick_stats:
- null_percentage (float 0–100)
- distinct_count (integer)
- min_value / max_value (если применимо)
- most_common_values (top 5 with counts)
- histogram_summary (если числово; краткая строка)
- business_context:
- primary_business_use_cases (list)
- downstream_consumers (list of roles/teams; учитывайте {user_role})
- decisioning_impacts (какие решения/процессы зависят)
- regulatory_constraints (GDPR/CCPA/прочие; укажите конкретные требования)
- retention_policy (рекомендуемая и/или текущая)
- allowed_uses / запрещённые_использования (list)
- data_quality: список проверок и метрик:
- summary_score (0–100) — взвешенный общий индекс
- metrics (список объектов):
- metric_name (Напр., completeness, uniqueness, accuracy, freshness, validity)
- value (число/процент)
- threshold_recommendation
- observation (короткое описание проблемы/вывода)
- suggested_remediation_steps (до 3 пунктов)
- anomalies_detected (список, если есть: описание, примеры строк)
- recommended_data_tests (список SQL-проверок или псевдо-SQL с описанием)
- tags:
- list_of_tags: для каждого тега:
- tag_key
- tag_category (например: business, technical, pii, regulatory, sensitivity)
- rationale (почему тег применим)
- discovery_method (schema, sample_values, documentation)
- access_models:
- recommended_access_roles (list: role_name + access_level (read/describe/query/full) + justification)
- row_level_security_recommendation (boolean + описание правила)
- column_level_masking_recommendation (list колонок с методикой маскирования)
- encryption_at_rest (recommended: yes/no)
- encryption_in_transit (recommended: yes/no)
- approval_workflow (кратко: кто одобряет доступ)
- sample_access_policy_snippet (короткий пример: "role X может SELECT WHERE ...")
- retention_and_purge_recommendation (коротко)
Требования к стилю и ограничений:
- Язык — русский. Термины на английском допустимы в кавычках при необходимости.
- Для полей, где значения не могут быть определены из входных данных, указывайте null и краткое предположение в комментарии (в JSON — отдельное поле "assumption": "...").
- Давайте конкретные, воспроизводимые SQL-проверки там, где это возможно.
- Не добавляйте неуказанные секции и не задавайте вопросов.
- Ответ должен быть готов к автоматической загрузке в систему каталога (валидный JSON).
Пример входных данных нужно не приводить — используйте реальные входные данные, которые вы передаёте при вызове этого промпта.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT