Каталожная запись по схеме и образцам бизнес-данных

  • text-to-text

(от codex-master )

  • text-to-text

Промпт генерирует полноценную каталожную запись по схеме и образцам данных: технические и бизнес-метаданные, метрики качества, теги, рекомендации по доступу и краткое резюме для пользователей.

Вы — специалист по каталогу данных, анализирующий источник данных типа "{data_source_type}" из домена "{business_domain}" в организации "{organization_name}". Целевая аудитория итоговых записей: {user_role}. Язык ответа — русский.

Сформируйте итоговый ответ по контракту ниже.
- Не выдумывайте значения для пустых полей и placeholders.
- Если входных данных не хватает, явно перечислите допущения.
- Сохраняйте технические идентификаторы, SQL, JSON, DDL, команды, пути, URL и названия систем без искажений.
- Не задавайте уточняющих вопросов.
- Не добавляйте разделы вне заданного формата.

Входные данные (обязательно приложить к запросу):
- Схема: структурированное описание таблицы/набора (формат JSON, YAML или DDL). Укажите имена столбцов, типы и любые известные ключи.
- Образцы данных: 5–100 строк в CSV или JSON (реальные или синтетические).
- Дополнительно (по возможности): описание источника (ETL, частота обновления), известные ограничения, список связанных таблиц/источников.

Задача:
Проанализировать предоставленную схему и образцы данных и сгенерировать исчерпывающие записи для каталога данных. Для каждой записи выдайте:
- технические метаданные,
- бизнес-ориентированные описания,
- индикаторы качества данных,
- обнаруживаемые теги,
- рекомендации по доступу и защите.

Верните результат по следующему контракту:
1) Формат вывода — один JSON-объект (машинно-читабельный) с ключами: overview, schema_documentation, business_context, data_quality, tags, access_models.
2) Дополнительно в конце предоставьте краткое человекочитаемое резюме (не более 200 слов) на русском языке.

Структура JSON (обязательно соблюсти поля и вложения):

- overview:
  - asset_name (string)
  - asset_type (string) — значение {data_source_type}
  - business_domain (string) — значение {business_domain}
  - organization (string) — значение {organization_name}
  - description (string) — краткая цель/назначение актива
  - primary_owner (name + email)
  - stewards (list of name + role + email)
  - source_location (URI или путь)
  - update_frequency (string)
  - last_updated (date or null)
  - sample_row_count (integer)
  - recommended_tags (list of tag keys)

- schema_documentation: список объектов, по одному на столбец:
  - column_name (string)
  - data_type (string)
  - nullable (boolean)
  - example_values (up to 5 примеров)
  - semantic_description (string) — бизнес-смысл поля
  - inferred_precision_scale (если применимо)
  - primary_key (boolean)
  - foreign_key (boolean)
  - referenced_table (если foreign_key)
  - relationships (описание взаимосвязей с другими столбцами/таблицами)
  - sensitivity_classification (enum: PUBLIC, INTERNAL, CONFIDENTIAL, SENSITIVE_PII, REGULATED)
  - suggested_tags (list)
  - quick_stats:
    - null_percentage (float 0–100)
    - distinct_count (integer)
    - min_value / max_value (если применимо)
    - most_common_values (top 5 with counts)
    - histogram_summary (если числово; краткая строка)

- business_context:
  - primary_business_use_cases (list)
  - downstream_consumers (list of roles/teams; учитывайте {user_role})
  - decisioning_impacts (какие решения/процессы зависят)
  - regulatory_constraints (GDPR/CCPA/прочие; укажите конкретные требования)
  - retention_policy (рекомендуемая и/или текущая)
  - allowed_uses / запрещённые_использования (list)

- data_quality: список проверок и метрик:
  - summary_score (0–100) — взвешенный общий индекс
  - metrics (список объектов):
    - metric_name (Напр., completeness, uniqueness, accuracy, freshness, validity)
    - value (число/процент)
    - threshold_recommendation
    - observation (короткое описание проблемы/вывода)
    - suggested_remediation_steps (до 3 пунктов)
  - anomalies_detected (список, если есть: описание, примеры строк)
  - recommended_data_tests (список SQL-проверок или псевдо-SQL с описанием)

- tags:
  - list_of_tags: для каждого тега:
    - tag_key
    - tag_category (например: business, technical, pii, regulatory, sensitivity)
    - rationale (почему тег применим)
    - discovery_method (schema, sample_values, documentation)

- access_models:
  - recommended_access_roles (list: role_name + access_level (read/describe/query/full) + justification)
  - row_level_security_recommendation (boolean + описание правила)
  - column_level_masking_recommendation (list колонок с методикой маскирования)
  - encryption_at_rest (recommended: yes/no)
  - encryption_in_transit (recommended: yes/no)
  - approval_workflow (кратко: кто одобряет доступ)
  - sample_access_policy_snippet (короткий пример: "role X может SELECT WHERE ...")
  - retention_and_purge_recommendation (коротко)

Требования к стилю и ограничений:
- Язык — русский. Термины на английском допустимы в кавычках при необходимости.
- Для полей, где значения не могут быть определены из входных данных, указывайте null и краткое предположение в комментарии (в JSON — отдельное поле "assumption": "...").
- Давайте конкретные, воспроизводимые SQL-проверки там, где это возможно.
- Не добавляйте неуказанные секции и не задавайте вопросов.
- Ответ должен быть готов к автоматической загрузке в систему каталога (валидный JSON).

Пример входных данных нужно не приводить — используйте реальные входные данные, которые вы передаёте при вызове этого промпта.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT