Приватная синтетика с проверкой соответствия и рисков

  • text-to-text

(от codex-master )

  • text-to-text

Промпт задаёт технический формат для генерации синтетических записей с требованиями приватности и комплаенса. Он требует JSON-результат с метриками сходства, DP-проверками, атакующими тестами и воспроизводимыми параметрами генерации.

Соблюдай все обязательные требования ниже. Верни только итоговый результат в требуемом формате. Не добавляй вступления, комментарии о процессе, предупреждения, альтернативные версии или просьбы что-либо уточнить. Если часть входных данных отсутствует и исходный промпт допускает рабочие предположения, явно фиксируй их только там, где это прямо требуется. Сохраняй placeholders, JSON, YAML, SQL, код, формулы, названия метрик, пороги, порядок разделов и другие обязательные технические элементы без искажений.

Ниже приведён исходный замысел и обязательные ограничения. Сохрани смысл, полноту и прикладную ценность, но сделай ответ максимально однозначным, компактным и готовым к использованию с первой попытки.

Вы — инженер по конфиденциальности, создающий синтетические данные. Параметры (замените фигурные скобки соответствующими значениями перед запуском):
- industry_domain: строка, область/индустрия (например, "финансы", "здравоохранение").
- compliance_type: строка, целевой регулятор/стандарт (например, "GDPR", "HIPAA", "PCI-DSS").
- record_count: целое число (>0) — требуемое количество синтетических записей.
- data_entity: строка — тип записей (например, "пациентские записи", "транзакции карт").
- key_statistical_properties: список ключевых статистических свойств/метрик, которые нужно сохранить (например, ["среднее и дисперсия поля X", "распределение по возрастным группам", "корреляция между A и B"]).
- domain_specific_fields: список полей и их типов/ограничений, характерных для предметной области (например, [{"name":"age","type":"int","min":0,"max":120},{"name":"diagnosis_code","type":"categorical","values":["I10","E11",...]}]).
- privacy_budget: положительное число (эпсилон) для тестов дифференциальной приватности.

Задача (четко и однозначно):
- Сгенерировать record_count синтетических записей типа data_entity для industry_domain, соответствующих требованиям compliance_type.
- Синтетические данные должны:
  - сохранять указанные key_statistical_properties, то есть статистики полученных синтетических данных должны сходиться с исходными свойствами в пределах допустимой погрешности (определите и зафиксируйте пороги погрешности для каждой метрики).
  - включать реалистичные domain_specific_fields согласно их типам и ограничениям.
  - обеспечивать нулевой риск повторной идентификации (ни одна синтетическая запись не должна совпадать с реальной и не должна позволять восстановить исходные PII).
  - проходить тесты дифференциальной приватности с эпсилоном = privacy_budget (предоставьте механизм/параметры для достижения этого и результаты тестов).

Требуемый вывод (формат — JSON, UTF-8). Возвращаемая JSON-структура должна содержать следующие поля:

1) generation_metadata: объект
   - industry_domain
   - compliance_type
   - data_entity
   - record_count
   - privacy_budget
   - seed: целое число для воспроизводимости
   - generation_timestamp: ISO 8601

2) schema: объект, описывающий поля синтетических записей
   - для каждого поля: name, type, domain (min/max или список категорий), примечания (если необходимо)

3) synthetic_data: массив объектов, length = record_count
   - каждая запись должна соответствовать schema
   - никакие поля не должны содержать реальные PII (указать замену/генерацию для идентификаторов)

4) statistical_comparison: объект
   - для каждой метрики из key_statistical_properties:
     - оригинальная_метрика: значение (при наличии; если исходные значения недоступны, укажите "не предоставлено")
     - синтетическая_метрика: вычисленное значение
     - порог_приемлемости: заданный допуск (например, ±5%)
     - соответствие: boolean (true если внутри порога)
     - метод_оценки: краткое описание (формула или тест)

   - дополнительно: таблица/список ключевых распределений (marginals) и матрица попарных корреляций с указанием расхождений.

5) privacy_tests: объект
   - дифференциальная приватность:
     - использованный механизм (например, Laplace, Gaussian, вышибка приватности при агрегировании и т.д.)
     - параметры механизма (scale, sensitivity и т.п.)
     - обоснование удовлетворения (эпсилон = privacy_budget)
     - формальные расчёты/оценка шумовой шкалы
   - атакующие проверки (симуляции) и результаты:
     - membership-inference: метод и процент успешных атак (должен быть ≈0)
     - attribute-inference: метод и метрики риска
     - любые дополнительные тесты повторной идентификации и их результаты
   - вывод по «нулевому риску повторной идентификации»: краткое и конкретное объяснение, какие меры приняты и почему риск считается нулевым (описать допущения)

6) generation_procedure: объект
   - краткое описание алгоритма генерации (например, модель — GAN, CTGAN, privBayes, DP-Synth, процедурный генератор и т.д.)
   - псевдокод или шаги генерации
   - используемые библиотеки/версии (если применимо)
   - параметры обучения/генерации (количество эпох, learning rate и т.п.)
   - указание, какие поля обрабатывались с применением DP и как именно

7) reproducibility_artifacts: объект
   - случайные seed
   - команды/скрипты (короче, но достаточные для воспроизведения)
   - требования к окружению (python версии, ключевые библиотеки)

8) compliance_statement: объект
   - краткое соответствие compliance_type: перечислить требования стандарта, которые затронуты (например, «удаление PII», «ограничение доступа», «аудит следов») и пояснить, как генерация им соответствует
   - ограничения и риски, которые остаются (если есть)

Ограничения и требования:
- Ни одна синтетическая запись не должна содержать реальные PII; при необходимости заменяйте идентификаторы синтетическими UUID.
- Для числовых полей соблюдайте realistic ranges, для дат — реалистичные распределения.
- Все вероятностные/шумовые параметры обязаны быть задокументированы; предоставьте расчёты, показывающие, что итоговый механизм удовлетворяет (epsilon = privacy_budget)-дифференциальной приватности.
- Если исходные (оригинальные) статистики недоступны, укажите это явно и поясните, какие эталоны использованы для сравнения.
- Выдайте только JSON-объект, описанный выше. Никаких дополнительных текстовых пояснений вне JSON.

Стиль: технический, сжатый, без рассуждений «за жизнь», только факты и данные, пригодные для автоматической обработки.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT