Генерация синтетического датасета для анализа и моделирования

  • text-to-text

(от codex-master )

  • text-to-text

Промпт помогает сгенерировать реалистичный синтетический датасет для анализа и моделирования. Он фиксирует входные данные, ограничения и ожидаемый формат ответа, чтобы результат можно было сразу использовать в работе.

Выполни задачу ниже строго по её предметной области и формату.

        Общие правила исполнения:
        - Сначала определи, какие входные данные обязательны по исходному промпту, и не придумывай отсутствующие значения.
        - Сохраняй язык ответа, целевую аудиторию, формат вывода, обязательные разделы, лимиты и критерии качества из исходной задачи.
        - Если в исходном промпте есть значения по умолчанию, применяй только их; если defaults не указаны, не подставляй свои без явного разрешения.
        - Если для части задачи нужен веб-поиск, файлы, код, таблицы, доступ к сайту или иные внешние ресурсы, не имитируй результаты и не выдумывай факты.
        - Если некоторые данные или ресурсы недоступны, явно отмечай это только в пределах формата, который допускает исходный промпт.
        - Не раскрывай внутренние рассуждения, не добавляй вступление, дисклеймеры или комментарии вне требуемого формата.
        - Если исходный промпт требует строгий JSON, HTML, CSV, таблицу, список, шаблон письма или иную структуру, соблюдай её без лишнего текста.
        - Считай placeholders вроде `[product]`, `[website URL]`, `{first_name}` и аналогичные обязательными переменными, которые должен передать пользователь, если исходный промпт прямо не задаёт иное.

        Исходный промпт:

        Вы — генератор фиктивных (синтетических) наборов данных. Ваша задача — сгенерировать полноценный, реалистичный и структурированный набор данных, готовый для анализа, моделирования и визуализации. Выполните следующие инструкции строго и воспроизводимо.

Входные параметры (замените значениями при запуске):
- COLUMNS — список столбцов с краткими примечаниями о назначении и типе (например: "user_id: уникальный идентификатор; signup_date: дата регистрации; age: целое; country: страна проживания; purchase_amount: числовое (USD)"). Обязателен.
- ROWS — количество строк; по умолчанию 1000.
- FORMAT — желаемый формат вывода: "CSV" или "Excel (XLSX)". По умолчанию CSV.
- SEED — целое число для псевдослучайной генерации; по умолчанию 42.

Требования к генерации:
1. Структура и содержание
   - Спроектируйте значения для каждого столбца из COLUMNS так, чтобы они реалистично имитировали реальные данные (форматы дат, единицы измерения, кодировки стран и т. п.).
   - Обеспечьте согласованность значений (например, внешние ключи, диапазоны дат, возраст >= 0 и соотв. дате рождения).
   - Включите разнообразие: нормальные/смешанные распределения, категориальные значения с естественным неравновесием, некоторое количество выбросов и пропусков, типичные ошибки ввода (если это уместно).
   - Если в COLUMNS присутствуют связанные столбцы (например, order_id и customer_id), соблюдайте референциальную целостность.

2. Репродуцируемость и параметризация
   - Используйте SEED для генератора случайных чисел и укажите его в метаданных.
   - По умолчанию генерируйте ROWS строк; если ROWS не задано — 1000.

3. Формат вывода
   - Сначала выведите полный набор данных в выбранном FORMAT. Если FORMAT=CSV — выведите текст CSV с первой строкой-заголовком и ROWS строками данных. Если FORMAT=XLSX — вместо файла выведите CSV-эмулированный экспорт и отметку, что XLSX доступен по запросу.
   - После данных добавьте явный раздел документации (строгий plain text, без лишних разъяснений), содержащий:
     a) Краткое описание набора данных (цель, предполагаемое использование).
     b) Таблицу схемы: для каждого столбца — имя, тип данных, допустимый диапазон/формат, единицы (если есть).
     c) Описание распределений и правил генерации для каждого столбца (например: "age — нормальное распределение, mu=35, sigma=10, квантили...; 5% пропусков; 1% выбросов >100").
     d) Список допущений и ограничений (что смоделировано, что опущено).
     e) Метаданные: количество строк, SEED, дата и время генерации (ISO 8601).
     f) Несколько (3–10) примеров строк, выделенных отдельно для быстрой проверки.
   - Не добавляйте внешних пояснений вне этого формата.

4. Ограничения по содержанию
   - Не используйте реально существующие личные данные. Все персональные данные должны быть синтетическими и неповторимыми.
   - Избегайте явных противоречий и логических ошибочных записей, если они не сделаны намеренно и документированы.

5. Качество и цель
   - Набор данных должен быть пригоден для: описательной статистики, обучения простых моделей машинного обучения (классификация/регрессия), проверки гипотез, визуализации.
   - Обеспечьте достаточное разнообразие и вариативность признаков для этих задач.

Выходной формат (строго):
- Если FORMAT=CSV: сначала CSV-таблица (кодировка UTF-8), затем пустая строка, затем документация в plain text в указанной структуре.
- Не добавляйте дополнительные вступления или пояснительные блоки.

Пример (минимальный) входа:
COLUMNS = "user_id: уникальный идентификатор; signup_date: дата; age: целое; country: категория; purchase_amount: число (USD)"
ROWS = 500
FORMAT = CSV
SEED = 123

Сгенерируйте набор данных согласно приведённым правилам.

Попробуйте этот промпт

ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT