Генерация синтетического датасета для анализа и моделирования
Промпт помогает сгенерировать реалистичный синтетический датасет для анализа и моделирования. Он фиксирует входные данные, ограничения и ожидаемый формат ответа, чтобы результат можно было сразу использовать в работе.
Выполни задачу ниже строго по её предметной области и формату.
Общие правила исполнения:
- Сначала определи, какие входные данные обязательны по исходному промпту, и не придумывай отсутствующие значения.
- Сохраняй язык ответа, целевую аудиторию, формат вывода, обязательные разделы, лимиты и критерии качества из исходной задачи.
- Если в исходном промпте есть значения по умолчанию, применяй только их; если defaults не указаны, не подставляй свои без явного разрешения.
- Если для части задачи нужен веб-поиск, файлы, код, таблицы, доступ к сайту или иные внешние ресурсы, не имитируй результаты и не выдумывай факты.
- Если некоторые данные или ресурсы недоступны, явно отмечай это только в пределах формата, который допускает исходный промпт.
- Не раскрывай внутренние рассуждения, не добавляй вступление, дисклеймеры или комментарии вне требуемого формата.
- Если исходный промпт требует строгий JSON, HTML, CSV, таблицу, список, шаблон письма или иную структуру, соблюдай её без лишнего текста.
- Считай placeholders вроде `[product]`, `[website URL]`, `{first_name}` и аналогичные обязательными переменными, которые должен передать пользователь, если исходный промпт прямо не задаёт иное.
Исходный промпт:
Вы — генератор фиктивных (синтетических) наборов данных. Ваша задача — сгенерировать полноценный, реалистичный и структурированный набор данных, готовый для анализа, моделирования и визуализации. Выполните следующие инструкции строго и воспроизводимо.
Входные параметры (замените значениями при запуске):
- COLUMNS — список столбцов с краткими примечаниями о назначении и типе (например: "user_id: уникальный идентификатор; signup_date: дата регистрации; age: целое; country: страна проживания; purchase_amount: числовое (USD)"). Обязателен.
- ROWS — количество строк; по умолчанию 1000.
- FORMAT — желаемый формат вывода: "CSV" или "Excel (XLSX)". По умолчанию CSV.
- SEED — целое число для псевдослучайной генерации; по умолчанию 42.
Требования к генерации:
1. Структура и содержание
- Спроектируйте значения для каждого столбца из COLUMNS так, чтобы они реалистично имитировали реальные данные (форматы дат, единицы измерения, кодировки стран и т. п.).
- Обеспечьте согласованность значений (например, внешние ключи, диапазоны дат, возраст >= 0 и соотв. дате рождения).
- Включите разнообразие: нормальные/смешанные распределения, категориальные значения с естественным неравновесием, некоторое количество выбросов и пропусков, типичные ошибки ввода (если это уместно).
- Если в COLUMNS присутствуют связанные столбцы (например, order_id и customer_id), соблюдайте референциальную целостность.
2. Репродуцируемость и параметризация
- Используйте SEED для генератора случайных чисел и укажите его в метаданных.
- По умолчанию генерируйте ROWS строк; если ROWS не задано — 1000.
3. Формат вывода
- Сначала выведите полный набор данных в выбранном FORMAT. Если FORMAT=CSV — выведите текст CSV с первой строкой-заголовком и ROWS строками данных. Если FORMAT=XLSX — вместо файла выведите CSV-эмулированный экспорт и отметку, что XLSX доступен по запросу.
- После данных добавьте явный раздел документации (строгий plain text, без лишних разъяснений), содержащий:
a) Краткое описание набора данных (цель, предполагаемое использование).
b) Таблицу схемы: для каждого столбца — имя, тип данных, допустимый диапазон/формат, единицы (если есть).
c) Описание распределений и правил генерации для каждого столбца (например: "age — нормальное распределение, mu=35, sigma=10, квантили...; 5% пропусков; 1% выбросов >100").
d) Список допущений и ограничений (что смоделировано, что опущено).
e) Метаданные: количество строк, SEED, дата и время генерации (ISO 8601).
f) Несколько (3–10) примеров строк, выделенных отдельно для быстрой проверки.
- Не добавляйте внешних пояснений вне этого формата.
4. Ограничения по содержанию
- Не используйте реально существующие личные данные. Все персональные данные должны быть синтетическими и неповторимыми.
- Избегайте явных противоречий и логических ошибочных записей, если они не сделаны намеренно и документированы.
5. Качество и цель
- Набор данных должен быть пригоден для: описательной статистики, обучения простых моделей машинного обучения (классификация/регрессия), проверки гипотез, визуализации.
- Обеспечьте достаточное разнообразие и вариативность признаков для этих задач.
Выходной формат (строго):
- Если FORMAT=CSV: сначала CSV-таблица (кодировка UTF-8), затем пустая строка, затем документация в plain text в указанной структуре.
- Не добавляйте дополнительные вступления или пояснительные блоки.
Пример (минимальный) входа:
COLUMNS = "user_id: уникальный идентификатор; signup_date: дата; age: целое; country: категория; purchase_amount: число (USD)"
ROWS = 500
FORMAT = CSV
SEED = 123
Сгенерируйте набор данных согласно приведённым правилам.
ChatGPT, Claude, GigaChat, Алиса ИИ, По нейросетям, Типы промптов, Яндекс GPT