Автономный анализ корпуса прозы с темами и визуализациями
(от codex-master
)
Промпт требует полный NLP-конвейер для корпуса прозы: очистку, тематическое моделирование, метрики качества, экспорт таблиц, построение графиков и готовые скрипты Python для воспроизводимого анализа.
В этом промпте 65 строк и 2366 символов
Ты — эксперт по NLP и визуализации данных.
Полностью автономно выполни анализ корпуса прозы и подготовь воспроизводимое руководство по тематическому моделированию и визуализации результатов. Конечный результат должен включать отчёт, список файлов и готовые примеры кода на Python 3.8+.
Входные данные могут быть двух видов:
- CSV UTF-8 с колонками `id` и `text`;
- папка с `.txt` файлами, где один файл = один документ.
Обязательные элементы результата:
1. Краткий обзор процесса.
2. Таблица `topics_overview.csv`: `id`, `dominant_topic`, `topic_distribution`.
3. Сводка тем: метка темы, 8–12 ключевых слов с весами, 3 реальных примерных фрагмента из корпуса и краткая интерпретация.
4. Метрики качества моделей: `coherence (c_v)`, при наличии `perplexity`, параметры модели.
5. Набор визуализаций с инструкцией по интерпретации.
6. Полные скрипты или блоки кода Python с комментариями и параметризованными путями.
Обязательный стек:
- Python 3.8+
- пакеты: `pandas`, `numpy`, `scikit-learn`, `gensim`, `spacy`, `nltk`, `matplotlib`, `seaborn`, `plotly`, `pyLDAvis`, `umap-learn`, `hdbscan`, `bertopic`, `wordcloud`, `networkx`, `python-louvain`
- для русского текста покажи вариант со `spaCy` и вариант с `pymorphy2`
Опиши и проиллюстрируй кодом:
A. Подготовку данных:
- чтение CSV или папки;
- проверку кодировки;
- очистку;
- токенизацию;
- стоп-слова;
- лемматизацию;
- биграммы и триграммы;
- BoW и TF-IDF.
B. Тематическое моделирование:
- минимум 2 метода: `LDA` и `BERTopic` либо `NMF`;
- подбор числа тем;
- вывод топ-слов;
- присвоение доминирующей темы документам.
C. Валидацию и маркировку тем:
- coherence;
- ручную выборку документов;
- подход к именованию тем.
D. Визуализации:
- bar chart;
- heatmap или stacked bar;
- `pyLDAvis`;
- wordclouds;
- 2D-проекцию `UMAP` или `t-SNE`;
- сетевой граф;
- временную динамику тем при наличии дат.
E. Репликацию и оптимизацию:
- ускорение;
- гиперпараметры;
- интерпретацию неоднозначных тем.
F. Ожидаемые файлы на выходе и их пути.
Формат ответа:
- нумерованные шаги;
- короткие пояснения;
- готовые блоки кода с подписями;
- пример `requirements.txt`;
- итоговое краткое резюме из 3–5 пунктов.
Ограничения:
- не используй платные или закрытые API;
- не предполагай наличие GPU;
- не выдумывай цитаты; примерные фрагменты должны браться из реального корпуса, а демонстрационные mock-примеры помечай явно.
Промпт доступен бесплатно после регистрации/авторизации
Регистрация
Разработка, Типы промптов