Верни только один валидный JSON-объект без Markdown и без любого текста до или после него.
Роль: эксперт в вычислительной социальной науке и разработке программных конвейеров для анализа больших данных.
Задача:
- Предложи детализированный, воспроизводимый и реализуемый pipeline для автоматического отслеживания появления, распространения и развития социальных норм в данных.
- Под социальными нормами понимай поведенческие или языковые паттерны, которые становятся регулярными и/или сопровождаются социальным давлением.
- Учитывай различие между injunctive и descriptive norms.
- Ответ должен быть достаточен для реализации MVP инженерной и исследовательской командой.
Предполагаемые данные:
- поток, таблица или `JSON` с полями `event_id`, `user_id`, `timestamp`, `content`, `action_type`, `target_id`, `metadata`;
- объём от `10^4` до `10^8` записей;
- возможны сетевые данные и gold labels.
Структура верхнего уровня JSON:
{
"pipeline": ...,
"data_schema": ...,
"algorithms": ...,
"pseudocode": ...,
"features": ...,
"metrics": ...,
"evaluation": ...,
"implementation": ...,
"visualizations": ...,
"config_examples": ...
}
Что обязательно раскрыть в JSON:
- короткое определение проблемы и сигналов появления или развития нормы;
- этапы pipeline: ingest, очистка, нормализация, признаки, детекция, моделирование распространения, динамика во времени, валидация, визуализация;
- для каждого этапа: вход, выход, инструменты, заметки по производительности;
- схему данных с обязательными и опциональными полями, типами и примерами;
- инженерные признаки:
- лингвистические;
- поведенческие;
- сетевые;
- временные;
- рекомендации по нормализации и агрегации;
- алгоритмы:
- change point detection;
- burst detection `Kleinberg`;
- term emergence;
- temporal embeddings и cosine drift;
- классификация injunctive vs descriptive;
- weak supervision;
- `SI`, `Hawkes`, contagion models;
- adoption curves, survival analysis;
- `DTM`, rolling `LDA`, `BERTopic`, `HMM`, changepoint models, Bayesian hierarchical models;
- сигналы санкций через негативные и позитивные реакции;
- метрики появления и укоренения нормы;
- план валидации и оценивания;
- технологии реализации на `Python`, при необходимости `R` или `Scala`;
- короткий псевдокод ключевого шага;
- рекомендации по масштабированию: batching, `Spark`, `Dask`, индексирование;
- приватность, смещения и этику;
- визуализации и формат выходного артефакта с полями `norm_id`, `start_timestamp`, `confidence`, `affected_communities`, `top_features`, `adoption_curve`;
- 2-3 примера конфигураций `JSON` для малого, среднего и большого сценария.
Ограничения:
- не включай персональные данные;
- пиши компактно, но достаточно подробно для разработки;
- соблюдай валидный JSON-синтаксис.