← 返回项目

爬虫 + 研究全流程

Research Operating System:科研写作、引用与数据工具链

这个项目不是简单的“科研 AI 页面”,而是一套围绕社会心理研究展开的操作系统:前端是微博事件数据采集与脱敏导出,中间是文献、引用和写作流程,最后进入组会报告和论文材料。

Research Operating System generated cover
weibo_event_researchstate-backed crawl
$ python src/weibo_cli.py tweet_by_keyword "就业压力" --start 2026-06-01-00 --split_by_hour --resume [state] load seen_ids from data/output/crawl_state.json [window] 2026-06-01-00 -> 2026-06-01-01 [metadata] crawl_mode=keyword_search crawl_job_id=keyword_search:就业压力:... [privacy] salted sha-256 anonymize -> export csv with UTF-8 BOM

核心工具

爬虫不是一次性脚本,而是为研究审计设计的数据管线。

研究材料采集最怕两件事:跑到一半断掉,以及跑完之后不知道每条记录从哪里来。这个管线把请求节奏、时间窗口、断点续跑、去重、元数据和脱敏放在一起处理,让微博事件材料可以进入后续分析。

关键词事件采集

通过 s.weibo.com 关键词检索,支持 start/end 时间窗和 split_by_hour,适合高频事件材料。

用户时间线采集

围绕用户主页、推文、评论、转发、粉丝和关注关系补充事件语境。

断点续跑

crawl_state.json 保存 seen_ids 和任务状态,任务中断后可以继续跑,避免重复写入。

时间窗口切片

_iter_time_windows 把长时间范围拆成可控窗口,降低请求失败和数据遗漏风险。

元数据盖章

每条记录附加 crawl_mode、crawl_job_id、source_endpoint、collected_at,方便后续审计。

脱敏导出

加盐 SHA-256 匿名化用户字段,再把 JSONL 导出为适合 Excel / Stata / SPSS 的 CSV。

研究流水线

数据采集、文献组织和报告写作不是三件分开的事。

01

研究问题

围绕教育竞争、机会稀缺、相对剥夺、公正世界信念和零和信念定义问题。

02

文献组织

PaperSpine 用目标场景、优秀样例、citation bank 和 audit 把写作过程结构化。

03

事件采集

Weibo pipeline 采集关键词和用户材料,保留状态、去重、时间窗和元数据。

04

数据处理

原始 JSONL 经过脱敏、扁平化和导出,进入统计或质性分析工具。

05

报告交付

组会材料把文献、模型、量表、图表和研究假设组织成可汇报版本。

Weibo Event Research

负责事件数据采集、反爬节奏、状态恢复、匿名化和 CSV 导出。

PaperSpine

负责论文/报告写作主线,覆盖 research、citation、rewrite/build、LaTeX、audit、translate。

Academic Research Skills

负责审稿视角、方法论检查、claim-faithfulness 和 mandatory checkpoints。

组会报告材料

把真实文献和研究模型落到汇报页,证明工具链进入研究工作流。

产品边界

它不是替代研究者,而是把重复、易错、难追溯的研究环节工具化。

研究判断仍然由人完成:变量怎么定义、文献怎么解释、模型是否成立、材料能否支撑结论,都不交给工具自动拍板。工具负责把采集、引用、写作、审计和汇报的中间过程保留下来,让研究者能回看、能修正、能复用。