关键词事件采集
通过 s.weibo.com 关键词检索,支持 start/end 时间窗和 split_by_hour,适合高频事件材料。
爬虫 + 研究全流程
这个项目不是简单的“科研 AI 页面”,而是一套围绕社会心理研究展开的操作系统:前端是微博事件数据采集与脱敏导出,中间是文献、引用和写作流程,最后进入组会报告和论文材料。
$ python src/weibo_cli.py tweet_by_keyword "就业压力" --start 2026-06-01-00 --split_by_hour --resume [state] load seen_ids from data/output/crawl_state.json [window] 2026-06-01-00 -> 2026-06-01-01 [metadata] crawl_mode=keyword_search crawl_job_id=keyword_search:就业压力:... [privacy] salted sha-256 anonymize -> export csv with UTF-8 BOM 核心工具
研究材料采集最怕两件事:跑到一半断掉,以及跑完之后不知道每条记录从哪里来。这个管线把请求节奏、时间窗口、断点续跑、去重、元数据和脱敏放在一起处理,让微博事件材料可以进入后续分析。
通过 s.weibo.com 关键词检索,支持 start/end 时间窗和 split_by_hour,适合高频事件材料。
围绕用户主页、推文、评论、转发、粉丝和关注关系补充事件语境。
crawl_state.json 保存 seen_ids 和任务状态,任务中断后可以继续跑,避免重复写入。
_iter_time_windows 把长时间范围拆成可控窗口,降低请求失败和数据遗漏风险。
每条记录附加 crawl_mode、crawl_job_id、source_endpoint、collected_at,方便后续审计。
加盐 SHA-256 匿名化用户字段,再把 JSONL 导出为适合 Excel / Stata / SPSS 的 CSV。
研究流水线
围绕教育竞争、机会稀缺、相对剥夺、公正世界信念和零和信念定义问题。
PaperSpine 用目标场景、优秀样例、citation bank 和 audit 把写作过程结构化。
Weibo pipeline 采集关键词和用户材料,保留状态、去重、时间窗和元数据。
原始 JSONL 经过脱敏、扁平化和导出,进入统计或质性分析工具。
组会材料把文献、模型、量表、图表和研究假设组织成可汇报版本。
负责事件数据采集、反爬节奏、状态恢复、匿名化和 CSV 导出。
负责论文/报告写作主线,覆盖 research、citation、rewrite/build、LaTeX、audit、translate。
负责审稿视角、方法论检查、claim-faithfulness 和 mandatory checkpoints。
把真实文献和研究模型落到汇报页,证明工具链进入研究工作流。
产品边界
研究判断仍然由人完成:变量怎么定义、文献怎么解释、模型是否成立、材料能否支撑结论,都不交给工具自动拍板。工具负责把采集、引用、写作、审计和汇报的中间过程保留下来,让研究者能回看、能修正、能复用。