本项目旨在分析气候变化和COVID-19相关政策文档,使用自然语言处理和主题建模技术来识别政策趋势和主题。项目包含了大量的政策文本数据,以及用于处理和分析这些数据的代码。
-
Bertopic_model/: 包含使用BERTopic进行主题建模的代码和结果
Train_model.ipynb: 训练主题模型的Jupyter笔记本preprocessed_climate_en_merged_policies.txt: 分词处理并合并后用于建模的气候政策文本,上传到百度网盘:https://pan.baidu.com/s/1nFImmimKr7ukX7cZYojLbw?pwd=g3mwpreprocessed_covid_en_merged_policies.txt:分词处理合并后用于建模的COVID政策文本,上传到百度网盘:https://pan.baidu.com/s/1FWFEd4HRSm5KnflTJJUsSQ?pwd=hi43climate_policy_topics.csv: 气候政策主题分析结果,上传到Google Drive:https://drive.google.com/file/d/1MpUKgPh9pt3gIEbtQSjBTYjcopOiKWFQ/view?usp=sharingoutput_covid_en.xlsx: COVID-19政策主题分析结果,上传到Google Drive:https://docs.google.com/spreadsheets/d/1U9vRkyXWGNen_OzfQ31dVy49QayfFUeo/edit?usp=sharing&ouid=113881400530248475154&rtpof=true&sd=trueprocess/: 数据预处理脚本
-
embeddings/: 包含文本嵌入向量和原始文本数据
climate_en_cn/: 气候政策文本(英文和中文),上传到百度网盘:https://pan.baidu.com/s/1Z2aZaWDTh_z9UCTwTVhufA?pwd=iibjcovid_en/: COVID-19政策文本(英文),上传到百度网盘:https://pan.baidu.com/s/1fMjoPkOLOGwW78q_U3tUoQ?pwd=idzkcopy_climate_en_merged_policies.txt:合并后用于embedding的气候政策文本数据,上传到百度网盘:https://pan.baidu.com/s/1gzwCt8Unx1aUOU2QjskYAw?pwd=7q52covid_en_merged_policies.txt:合并后用于embedding的COVID-19政策文本数据,上传到百度网盘:https://pan.baidu.com/s/1k3URNu8dLWLdWcR-KkDA5g?pwd=ndy3embedding_longformer.ipynb: 生成文本嵌入的笔记本copy_climate_en_merged_policies_embeddings_1.npy:气候政策文本嵌入结果covid_en_merged_policies_embeddings.npy:COVID-19政策文本嵌入结果
-
results/: 分析结果和可视化
visualization/: 主题模型可视化结果,上传到Google Drive
-
yuanwen/: 原始政策文档 百度网盘链接:通过网盘分享的文件:政策 链接: https://pan.baidu.com/s/1WiKNgX8-WysMc6iVNmIBYQ?pwd=ykq4 提取码: ykq4 --来自百度网盘超级会员v4的分享
-
克隆仓库:
git clone https://github.com/Kristariss/policy_climate_covid.git -
安装依赖:
pip install -r requirements.txt -
运行Jupyter笔记本以查看分析过程和结果:
jupyter notebook
项目包含来自各种国际组织、政府和研究机构的政策文档,包括但不限于:
- 联合国气候变化框架公约(UNFCCC)
- 世界卫生组织(WHO)
- 各国政府发布的COVID-19应对政策
- 气候变化相关研究报告和政策建议
本项目采用MIT许可证。详情请参阅LICENSE文件。