简要说明:这是目前关于政府工作报告文本分析最全量、最系统的数据集。共涉及45800多份原始文本,其中:国家级=58份、省级=839份、市级=7977份、区县级=36937份。我们致力于为正式用户提供更系统、更全量的数据支持,助力社科学者拓展科研边界与学术创新。
一、背景介绍
政府工作报告是各级政府部门发布的权威政策文本、是宏观经济与社会发展的一手数据源,覆盖经济、产业、民生、科技、生态、治理等全领域,在社会科学、交叉学科的研究中均具备极高科研价值。补充优势。权威性强:官方定稿,零信息失真,学术引用认可度极高;连续性完整:历年报告可形成长时序面板数据,适合长周期研究。覆盖面广:贯通宏观-中观-微观。适配绝大多数人文社科、交叉学科选题。中国社科投研数据平台(CNSSIRD数据库)非常重视对各级政府相关数据的开发,为此,我们耗费巨大代价系统性地采集了中国各级政府发布的工作报告原始文本,目前已经获得原始报告超过45800多份、时间跨度于1954年-2026年。我们通过对将相关原始pdf文本转换为txt文本,以便作为本期所介绍的数据集开发的基础文本语料。二、数据详情
中国社科投研数据平台(CNSSIRD数据库)将充分利用中国各级政府发布的工作报告原始文本进行各类数据集的开发。例如:数据经济政府关注、新质生产力政府关注、数字化政府关注、绿色环保关注等等......本期我们充分结合相关学术研究的文献,选取了300多个代表数字经济政府关注的关键词语,再利用中国各级政府发布的工作报告原始文本进行词频统计,获得数字经济关键词频总量并进行对数化处理,获得结果可用于衡量各地区政府对于数字经济的重视程度或关注程度,助力我们的正式用户开展更多学术研究。
数据预览
我们已经完成中国各级政府数字经济关注程度的数据开发,展示如下所示。由于涉及的关键词语为300多个,页面太宽无法完整展示。这里仅展示部分统计结果与词频分布供预览。
三、注意事项
D1、本期介绍数据集的计算结果与词频分布,将会发布于中国社科投研数据平台(CNSSIRD数据库)专业版,采购专业版会员即可免费使用。接下来我们还将陆续按照同样原理计算并发布其他更多专业数据集。
D2、本数据整体跨于1954年-2026年,每个地区所披露政府工作报告的起始时间不同。为了方便大家更好地了解本数据,我们将各个年度的样本量整理为下表所示的分布。
D3、并非全部政府部分都披露自身的全部年度的政府工作报告文本,因此尽管我们已经耗费巨大代价进行逐一收集,但仍存在部分政府工作报告文本缺失的情况,这些都是正常的客观情况。即便如此,这也是目前最全面、最系统的政府工作报告文本库,足够符合科研需求。未来,我们还会持续更新整个数据库的文本语料,尤其是继续整理2026年的政府工作报告文本。