企业经济政策不确定性(句内共现法)
「企业经济政策不确定性(句内共现法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 67,314。 衡量企业对经济政策不确定性的感知程度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 67,314 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- FEPU_W [词频经济政策不确定性感知] — 参考聂辉华, 阮睿, 沈吉(2020, 世界经济)的方法,计算公式为:100 * EPU句中不确定性词出现次数 / MD&A总中文字符数。EPU句指同时包含经济政策词(39个)和不确定性词(40个)的句子。用作研究变量,越大代表企业对经济政策不确定性的感知越强。单位:比例
- FEPU_S [句频经济政策不确定性感知] — 参考聂辉华, 阮睿, 沈吉(2020, 世界经济)的方法,计算公式为:100 * 经济政策不确定性句子数 / MD&A总句子数。用作研究变量,越大代表企业对经济政策不确定性的讨论比例越高。单位:%
- EPUSentCount [经济政策不确定性句数] — 参考聂辉华, 阮睿, 沈吉(2020, 世界经济)的方法,在MD&A文本中同时包含经济政策词和不确定性词的句子数量。单位:个
- TotalSentCount [总句数] — MD&A文本中的总句子数,以中文句号、感叹号、问号、分号为分句符。单位:个
- UncertainWordCount [不确定性词频] — 参考聂辉华, 阮睿, 沈吉(2020, 世界经济)的方法,在EPU句中不确定性词出现的总次数。单位:次
- TotalChars [总中文字符数] — MD&A文本中的中文字符总数。单位:个
- MDAExtracted [MDA提取标志] — 是否成功从年报中提取管理层讨论与分析章节(0=否,1=是)
常见问题
- 「企业经济政策不确定性(句内共现法)」是什么数据集?
- 企业经济政策不确定性(句内共现法),隶属信息环境。衡量企业对经济政策不确定性的感知程度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:词频经济政策不确定性感知、句频经济政策不确定性感知、经济政策不确定性句数、总句数、不确定性词频、总中文字符数、MDA提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,314 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在度量中国上市公司对经济政策不确定性的感知程度,其核心思想是通过分析上市公司年报中“管理层讨论与分析”(MD&A)章节的文本内容,捕捉企业在该部分讨论中与经济政策不确定性相关的表述。该方法借鉴了聂辉华等(2020)提出的“句内共现法”,即识别那些同时包含经济政策相关词汇和不确定性相关词汇的句子,并以此为基础构建量化指标。 首先,对年报MD&A文本进行预处理,统计其总句子数($TotalSentCount$)和总中文字符数($TotalChars$)。随后,根据聂辉华等(2020)构建的词典(包含39个经济政策词和40个不确定性词),对文本进行扫描。核心的中间变量是经济政策不确定性句数($EPUSentCount$),它被定义为MD&A中同时包含至少一个经济政策词和至少一个不确定性词的句子数量。在这些句子中,进一步统计所有不确定性词汇出现的总次数,得到不确定性词频($UncertainWordCount$)。 基于上述基础变量,构建两个核心研究指标。第一个是句频经济政策不确定性感知($FEPU\S$),其计算公式为: $$FEPU\S = 100 \times \frac{EPUSentCount}{TotalSentCount}$$ 该指标反映了在MD&A的全部论述中,涉及经济政策不确定性讨论的句子所占的比例,比例越高,表明企业对该议题的关注度越高。 第二个核心指标是词频经济政策不确定性感知($FEPU\W$),其计算公式为: $$FEPU\W = 100 \times \frac{UncertainWordCount}{TotalChars}$$ 该指标以文本长度为基准,衡量了在涉及经济政策不确定性的句子中,不确定性词汇出现的密集程度,数值越大,通常被认为企业感知到的不确定性强度越强。 补充说明 - 本数据集的构建以成功从年报中提取MD&A文本为前提,字段$MDAExtracted$标识了提取是否成功(1为成功,0为失败)。后续分析通常仅使用$MDAExtracted=1$的样本。 - 文本分句以中文句号、感叹号、问号和分号为分隔符。 - 经济政策词与不确定性词词典严格遵循聂辉华等(2020)的研究。 参考文献 - 聂辉华, 阮睿, 沈吉. 企业不确定性感知、投资决策和金融资产配置[J]. 世界经济, 2020, 43(6): 77-100.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。