风险信息披露(134风险词词频)

「风险信息披露(134风险词词频)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,314。 衡量上市公司年报中的风险信息披露水平。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数19
样本量67,314
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • RiskDis [风险信息披露水平] — 参考王雄元, 高曦(2018, 金融研究)和Kravet & Muslu(2013, RAST)的方法,计算公式为:100*全文风险关键词频数/全文总中文字符数。基于134个风险相关关键词(涵盖风险/不确定/波动/损失/不利/威胁/恶化/脆弱/困难等语义类别)在年报全文中的出现频率,衡量企业年报风险信息的披露水平。用作研究变量,越大代表风险披露水平越高。单位:%
  • RiskDisMDA [MD&A风险信息披露水平] — 参考王雄元, 高曦(2018, 金融研究)的方法,计算公式为:100*MD&A部分风险关键词频数/MD&A总中文字符数。仅在成功提取MD&A章节时计算(MDA提取标志=1),提取失败时为缺失值。单位:%
  • RiskFreq [全文风险词频数] — 年报全文中风险关键词出现的总次数(AC自动机最长匹配去重)。单位:个
  • RiskFreqMDA [MD&A风险词频数] — MD&A部分风险关键词出现的总次数(AC自动机最长匹配去重)。单位:个
  • TotalChars [全文总字数] — 年报全文中文字符总数。单位:个
  • TotalCharsMDA [MD&A总字数] — MD&A部分中文字符总数,MDA提取失败时为0。单位:个
  • DeltaRiskDis [风险披露变动] — 参考Kravet & Muslu(2013, RAST)的方法,计算公式为:当年风险信息披露水平减去上年风险信息披露水平,仅对连续年份计算(年份间隔>1时为缺失值)。用作研究变量,越大代表风险披露水平增加越多
  • MDAExtracted [MDA提取标志] — 是否成功从年报全文中提取MD&A章节(0=否,1=是)

常见问题

「风险信息披露(134风险词词频)」是什么数据集?
风险信息披露(134风险词词频),隶属信息环境。衡量上市公司年报中的风险信息披露水平。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:风险信息披露水平、MD&A风险信息披露水平、全文风险词频数、MD&A风险词频数、全文总字数、MD&A总字数、风险披露变动、MDA提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,314 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在衡量中国上市公司年度报告中的风险信息披露水平,其构建方法主要参考了王雄元和高曦(2018)以及Kravet和Muslu(2013)的研究。核心思路是通过统计年报文本中特定风险关键词的出现频率,来量化公司披露风险相关信息的程度。具体而言,构建了一个包含134个风险相关关键词的词库,这些关键词涵盖了“风险”、“不确定”、“波动”、“损失”、“不利”、“威胁”、“恶化”、“脆弱”、“困难”等语义类别。 基础变量包括从年报全文及“管理层讨论与分析”(MD&A)章节中提取的文本特征。其中,$RiskFreq$ 为年报全文中风险关键词出现的总次数,$TotalChars$ 为年报全文的中文字符总数。类似地,$RiskFreqMDA$ 和 $TotalCharsMDA$ 分别为MD&A章节中的风险词频和总字符数。MD&A章节的提取成功与否由二元变量 $MDAExtracted$ 标识(1为成功,0为失败)。 基于上述基础变量,计算两个核心的风险信息披露指标。第一个是全文风险信息披露水平 $RiskDis$,其计算公式为: $$RiskDis = 100 \times \frac{RiskFreq}{TotalChars}$$ 其中 $RiskFreq$ 为全文风险词频数,$TotalChars$ 为全文总中文字符数。该指标衡量了风险信息在整份年报中的相对密集程度。 第二个是MD&A章节的风险信息披露水平 $RiskDisMDA$,其计算公式为: $$RiskDisMDA = 100 \times \frac{RiskFreqMDA}{TotalCharsMDA}$$ 其中 $RiskFreqMDA$ 为MD&A部分风险词频数,$TotalCharsMDA$ 为MD&A部分总中文字符数。该指标仅在 $MDAExtracted = 1$ 时计算,用于衡量风险信息在关键叙述性章节的披露强度。 此外,为捕捉风险披露的动态变化,计算了风险披露变动指标 $DeltaRiskDis$,其值为公司当年 $RiskDis$ 与上年 $RiskDis$ 的差值,仅对连续年份进行计算。 补充说明 - 风险关键词的匹配采用AC自动机算法进行最长匹配并去重。 - MD&A章节的提取基于文本规则进行,若提取失败,则 $MDAExtracted$ 标记为0,且 $RiskDisMDA$、$RiskFreqMDA$、$TotalCharsMDA$ 均为缺失值($TotalCharsMDA$ 在原始数据中记为0)。 - $DeltaRiskDis$ 仅在公司连续两年均有 $RiskDis$ 数据时计算,若年份间隔大于1年,则该指标为缺失值。 参考文献 - Kravet T, Muslu V. Textual risk disclosures and investors’ risk perceptions[J]. Review of Accounting Studies, 2013, 18(4): 1088-1122. - 王雄元, 高曦. 年报风险披露与权益资本成本[J]. 金融研究, 2018.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。