MD&A信息含量(Hanley残差法)

「MD&A信息含量(Hanley残差法)」,覆盖 2001-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 66,767。 衡量上市公司年报管理层讨论与分析(MD&A)章节的信息含量。

时间跨度2001-2025 年
数据频率年度
层级上市公司
变量数16
样本量66,767
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • InfoContent [MD&A信息含量] — 参考孟庆斌等(2017, 中国工业经济)的方法,借鉴Hanley & Hoberg (2010, RFS)的思路,计算公式为:将MD&A文本词频向量L1标准化后,对行业均值向量和市场均值向量做OLS回归,信息含量等于残差向量各维度绝对值之和sum(|e|)。用作研究变量,越大代表MD&A中独特信息越多
  • StdContent [标准信息权重] — 参考孟庆斌等(2017, 中国工业经济)的方法,计算公式为:OLS回归中行业系数a1与市场系数a2之和,越大代表MD&A中标准化(共有)信息比重越高
  • InfoContentLn [MD&A信息含量对数] — 计算公式为:ln(MD&A信息含量+1),对信息含量取自然对数以缓解右偏
  • MDAExtracted [MD&A提取标志] — 是否成功提取MD&A章节(0=否,1=是),建议研究时过滤MD&A提取标志=1的样本
  • MDAWordCount [MD&A词数] — MD&A章节经jieba分词后的词数,建议在回归中控制ln(MD&A词数)。单位:个

常见问题

「MD&A信息含量(Hanley残差法)」是什么数据集?
MD&A信息含量(Hanley残差法),隶属信息环境。衡量上市公司年报管理层讨论与分析(MD&A)章节的信息含量。
该数据集的时间范围是?
覆盖 2001-2025 年。
包含哪些变量/指标?
共 16 个变量。核心指标包括:MD&A信息含量、标准信息权重、MD&A信息含量对数、MD&A提取标志、MD&A词数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 66,767 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在度量中国上市公司年报中“管理层讨论与分析”(MD&A)章节的信息含量,其核心思想源于Hanley & Hoberg (2010) 和孟庆斌等 (2017) 的研究。该方法将MD&A文本中与行业或市场普遍信息重复的部分视为“标准信息”,而将超出这些共有信息的独特部分视为“增量信息”或“信息含量”。具体而言,信息含量通过衡量MD&A文本向量与行业、市场平均文本向量的偏离程度来量化。 计算过程首先从上市公司年报中提取MD&A章节的纯文本,并使用分词工具进行分词,构建词频向量。随后,对词频向量进行L1标准化(即每个维度的词频除以总词数),得到标准化向量 $Normi$,代表第 $i$ 家公司的MD&A文本特征。对于每一年度,按中上协行业分类(制造业取二级代码前两位,其他行业取门类首位)分组,计算行业内所有公司标准化向量的均值,得到行业均值向量 $Norm\Ind$;同时计算全市场所有公司标准化向量的均值,得到市场均值向量 $Norm\Mkt$。 核心计算步骤是对每家公司的标准化向量 $Normi$ 在每一个词维度 $d$ 上,分别对行业均值向量 $Norm\Ind$ 和市场均值向量 $Norm\Mkt$ 的对应维度进行横截面OLS回归: $$Normi[d] = a0 + a1 \times Norm\Ind[d] + a2 \times Norm\Mkt[d] + e[d]$$ 其中,$a1$ 和 $a2$ 分别为行业和市场向量的回归系数,$e[d]$ 为残差。该回归旨在剥离文本中可由行业和市场共性解释的部分。 最终,MD&A信息含量 ($InfoContent$) 定义为所有词维度上回归残差绝对值之和: $$InfoContent = \sum{d} |e[d]|$$ 该值越大,表明MD&A文本中包含的、区别于行业和市场共性的独特信息越多。为缓解其分布的右偏性,同时计算其自然对数值 MD&A信息含量对数 ($InfoContentLn$),即 $ln(InfoContent + 1)$。 此外,标准信息权重 ($StdContent$) 定义为回归系数 $a1$ 与 $a2$ 之和,即 $StdContent = a1 + a2$。该指标反映了MD&A文本中标准化(共有)信息的相对比重。 补充说明 - 研究样本建议筛选 MD&A提取标志 ($MDAExtracted$) 等于1的观测值,以确保分析基于成功提取的MD&A文本。 - 在实证分析中,建议对 MD&A词数 ($MDAWordCount$) 取自然对数后作为控制变量纳入模型。 参考文献 - Hanley K W, Hoberg G. The information content of IPO prospectuses[J]. Review of Financial Studies, 2010, 23(7): 2821-2864. - 孟庆斌, 杨俊华, 鲁冰. 管理层讨论与分析披露的信息含量与股价崩盘风险——基于文本向量化方法的研究[J]. 中国工业经济, 2017(12): 132-150.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。