MD&A文本相似度(TF-IDF余弦法)
「MD&A文本相似度(TF-IDF余弦法)」,覆盖 2002-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 61,105。 衡量上市公司管理层讨论与分析(MD&A)披露内容的年度修改程度。
| 时间跨度 | 2002-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 61,105 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- MDASimCos [MD&A余弦相似度] — 参考Brown & Tucker (2011, JAR)的方法,计算公式为:cos(TF-IDF_t, TF-IDF_{t-1}),即同一公司当年与上年MD&A的TF-IDF向量余弦相似度。用作研究变量,越大代表MD&A修改越少
- MDAModScore [MD&A修改程度] — 参考Brown & Tucker (2011, JAR)的方法,计算公式为:1 - MD&A余弦相似度。用作研究变量,越大代表MD&A修改越多,信息增量越大
- MDAExtracted [MD&A提取标志] — 是否成功提取管理层讨论与分析章节(0=否,1=是),MD&A提取标志=0时人工智能水平-MDA基于全文计算
- MDAWordCount [MD&A词数当年] — 当年MD&A章节jieba分词后的词数。单位:个
- MDAWordCountPrior [MD&A词数上年] — 上年MD&A章节jieba分词后的词数。单位:个
常见问题
- 「MD&A文本相似度(TF-IDF余弦法)」是什么数据集?
- MD&A文本相似度(TF-IDF余弦法),隶属信息环境。衡量上市公司管理层讨论与分析(MD&A)披露内容的年度修改程度。
- 该数据集的时间范围是?
- 覆盖 2002-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:MD&A余弦相似度、MD&A修改程度、MD&A提取标志、MD&A词数当年、MD&A词数上年。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 61,105 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在度量上市公司年度报告中管理层讨论与分析(MD&A)章节的文本修改程度,以反映管理层披露信息的增量变化。其核心思想源于Brown和Tucker(2011)的研究,即通过计算同一公司连续两年MD&A文本的相似度来评估管理层对披露内容的修改幅度。MD&A文本相似度越高(接近1),表明管理层对披露内容的修改越少,信息增量可能越小;反之,相似度越低,则表明修改越多,可能反映了公司经营环境或管理层认知发生了更大的变化。 具体计算过程如下:首先,从上市公司年度报告中提取MD&A章节的文本内容。随后,使用中文分词工具对文本进行分词处理。接着,基于整个语料库,采用词频-逆文档频率(TF-IDF)方法将文本向量化,其中词频(TF)采用子线性缩放(sublineartf=True)以降低高频词的影响。最后,对于每家公司在第t年和第t-1年的MD&A文本,计算其TF-IDF向量之间的余弦相似度,作为核心指标MDASimCos。 核心指标MDASimCos的计算公式为: $$MDASimCos = \cos(\mathbf{V}t, \mathbf{V}{t-1})$$ 其中$\mathbf{V}t$和$\mathbf{V}{t-1}$分别代表第t年和第t-1年MD&A文本的TF-IDF向量。 基于此,衍生出另一个研究变量MDAModScore,即MD&A修改程度,其计算公式为$MDAModScore = 1 - MDASimCos$。该指标越大,代表MD&A文本的修改越多,信息增量越大。 此外,数据集还包含辅助变量:MDAExtracted为MD&A提取标志,标识是否成功提取到MD&A章节;MDAWordCount和MDAWordCountPrior分别记录了当年和上一年MD&A章节经分词处理后的词数。 补充说明 - 仅对成功提取MD&A章节(即MDAExtracted=1)的样本计算文本相似度指标。 - 若未能成功提取MD&A章节(MDAExtracted=0),则相关文本指标(MDASimCos、MDAModScore、MDAWordCount、MDAWordCountPrior)为缺失值。 参考文献 - Brown S V, Tucker J W. Large-sample evidence on firms’ year-over-year MD&A modifications[J]. Journal of Accounting Research, 2011, 49(2): 309-346.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。