年报内容相似性(LDA主题法)
「年报内容相似性(LDA主题法)」,覆盖 2001-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 66,656。 基于LDA主题模型度量企业年报全文与同行业其他企业年报的内容相似度。
| 时间跨度 | 2001-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 14 |
| 样本量 | 66,656 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 公司当年的证券简称(按年动态匹配, 反映历史更名)
- Year [年份] — 财务年度(年报所属年度)
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 公司当年中上协行业分类代码(如C39、J66; 动态按年匹配)
- IndustryName [行业名称] — 公司当年中上协行业分类名称(动态按年匹配)
- NumPeers [同行业可比企业数] — 参考陆瑶等(2025,经济研究)"同行业其他企业"口径, 计算公式为: 该公司当年所在中上协行业大类(制造业取行业代码前两位如C39->C3, 非制造业取首字母如J66->J)、同年度分组内除自身以外的企业数量。作为年报内容相似性余弦均值的样本规模(机制构件), 用作研究变量, 越大表示同行业可比同伴越多、相似性估计越稳健。
- DocTokenCount [年报文本词数] — 计算公式为: 该公司当年年报全文经分词、仅保留含中文字符的词、并经词典极值过滤(保留出现于不少于20份且不超过50%年报的词、词表上限10000)后纳入LDA词袋的词数。反映纳入主题建模的文本信息量; 因年报内容相似性与文本长度存在机械相关, 建议作为控制变量与之同时使用。
- Similarity [年报内容相似性] — 参考陆瑶等(2025,经济研究)的方法, 先用LDA主题模型(100个主题, 基于全样本年报全文训练)将企业当年年报全文表示为100维主题分布向量theta, 再在同中上协行业大类-年度分组内计算该向量与其他企业当年主题向量的两两余弦相似度均值。计算公式为: Similarity等于同行业同年其他企业cos(theta_i,theta_j)的平均值。取值范围[0,1], 用作研究变量, 越大代表企业年报披露内容与同行业同伴越趋同。注意: 该指标与年报长度、同行业企业数存在机械相关, 水平不宜跨年直接比较, 使用时建议加入年度固定效应并控制年报文本词数。
常见问题
- 「年报内容相似性(LDA主题法)」是什么数据集?
- 年报内容相似性(LDA主题法),隶属信息环境。基于LDA主题模型度量企业年报全文与同行业其他企业年报的内容相似度。
- 该数据集的时间范围是?
- 覆盖 2001-2025 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:同行业可比企业数、年报文本词数、年报内容相似性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 66,656 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业年度报告是公司向外部信息使用者披露经营、财务与战略信息的核心文本载体。同一行业内企业面临相似的经营环境与披露规范,其年报内容往往呈现一定程度的趋同;而当企业经营模式、业务结构或信息披露策略具有独特性时,其年报内容会与同业拉开距离。年报内容相似性正是用以刻画"企业当年年报披露内容在多大程度上与同行业其他企业趋同"的文本特征指标,可用于控制企业信息环境、披露风格或模板化程度等不可观测因素。 本指标参考陆瑶等(2025)的做法,借助主题模型将文本转化为可比较的低维语义向量,再以向量夹角度量内容接近程度。具体分三步。第一步,对企业当年年报全文做中文分词,保留含中文字符的词,并在全样本语料上做词频极值过滤(剔除过于罕见与过于普遍的词、限定词表规模),得到词袋表示。第二步,在全样本语料上训练潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)主题模型,将每篇年报表示为一个 $K$ 维主题分布向量 $\thetai=(\theta{i,1},\dots,\theta{i,K})$,其中 $\theta{i,k}\ge 0$、$\sumk \theta{i,k}=1$,表示该年报在第 $k$ 个潜在主题上的内容占比。LDA 是文本主题建模的奠基性方法(Blei et al., 2003),并被广泛用于年报等公司披露文本的内容结构刻画(Dyer et al., 2017)。第三步,在"同行业—同年度"分组内,计算目标企业主题向量与组内其他每一家企业主题向量的余弦相似度,并取均值: $$ \text{Similarity}{i,t}=\frac{1}{N{g,t}-1}\sum{j\in g,\ j\neq i}\frac{\theta{i,t}\cdot\theta{j,t}}{\lVert\theta{i,t}\rVert\,\lVert\theta{j,t}\rVert} $$ 其中 $g$ 为企业 $i$ 在第 $t$ 年所属的行业分组,$N{g,t}$ 为该分组内企业数。由于主题分布向量各分量非负,余弦相似度取值于 $[0,1]$;取值越大,表示企业年报内容与同行业其他企业越趋同。行业归属采用动态匹配,按企业当年实际所属行业大类划分(制造业按行业代码前两位、非制造业按首字母聚合)。 补充说明 样本为上市公司年度报告全文,每个"企业—年度"保留信息最完整的一份主报告(排除报告摘要与外文版本),并剔除 B 股镜像代码以避免同一主体在分组内重复计数。为保证主题向量的可靠性,剔除有效中文词数过少或经词表过滤后在表词过少(主题向量退化为噪声)的残缺/解析失败文本;同一行业—年度分组内若不存在其他可比企业,则该观测的相似性缺失。 需特别提示该指标的两点机械性质,使用时应予以控制:其一,余弦相似度对文本长度敏感,较短的年报激活的主题较少、主题向量更集中,从而系统性地呈现更高的相似度,本指标与年报文本词数存在负向机械相关;其二,分组规模越大、组内企业越异质,对全部同业取均值的相似度越低,本指标与同行业企业数亦存在负向机械相关。因此该指标的绝对水平不宜跨年度直接比较,实证中建议加入年度(或行业×年度)固定效应,并同时控制年报文本词数;亦可在行业—年度分组内做标准化后使用。指标在企业层面具有很强的跨年持续性,反映其捕捉的是相对稳定的企业披露内容特征。 参考文献 - 陆瑶, 施函青, 周欣怡. 中国企业数字技术风险暴露对企业价值的影响——来自大语言模型的文本分析证据[J]. 经济研究, 2025, 60(2): 73-89. - Loughran T, McDonald B. Textual analysis in accounting and finance: A survey[J]. Journal of Accounting Research, 2016, 54(4): 1187-1230. - Dyer T, Lang M, Stice-Lawrence L. The evolution of 10-K textual disclosure: Evidence from latent Dirichlet allocation[J]. Journal of Accounting and Economics, 2017, 64(2-3): 221-245. - Blei D M, Ng A Y, Jordan M I. Latent Dirichlet allocation[J]. Journal of Machine Learning Research, 2003, 3: 993-1022.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。