风险披露模仿行为(LDA主题模型)

「风险披露模仿行为(LDA主题模型)」,覆盖 2005-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 29,365。 衡量上市公司年报风险信息披露中的同行模仿行为。

时间跨度2005-2025 年
数据频率年度
层级上市公司
变量数14
样本量29,365
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • ImiScore [模仿性主题得分] — 参考王成龙, 吴忧 (2024, 世界经济)的方法, 以全部上市公司风险信息为语料运行LDA主题模型(K=26), 计算公式为: 同行业-同年内被超过50%%的公司提及(theta>0.01)的模仿性主题的主题得分之和, 取值0-1, 越大代表风险披露模仿程度越高, 用作研究变量
  • Order [风险信息披露顺序] — 参考王成龙, 吴忧 (2024, 世界经济)的方法, 计算公式为: 公司在其所在行业-年内按年报披露日排序的先后顺序, 越大代表披露越晚
  • RiskTextLen [风险文本字数] — 从年报中提取的风险信息章节中文字符数。单位:个

常见问题

「风险披露模仿行为(LDA主题模型)」是什么数据集?
风险披露模仿行为(LDA主题模型),隶属信息环境。衡量上市公司年报风险信息披露中的同行模仿行为。
该数据集的时间范围是?
覆盖 2005-2025 年。
包含哪些变量/指标?
共 14 个变量。核心指标包括:模仿性主题得分、风险信息披露顺序、风险文本字数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 29,365 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在衡量上市公司在年度报告风险信息披露中存在的同行模仿行为。其核心思想是,如果同一行业内多家公司在同一年度披露的风险信息主题高度相似,则表明存在模仿性披露。研究借鉴文本挖掘中的潜在狄利克雷分布(Latent Dirichlet Allocation, LDA)主题模型方法,对年报风险章节文本进行分析。 首先,从上市公司年度报告中提取专门描述风险因素的章节文本,并计算其字符数(RiskTextLen)。随后,使用所有上市公司的风险文本构建语料库,并训练LDA主题模型。参考相关研究,模型的主题数K设定为26。对于每家公司-年度样本,LDA模型会输出其风险文本在各个主题上的概率分布(主题得分)。 为了识别“模仿性主题”,按中上协行业分类(制造业取二级代码前两位,其他行业取门类首位)和年份进行分组。在每个行业-年度组内,如果一个主题被超过50%的公司提及(即该公司在该主题上的得分大于0.01),则该主题被定义为该组别的模仿性主题。核心指标模仿性主题得分(ImiScore)的计算公式为: $$ \text{ImiScore}{i,t} = \sum{k \in M{j,t}} \theta{i,t,k} $$ 其中,$\text{ImiScore}{i,t}$ 代表公司$i$在$t$年度的风险披露模仿程度,$M{j,t}$ 表示公司$i$所属行业$j$在$t$年度识别出的所有模仿性主题的集合,$\theta{i,t,k}$ 代表公司$i$在$t$年度的风险文本在主题$k$上的LDA主题得分。该指标取值在0到1之间,数值越大,表明该公司风险信息披露的模仿程度越高。 此外,为控制信息披露顺序可能产生的影响,计算了风险信息披露顺序(Order)变量,即公司在所属行业-年度组内,按其年度报告实际披露日期进行排序所得的序号,序号越大代表披露时间越晚。数据集同时提供了公司注册地(省、市、区县)及行业分类等基本信息。 补充说明 - 样本范围为中国A股上市公司。 - 风险文本提取基于年报中特定章节的模式匹配逻辑。 - LDA主题模型的训练以前述提取的全部上市公司风险文本为语料。 参考文献 [1]王成龙,吴忧.年报风险信息披露模仿行为研究:基于LDA主题模型分析[J].世界经济,2024,47(11):183-202. [2]Blei D M, Ng A Y, Jordan M I. Latent Dirichlet allocation[J]. Journal of Machine Learning Research, 2003, 3(Jan): 993-1022.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。