前瞻性信息(Word2Vec种子扩展)

「前瞻性信息(Word2Vec种子扩展)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,305。 衡量上市公司年报中前瞻性信息的披露程度。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数19
样本量67,305
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • SeedFreq [种子词词频] — 参考许帅等(2025, 中国管理科学)的方法,30个前瞻性种子词(计划类/预期类/目标类)在MD&A中出现总次数。单位:次
  • ExpandFreq [扩展词词频] — 参考胡楠等(2021, 管理世界)的Word2Vec CBOW扩展方法,将30个种子词在MD&A语料训练的词向量空间中扩展后(195个词),扩展词在MD&A中出现总次数。单位:次
  • TotalWords [MD&A总词数] — jieba分词后MD&A章节的有效词数(最小词长2)。单位:个
  • FLInfo1 [前瞻性信息-词频占比] — 参考刘瑶瑶, 路军伟(2023, 外国经济与管理)的方法,计算公式为:扩展词词频/MD&A总词数,用作研究变量,越大代表前瞻性信息披露越多。单位:比例
  • FLInfo2 [前瞻性信息-对数] — 参考许帅等(2025, 中国管理科学)的方法,计算公式为:ln(1+扩展词词频),使用时需控制ln(MD&A总词数)
  • FLInfo3 [前瞻性信息-种子词占比] — 参考许帅等(2025, 中国管理科学)的方法,计算公式为:种子词词频/MD&A总词数,仅使用原始30个种子词,不含Word2Vec扩展词。单位:比例
  • MDAExtracted [MD&A提取标志] — 是否成功从年报中提取MD&A章节(0=否,1=是),失败时回退到全文
  • ExpandedDictSize [扩展词表大小] — Word2Vec扩展并剔除噪音后的最终词表大小。单位:个

常见问题

「前瞻性信息(Word2Vec种子扩展)」是什么数据集?
前瞻性信息(Word2Vec种子扩展),隶属信息环境。衡量上市公司年报中前瞻性信息的披露程度。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:种子词词频、扩展词词频、MD&A总词数、前瞻性信息-词频占比、前瞻性信息-对数、前瞻性信息-种子词占比、MD&A提取标志、扩展词表大小。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,305 条观测。
数据是如何测算/获取的?
指标定义与计算方法 前瞻性信息披露是上市公司管理层讨论与分析(MD&A)文本中,关于未来计划、预期和目标等非历史性信息的披露程度。为量化这一概念,本研究参考许帅等(2025)的种子词扩展方法,结合胡楠等(2021)的文本分析技术,构建了基于年报MD&A文本的前瞻性信息披露指标。其核心思路是,首先确定一组代表前瞻性信息的种子词,然后利用词向量模型在语料库中扩展出语义相近的词汇,形成更全面的前瞻性词汇表,最后通过统计这些词汇在文本中的出现频率来衡量前瞻性信息披露水平。 具体构建过程如下:首先,参考许帅等(2025)的研究,选取了30个前瞻性种子词,涵盖计划、预期和目标三类。其次,借鉴胡楠等(2021)的方法,使用连续词袋模型(CBOW)在MD&A语料库上训练词向量模型。然后,在词向量空间中,为每个种子词计算余弦相似度最高的前10个相似词,合并去重后形成扩展的前瞻性词汇表。最后,基于刘瑶瑶和路军伟(2023)的度量方法,统计词汇在特定年报MD&A文本中的出现情况。 基于上述过程,计算得到三个核心指标。$FLInfo1$ 为扩展词词频占比,计算公式为: $$FLInfo1 = \frac{ExpandFreq}{TotalWords}$$ 其中$ExpandFreq$为扩展后的前瞻性词汇在MD&A中出现的总次数,$TotalWords$为MD&A文本经分词后的总词数。该指标越大,代表前瞻性信息披露越多。$FLInfo2$为扩展词词频的对数形式,计算公式为$FLInfo2 = \ln(1 + ExpandFreq)$,在使用时通常需控制文本长度(如$\ln(TotalWords)$)。$FLInfo3$为种子词词频占比,计算公式为$FLInfo3 = \frac{SeedFreq}{TotalWords}$,其中$SeedFreq$为30个原始种子词在MD&A中出现的总次数,该指标仅基于原始词表,不含扩展词。 补充说明 - 文本来源为上市公司年报,优先提取“管理层讨论与分析”(MD&A)章节内容进行分析。若提取失败,则回退至使用年报全文进行分析,并通过$MDAExtracted$字段标识。 - 文本处理采用分词技术,仅保留词长不小于2的有效词汇进行统计。 - 前瞻性词汇表通过Word2Vec模型扩展得到,扩展后的词表大小记录于$ExpandedDictSize$字段。 参考文献 - 胡楠,薛付婧,王昊楠. 管理者短视主义影响企业长期投资吗?——基于文本分析和机器学习[J]. 管理世界,2021, 37(5): 139-156. - 刘瑶瑶, 路军伟. 前瞻性信息披露与分析师盈余预测——基于文本分析和机器学习的证据[J]. 外国经济与管理, 2023. - 许帅, 邵帅, 何贤杰. 业绩说明会前瞻性信息对分析师盈余预测准确性的影响——信口雌黄还是言而有征[J]. 中国管理科学, 2025.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。