数据要素文本指数(Word2Vec法)

「数据要素文本指数(Word2Vec法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 67,314。 衡量上市公司年报中数据要素相关信息的披露程度。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数17
样本量67,314
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票简称] — 股票简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • DETI [数据要素文本指数] — 参考王璐璐, 凌爱凡, 黄飞鸣(2025, 系统工程理论与实践)的方法,以"数据要素/数据资产/数据资源"为核心词在年报语料库训练Word2Vec模型获取13个扩展词的余弦相似度权重,计算公式为:sum(关键词词频*余弦相似度)/年报中文字符总数*10000。用作研究变量,越大代表年报中数据要素信息含量越高
  • FreqCore [核心词词频] — 3个核心词(数据要素/数据资产/数据资源)在年报全文中的出现次数。单位:次
  • FreqExpanded [扩展词词频] — 13个Word2Vec扩展词(数据管理/数据模型/数据共享等)在年报全文中的出现次数。单位:次
  • FreqTotal [总关键词词频] — 核心词与扩展词的总出现次数,计算公式为:FreqCore + FreqExpanded。单位:次
  • TotalChars [年报中文字符总数] — 年报全文中CJK字符总数,用作DETI计算的分母。单位:个
  • DETIRaw [未加权数据要素词频比率] — 参考王璐璐等(2025)的方法,不使用相似度加权的数据要素关键词频率指标,计算公式为:FreqTotal/TotalChars*10000

常见问题

「数据要素文本指数(Word2Vec法)」是什么数据集?
数据要素文本指数(Word2Vec法),隶属数字化转型与人工智能。衡量上市公司年报中数据要素相关信息的披露程度。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:数据要素文本指数、核心词词频、扩展词词频、总关键词词频、年报中文字符总数、未加权数据要素词频比率。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,314 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在构建衡量上市公司年报中数据要素信息含量的文本指标。数据要素作为新型生产要素,其相关信息在年报中的披露程度反映了企业对数据资源的重视和利用水平。参考王璐璐等(2025)的方法,采用基于Word2Vec模型的文本分析方法,通过语义扩展和加权词频来构建核心指标。 首先,确定“数据要素”、“数据资产”和“数据资源”三个核心关键词。随后,利用上市公司年报语料库训练Word2Vec模型(采用CBOW架构,词向量维度为200,上下文窗口大小为5),以捕捉词语间的语义关联。通过计算与核心词的平均词向量之间的余弦相似度,筛选出相似度大于2/3的13个语义扩展词(如“数据管理”、“数据模型”等),并获取其对应的余弦相似度作为权重。 基于此,计算核心指标——数据要素文本指数(DETI)。该指标为加权关键词频率,其计算公式为: $$DETI = \frac{\sum{i=1}^{N} (Freqi \times Simi)}{TotalChars} \times 10000$$ 其中$Freqi$为第$i$个关键词(包括3个核心词和13个扩展词)在年报全文中的出现次数,$Simi$为该关键词与核心词的平均词向量之间的余弦相似度,$TotalChars$为年报全文中的中文字符总数。该指标越大,表明年报中与数据要素相关的信息含量越高。 为提供更全面的分析视角,数据集同时提供了多个中间及衍生变量。$FreqCore$为三个核心词的总出现次数,$FreqExpanded$为13个扩展词的总出现次数,$FreqTotal$为所有关键词的总出现次数(即$FreqCore$与$FreqExpanded$之和)。此外,还计算了未加权的数据要素词频比率$DETIRaw$,其公式为$FreqTotal / TotalChars \times 10000$,用于与加权指标$DETI$进行对比分析。 补充说明 - 计算$DETI$时,分母为年报全文的中文字符总数,而非分词后的总词数。 - 由于分母定义与原始文献可能存在差异,本数据集计算的$DETI$数值与原文结果存在约1.6倍的系统性缩放,但这不影响其在横截面排序和回归分析中的有效性。 参考文献 [1]王璐璐,凌爱凡,黄飞鸣.企业年报中数据要素信息含量的价值效应——基于融资约束的视角[J/OL].系统工程理论与实践,2025[2026-03-04].https://link.cnki.net/urlid/11.2267.N.20251022.1710.002.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。