数据资产共享(相似度加权词频)

「数据资产共享(相似度加权词频)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 67,314。 参考苑泽明等(2024)的方法,采用'种子词+Word2Vec相似词扩充'文本分析法,基于年报全文词频测算的企业数据资产共享水平指标(含加权主口径及对数、占比两

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数17
样本量67,314
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票简称] — 股票简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • WeightedFreq [加权词频] — 参考苑泽明等(2024,统计与决策)的方法,计算公式为:数据资产共享词典中各词在年报全文的精确词频乘以其与种子词'数据资产共享'的语义相似度权重后加总(种子词权重为1,其余29词权重为各自相似度),为数据资产共享水平(加权口径)的分子。用作中间变量。
  • RawFreq [原始词频] — 数据资产共享词典中30个词在年报全文出现的精确词频之和(不加权),用作对数与占比两个稳健性口径的分子。计算公式为:各词典词词频直接加总。
  • TotalWords [年报总词频] — 年报全文经中文分词后含中文的词条总数(排除纯英文与纯数字),为词频占比的分母。
  • DataAssetSharing [数据资产共享水平] — 参考苑泽明、宋雨倩、于翔(2024,统计与决策)的方法,采用'种子词+Word2Vec相似词扩充'文本分析法,计算公式为:sum(词典词词频×相似度权重)/年报总词频×100。用作研究变量,越大代表企业数据资产共享水平越高。
  • DataAssetSharingLn [数据资产共享水平(对数)] — 参考吴非等(2021,管理世界)的稳健性度量,计算公式为:ln(数据资产共享词典词总词频+1)。为主口径的对数替代度量,用作稳健性检验。
  • DataAssetSharingRatio [数据资产共享水平(占比)] — 参考吴非等(2021,管理世界)的稳健性度量,计算公式为:数据资产共享词典词总词频(不加权)/年报总词频×100。为主口径的不加权占比替代度量,用作稳健性检验。

常见问题

「数据资产共享(相似度加权词频)」是什么数据集?
数据资产共享(相似度加权词频),隶属数字化转型与人工智能。参考苑泽明等(2024)的方法,采用'种子词+Word2Vec相似词扩充'文本分析法,基于年报全文词频测算的企业数据资产共享水平指标(含加权主口径及对数、占比两
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:加权词频、原始词频、年报总词频、数据资产共享水平、数据资产共享水平(对数)、数据资产共享水平(占比)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,314 条观测。
数据是如何测算/获取的?
指标定义与计算方法 数据资产共享指企业将研发、生产、营销等不同价值链活动中生成的数据资产,以不同方式在不同场景交叉复用与跨主体连通。作为数据要素资产化的关键环节,其水平越高,越能驱动企业内外部利益相关方共同参与价值创造。由于数据资产共享难以直接观测,本指标参考苑泽明、宋雨倩、于翔(2024)的做法,沿用胡楠等(2021)提出的"种子词 + Word2Vec 相似词扩充"文本分析思路,从上市公司年度报告全文中识别数据资产共享相关词汇并计算其加权词频占比,从而对企业数据资产共享水平进行间接度量。 度量以"数据资产共享"为种子词,并将其语义相近、表意相同的扩充词一并纳入,构成一个共含 $30$ 个词条的关键词词典。每个词条带有一个与种子词的语义相似度权重 $weightn$,其中种子词自身权重取 $1$,其余 $29$ 个扩充词的权重为各自与种子词的余弦相似度(取值约介于 $0.51$ 至 $0.80$)。在实现上,先对年报全文进行中文分词(将词典中的多字词整体切分以避免长短词的重复计数),随后以"分词后词条与词典词精确相等"为命中标准统计每个词典词的精确词频。 核心指标数据资产共享水平 $Ds$ 定义为加权词频占年报总词频的比重(放大 $100$ 倍): $$Ds{it}=\dfrac{\sum{n} dictionaryword{n,it}\times weight{n}}{totalword{it}}\times 100$$ 其中 $dictionaryword{n,it}$ 为第 $n$ 个词典词在企业 $i$ 第 $t$ 年年报全文中的精确词频,$weightn$ 为该词与种子词的相似度权重,$totalword{it}$ 为该年报分词后含中文的词条总数(排除纯英文与纯数字)。$Ds$ 数值越大,表明企业数据资产共享水平越高。 为便于稳健性检验,另参考吴非等(2021)提供两种替代度量。其一为对数词频口径 $Ds1$,即不加权的词典词总词频加一后取自然对数: $$Ds1{it}=\ln\!\left(\textstyle\sum{n} dictionaryword{n,it}+1\right)$$ 其二为不加权占比口径 $Ds2$,即词典词总词频占年报总词频的比重(放大 $100$ 倍):$Ds2{it}=\big(\sum{n} dictionaryword{n,it}\big)/totalword{it}\times 100$。三种口径高度正相关,主口径 $Ds$ 与不加权占比 $Ds2$ 的相关系数接近 $1$。指标同时保留加权词频、不加权原始词频与年报总词频三个中间量,以支持机制分析与口径复核。 补充说明 样本覆盖全部 A 股上市公司,与原文献仅以制造业为样本不同,本指标做全行业测算以便于跨行业研究,原文献制造业样本可作对标基准。在制造业、原文献研究区间内,本指标分布与原文献报告的描述性统计高度一致(中位数量级吻合)。需注意两点:其一,词典包含若干通用信息化、连通性词汇,对信息技术、软件类企业的取值存在系统性偏高,跨行业回归宜引入行业固定效应;其二,受数据资源相关会计与披露制度变化影响,相关披露在近年出现结构性跃升,跨年度的水平不直接可比,趋势或断点分析建议引入年份固定效应。指标提供原始测算值,未作缩尾处理。 参考文献 - 苑泽明,宋雨倩,于翔.数据资产共享、供应链配置多元化与企业价值[J].统计与决策,2024,40(17):172-177. - 胡楠,薛付婧,王昊楠.管理者短视主义影响企业长期投资吗?——基于文本分析和机器学习[J].管理世界,2021,37(5):139-156,11. - 吴非,胡慧芷,林慧妍,等.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144,10.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。