数据资产与人力资本协同(词频耦合协调度)
「数据资产与人力资本协同(词频耦合协调度)」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 38,952。 以耦合协调度模型衡量企业数据资产与人力资本两种资源的协同程度。
| 时间跨度 | 2006-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 38,952 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- DA [数据资产水平] — 参考于翔等(2026,管理评论)的方法,以年报文本中数据资产相关词汇的密集程度衡量企业数据资产水平,计算公式为:年报全文中数据资产关键词出现的总次数/年报全文中文字符数*100。其中数据资产关键词表参考何瑛等(2024,中国工业经济)的220词数据资产词典(自用型161词与交易型59词)。与原文口径有三点差异需知悉:一是词典来源不同;二是本口径未对词汇作情感极性过滤,负向语境下的数据资产词汇同样计入分子;三是分母为年报全文中文字符数(逐字计数),而原文分母为分词后的总词频,故本口径取值的绝对水平低于原文口径,但因该差异近似同比例且后续要作标准化,主要影响水平而非排序。已剔除年报全文中文字符数不足20000的解析失败观测。值越大代表企业数据资产水平越高。单位:%
- HC [人力资本水平] — 参考于翔等(2026,管理评论)的方法,计算公式为:本科及以上学历员工人数/员工总人数*100,由本科学历占比与硕士及以上学历占比两项加总构成。已剔除本科占比被错误取整为100的观测,以及两项加总超过100的重复计数观测。值越大代表企业人力资本水平越高。单位:%
- DAs [数据资产标准化值] — 参考于翔等(2026,管理评论)的方法,对数据资产水平做极差标准化以消除量纲,计算公式为:(数据资产水平-全样本最小值)/(全样本最大值-全样本最小值),值域为[0,1]。作为耦合协调模型的投入项。研究者若需在特定子样本内复现,可用数据资产水平原始列重新标准化
- HCs [人力资本标准化值] — 参考于翔等(2026,管理评论)的方法,对人力资本水平做极差标准化以消除量纲,计算公式为:(人力资本水平-全样本最小值)/(全样本最大值-全样本最小值),值域为[0,1]。作为耦合协调模型的投入项。研究者若需在特定子样本内复现,可用人力资本水平原始列重新标准化
- Coupling [耦合度] — 参考于翔等(2026,管理评论)的方法,刻画数据资产与人力资本二者相互支撑的关联强度,计算公式为:2*根号(数据资产标准化值*人力资本标准化值)/(数据资产标准化值+人力资本标准化值),值域为[0,1]。二者标准化值越接近该值越大。需注意在权重各取0.5时该项在协同度中被约去,不对协同度构成独立贡献
- Coordination [协调指数] — 参考于翔等(2026,管理评论)的方法,用于避免数据资产与人力资本同时处于低水平时耦合度仍然偏高的问题,计算公式为:0.5*数据资产标准化值+0.5*人力资本标准化值,其中两项权重依据陶长琪和丁煜(2022,中国软科学)的设定各取0.5,值域为[0,1]
- Synergy [数据资产与人力资本协同度] — 参考于翔等(2026,管理评论)的方法,以耦合协调度衡量企业数据资产与人力资本两种资源的协同程度,计算公式为:根号(耦合度*协调指数),值域为[0,1]。用作研究变量,越大代表数据资产与人力资本协同程度越高。需注意在权重各取0.5时该式代数上等于数据资产标准化值与人力资本标准化值乘积的四次方根,故其对数与两个投入项的对数精确线性相关,不宜与二者的对数同时进入同一回归
- SynergyYearStd [数据资产与人力资本协同度(分年度标准化)] — 参考于翔等(2026,管理评论)的方法,将极差标准化由全样本口径改为按年度分组进行后,依同样公式重算得到的协同度,计算公式为:根号(按年度分组标准化后重算的耦合度*按年度分组标准化后重算的协调指数),值域为[0,1]。注意其耦合度与协调指数为分年度口径的中间量,与本数据集输出的耦合度、协调指数两列(全样本口径)不同,不可用输出列直接代入该式。用于检验结论对标准化窗口选择的敏感性,作为稳健性检验口径
常见问题
- 「数据资产与人力资本协同(词频耦合协调度)」是什么数据集?
- 数据资产与人力资本协同(词频耦合协调度),隶属数字化转型与人工智能。以耦合协调度模型衡量企业数据资产与人力资本两种资源的协同程度。
- 该数据集的时间范围是?
- 覆盖 2006-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:数据资产水平、人力资本水平、数据资产标准化值、人力资本标准化值、耦合度、协调指数、数据资产与人力资本协同度、数据资产与人力资本协同度(分年度标准化)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 38,952 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 数据要素已成为企业重要的新型生产要素,但数据本身缺乏自主判断力,其价值需要具备专业知识与分析能力的员工加以解读才能释放;反过来,高质量人才的决策也依赖数据提供客观依据。二者若相互割裂,企业容易陷入"数据冗余而洞察稀缺"的困境。本数据集据此刻画企业数据资产与人力资本两种稀缺资源的协同程度,参考于翔等 (2026, 管理评论) 的做法,采用耦合协调模型进行测度。 测度从两个基础变量出发。数据资产水平 $DA$ 以年报文本中数据资产相关词汇的密集程度衡量,计算公式为: $$DA = \frac{\text{年报全文中数据资产关键词出现的总次数}}{\text{年报全文中文字符数}} \times 100$$ 其中数据资产关键词表采用何瑛等 (2024, 中国工业经济) 构建的 220 词数据资产词典,由自用型数据资产 161 词与交易型数据资产 59 词两部分组成。人力资本水平 $HC$ 以员工学历结构衡量,计算公式为本科及以上学历员工人数占员工总人数的比重乘以 100,由本科学历占比与硕士及以上学历占比两项加总构成。 由于 $DA$ 与 $HC$ 的量纲不同(前者为词频占比,后者为百分数形式的人数占比),二者不能直接代入同一模型,需先做极差标准化以消除量纲。记标准化后的两个变量分别为 $DAs$ 与 $HCs$: $$DAs = \frac{DA - \min(DA)}{\max(DA) - \min(DA)}, \qquad HCs = \frac{HC - \min(HC)}{\max(HC) - \min(HC)}$$ 标准化基准为本数据集全部有效观测,两者值域均为 $[0,1]$。 在此基础上构建耦合协调模型。第一步计算耦合度 $C$,用以体现数据资产与人力资本相互支撑的关联强度,当二者标准化水平越接近时该值越大: $$C = \frac{2\sqrt{DAs \cdot HCs}}{DAs + HCs}$$ 第二步计算协调指数 $T$。由于较高的耦合度既可能出现在两者水平同时较高时,也可能出现在两者同时较低时,需引入反映综合发展水平的协调指数加以区分: $$T = \alpha \cdot DAs + \beta \cdot HCs$$ 其中待定系数满足 $\alpha + \beta = 1$,依据陶长琪和丁煜 (2022, 中国软科学) 的设定,两者的重要程度视为相当,故各取 $0.5$。 第三步得到核心指标,即数据资产与人力资本的协同度 $D$: $$D = \sqrt{C \cdot T}$$ 该值越大,代表企业数据资产与人力资本的协同程度越高。此外,考虑到极差标准化的结果依赖于标准化所用的样本范围,本数据集另提供一个稳健性口径:将标准化由全样本改为按年度分组进行,再依同样的三步重算,得到分年度标准化口径下的协同度,用于检验结论对标准化窗口选择的敏感性。 补充说明 - 样本口径:输出全行业全部可得年份的企业年观测,不预先施加原文回归样本的限制(年份区间、剔除 ST 与 PT 状态企业、剔除金融行业、缩尾),由研究者按研究需要自行处理。金融行业的高学历占比显著高于其他行业,其协同度系统性偏高,作全行业回归时建议剔除或披露其不可比。 - 数据资产的替代口径:原文的数据资产测度借鉴苑泽明等 (2025, 南开管理评论),其词典经自动短语挖掘扩展并征询专家意见构建,且对词汇作情感极性过滤后仅计入正向与中立情感的词频,分母为分词后的总词频。该词典未随文公开,无法忠实复现,故改用同一文献脉络内公开可复现的何瑛等 (2024) 数据资产词典(该文为原文的参考文献之一),计算形式同为词频占比乘以 100。三点差异:词典来源不同;未作情感极性过滤,使分子偏高;分母采用年报中文字符数(逐字计数)而非分词后的词频,因中文词条平均长度大于一字,该口径的分母系统性偏大。第三点对各观测近似同比例,主要影响绝对水平而非排序;第二点则与语境相关,对不同企业的影响并不一致。 - 标准化的性质:原文未指明标准化方法与基准样本,此处采用耦合协调度文献通行的极差标准化。由于两个投入项的最小值都远小于各自的最大值,该变换近似于纯粹的尺度变换,而协同度是二者的四次方根乘积,因此标准化基准的选择只改变协同度的绝对水平,不改变排序,也不改变变异系数——协同度均值与原文报告值的比较并不构成有效的口径校准。研究者若需在特定子样本内复现,可用输出的两个原始列在该子样本内重新标准化,为此数据集同时保留了标准化前后的四个中间变量。 - 数据清洗:剔除年报文本解析失败的观测(以年报中文字符数下限为门槛,长度正常而确未提及任何数据资产词汇者属真实的零披露,不受此门槛剔除);要求本科学历占比非缺失,并剔除该占比被错误取整为 100 的解析错误观测,以及本科与硕士两项加总超过 100 的重复计数观测——后者在定义上不可能出现,且其真值不可知,故整体剔除而非截断。 - 测度的固有性质:当两个权重各取 0.5 时,协同度在代数上恒等于两个标准化投入项乘积的四次方根。由此产生三点后果:耦合度在核心指标中被完全约去,不构成独立贡献,其输出仅作为模型构件;该测度无法区分"均衡的协同"与"两个水平的乘积",两个投入项严重失衡与完全均衡但乘积相同的企业,其协同度完全相同;协同度的对数与两个投入项的对数精确线性相关,不宜与二者的对数同时进入同一回归,且协同度与人力资本水平高度相关,与员工学历结构类控制变量并用时须检查共线性。 - 其他局限:本数据集协同度的变异系数低于原文报告值,该差异不受标准化尺度影响,其根源在于所用词典在几乎每份年报中都会命中、数据资产水平缺少接近零的左尾,故以"每一个标准差变动"表述的经济显著性不宜与原文直接对比。数据资产以年报文本披露强度为代理,反映企业谈论数据资产的程度,与其实际持有规模并非同一构念,且年报篇幅会同时影响分子与分母。相当比例的年报可得企业年因未披露学历结构而无法进入本数据集,且缺失并非随机。上游学历数据的披露口径在样本期内存在变动,涉及跨年比较时建议纳入年份固定效应。极差标准化必然把样本最小值映射为零,使取到最小值的个别观测协同度恰为零。 参考文献 - 于翔,于斌,田雨凡.数据资产与人力资本协同对企业战略变革的影响研究[J].管理评论,2026,38(6):165-177. - 苑泽明,于翔,李萌,等.数据资产促进了中国企业人力资本水平提升吗——基于文本分析法的经验证据[J].南开管理评论,2025,28(8):64-75. - 陶长琪,丁煜.数据要素何以成为创新红利?——源于人力资本匹配的证据[J].中国软科学,2022,(5):45-56. - 何瑛,陈丽丽,杜亚光.数据资产化能否缓解"专精特新"中小企业融资约束[J].中国工业经济,2024,(8):154-173.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。