企业数字化与绿色化耦合协调

「企业数字化与绿色化耦合协调」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 68,865。 参考王守海和郭英栋(2026,科研管理)的方法,将企业数字化转型与绿色化转型视为两个子系统,分别以年报数字化转型关键词词频的对数(吴非等,2021)和年报绿色化

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数18
样本量68,865
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年报对应的会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • DigitalRaw [数字化转型原始度量] — 参考吴非等(2021,管理世界)的方法,计算公式为:对企业年报全文中数字化转型相关关键词(涵盖人工智能技术、大数据技术、云计算技术、区块链技术、数字技术运用五个维度)的出现次数加总,再加1后取自然对数。数值越大表示企业年报所披露的数字化转型程度越高。
  • GreenRaw [绿色化转型原始度量] — 参考周阔等(2022,管理科学)的方法,计算公式为:对企业年报全文中绿色化转型相关关键词(涵盖宣传倡议、战略理念、技术创新、排污治理、监测管理五个维度)的出现次数加总,再加1后取自然对数。数值越大表示企业年报所披露的绿色化转型程度越高。
  • U1Digital [数字化子系统标准化值] — 参考王守海和郭英栋(2026,科研管理)的方法,计算公式为:(数字化转型原始度量-全样本最小值)/(全样本最大值-全样本最小值),即对数字化转型原始度量作极差标准化。耦合协调度模型要求两个子系统取值处于相同量纲区间,故在计算耦合协调度前先作此标准化,取值范围为0至1。
  • U2Green [绿色化子系统标准化值] — 参考王守海和郭英栋(2026,科研管理)的方法,计算公式为:(绿色化转型原始度量-全样本最小值)/(全样本最大值-全样本最小值),即对绿色化转型原始度量作极差标准化。耦合协调度模型要求两个子系统取值处于相同量纲区间,故在计算耦合协调度前先作此标准化,取值范围为0至1。
  • CouplingDegree [耦合度] — 参考王守海和郭英栋(2026,科研管理)的方法,计算公式为:2乘以数字化子系统标准化值与绿色化子系统标准化值乘积的平方根,再除以两者之和;当两个子系统标准化值同时为0时该指标取0。该指标度量数字化与绿色化两个子系统相互作用的强度,取值范围为0至1,数值越大表示两个子系统的发展水平越接近、相互作用越强。
  • ComprehensiveDev [综合发展水平] — 参考王守海和郭英栋(2026,科研管理)的方法,计算公式为:0.5乘以数字化子系统标准化值,加上0.5乘以绿色化子系统标准化值。原文认为数字化转型与绿色化转型同等重要,故两个子系统权重均取0.5。该指标度量数字化与绿色化的整体发展水平,取值范围为0至1。
  • DigitalGreenCoordination [数字化与绿色化耦合协调度] — 参考王守海和郭英栋(2026,科研管理)的方法,计算公式为:耦合度与综合发展水平乘积的平方根。该指标同时刻画数字化与绿色化两个子系统的协同匹配程度和整体发展水平,取值范围为0至1。用作研究变量,越大代表企业数字化转型与绿色化转型的协调匹配程度越高。

常见问题

「企业数字化与绿色化耦合协调」是什么数据集?
企业数字化与绿色化耦合协调,隶属数字化转型与人工智能。参考王守海和郭英栋(2026,科研管理)的方法,将企业数字化转型与绿色化转型视为两个子系统,分别以年报数字化转型关键词词频的对数(吴非等,2021)和年报绿色化
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:数字化转型原始度量、绿色化转型原始度量、数字化子系统标准化值、绿色化子系统标准化值、耦合度、综合发展水平、数字化与绿色化耦合协调度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 68,865 条观测。
数据是如何测算/获取的?
指标定义与计算方法 数字化转型与绿色化转型是当前企业战略变革的两条主线。既有研究多沿单一视角考察其中一条主线的经济后果,而在"双碳"目标与数字经济并行推进的背景下,两者并非彼此独立:数字技术的嵌入可以降低能耗监测与排放核算的成本,从而推动绿色化;绿色化转型带来的合规压力与改造成本又会反过来驱动企业加快数字化。因此,真正决定企业转型成效的往往不是某一维度的绝对水平,而是两者是否协同匹配、同步推进。本数据集参考王守海和郭英栋(2026)的做法,把企业数字化与绿色化视为两个相互作用的子系统,借用物理学中的耦合协调度模型,刻画二者协同匹配的程度。 两个子系统的水平均从上市公司年度报告全文的关键词披露强度中提取。数字化子系统 $U1$ 参考吴非等(2021)的词频法,统计年报全文中数字化转型相关关键词的出现次数,词表覆盖人工智能技术、大数据技术、云计算技术、区块链技术与数字技术运用五个维度;绿色化子系统 $U2$ 参考周阔等(2022)的词频法,统计年报全文中绿色化转型相关关键词的出现次数,词表覆盖宣传倡议、战略理念、技术创新、排污治理与监测管理五个维度。两者均先按维度加总得到当年关键词总词频,再加 1 后取自然对数,即 $U1=\ln(\text{数字化关键词总词频}+1)$、$U2=\ln(\text{绿色化关键词总词频}+1)$。加 1 是为了让当年未出现任何相关关键词的企业年仍可取对数并取值为零,取对数则用于压缩长尾、削弱少数企业词频畸高的影响。 耦合协调度模型要求两个子系统的取值处于相同且有界的量纲区间,因此在代入模型之前先对 $U1$ 与 $U2$ 分别作极差标准化,即用该观测值减去全样本最小值,再除以全样本极差,使标准化后的子系统值落在 0 到 1 之间。由于两个原始度量的最小值均为零(存在完全未披露相关关键词的企业年),标准化不会改变观测之间的相对次序,也不会把零披露的企业年抬升为正值。 在标准化的基础上依次计算三个量。首先是耦合度 $C$,度量两个子系统相互作用的强度: $$C = \frac{2\sqrt{U1 U2}}{U1 + U2}$$ $C$ 取值介于 0 与 1 之间,其数值仅取决于两个子系统的相对比例而与绝对水平无关:当两者水平完全相等时 $C$ 达到最大值 1,当其中任一子系统取值为零时 $C$ 为 0;两者同时为零时分母亦为零,此时按原文规定直接令 $C=0$。正因为 $C$ 只反映"是否匹配"而不反映"水平高低",单独使用会把两个子系统都极低但恰好相等的企业误判为高度协同,故还需引入综合发展水平 $T$: $$T = aU1 + bU2$$ 其中权重满足 $a+b=1$。本数据集沿用原文设定,认为数字化转型与绿色化转型同等重要,故取 $a=b=0.5$,即 $T$ 为两个标准化子系统值的算术平均,反映企业在两条主线上的整体推进水平。 最终的耦合协调度由耦合度与综合发展水平的几何平均给出: $$Coordination = \sqrt{C \times T}$$ 取几何平均意味着两个因子缺一不可:只有当两个子系统既相互匹配($C$ 高)又都达到较高水平($T$ 高)时,耦合协调度才会高;任一因子接近零都会把结果拉向零。该指标取值介于 0 与 1 之间,数值越大表示企业数字化转型与绿色化转型的协调匹配程度越高。数据集同时输出两个子系统的原始度量、标准化后的子系统值以及耦合度与综合发展水平,便于使用者追溯核心指标的形成过程,或在机制检验中单独使用其中某一构件。 补充说明 - 样本口径:本数据集按全集交付,覆盖全部 A 股上市公司与全部可得年份,未预先施加原文回归样本所作的限定——原文将样本限定为专精特新上市企业、剔除 ST 与变量缺失样本并对连续变量作上下 1% 缩尾。这些限定服务于原作者的识别策略,使用者可按行业代码、年份及自有名单自行筛选,并按需缩尾。金融业未予剔除:本指标为文本披露度量,不涉及财务比率的跨行业可比性问题。 - 标准化基准:原文未说明极差标准化的基准样本范围,本实现取交付全集的单一最小值与最大值,以保留数字化与绿色化水平的真实时间趋势、使跨年度数值可比;若改为逐年标准化,每年都会被强制拉满至 0 到 1 区间,整体上升趋势将被抹除。实测多种标准化方案在原文口径子样本上的均值差异很小,口径选择对结论不敏感。由于最小值与最大值随数据更新重新取值,历史年份的标准化值会随之发生微小平移,这是耦合协调度模型的固有性质。 - 稳健性口径:原文的一项稳健性检验改用管理层讨论与分析章节的数字化关键词词频替换数字化分量后重算耦合协调度。本数据集仅提供主口径,未以其他文献的数字化度量替代,以避免跨论文的方法拼接。 - 方法性质:耦合度仅由两个子系统的相对比例决定,与绝对水平无关。在实际样本中它大多要么因某一子系统为零而取零、要么落在接近上界的平台区,居中取值较少,因此核心指标的排序与综合发展水平相当接近,耦合度对排序的边际贡献有限——这是耦合协调度模型的固有数学性质。若研究主张"协同匹配的作用不同于单纯数字化水平",建议同时汇报只放数字化、只放绿色化以及两者交乘的对照回归;核心指标与两个子系统原始度量存在构造性关联,不宜在同一回归中同时作为解释变量。 - 零值结构:按模型定义,任一子系统当年无相关关键词披露时核心指标即取零。样本中的零值以"有绿色化披露但无数字化披露"的企业年居多,双方均无披露者占比较小,因而分布在零处存在一个较大的质点。以普通最小二乘把它当连续解释变量会低估斜率,建议配合零值指示变量、两部模型或受限因变量模型,并注意早期年份数字化词汇尚未普及、零值占比明显更高。 - 其他局限:词频法以年报披露强度作为转型程度的代理,采用未除以篇幅的绝对词频,因此披露篇幅较长的企业其关键词绝对词频天然更高,该关联在近年有所走强,行业间的披露习惯差异也会进入度量;年报篇幅偏短的少数企业年存在文本截断或编码问题导致的零词频,未作干预;最新一个年度的语料收录可能尚未完全,该年度的绿色化词频与年报篇幅较上一年有所回落,使用时可作剔除与保留的对照检验。 参考文献 [1]王守海,郭英栋.数字化与绿色化耦合协调对专精特新企业高质量创新的影响研究[J].科研管理,2026,47(6):44-54. [2]吴非,胡慧芷,林慧妍,等.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144+10. [3]周阔,王瑞新,陶云清,等.企业绿色化转型与股价崩盘风险[J].管理科学,2022,35(6):56-69.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。