企业绿色创新效率(三阶段DEA模型)
「企业绿色创新效率(三阶段DEA模型)」,覆盖 2015-2024 年,频率 年度,上市公司层级,含 28 个变量,样本量约 15,565。 按三阶段DEA模型测算的企业绿色创新效率。
| 时间跨度 | 2015-2024 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 28 |
| 样本量 | 15,565 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- GIEStaffInput [人力投入] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新投入维度的人力投入指标,计算公式为:研发人员数量/期末员工总数,取值为小数
- GIEFixedAssetInput [物质投入] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新投入维度的物质投入指标,对应原文的期末固定资产总额,因源数据不提供固定资产原值而取净额,计算公式为:期末固定资产净额/10000,单位为万元
- GIERDInput [资金投入] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新投入维度的资金投入指标,计算公式为:研发投入总额(费用化与资本化之和)/10000,单位为万元
- GIEGreenPatentOutput [技术产出] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新产出维度的技术产出指标,为企业当年按世界知识产权组织绿色专利清单识别的绿色专利申请量,单位为件
- GIEIncomeOutput [经济产出] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新产出维度的经济产出指标,对应原文的主营业务收入,因现行会计准则下不再单独披露主营业务收入总额而取营业收入,计算公式为:营业收入/10000,单位为万元
- GIEDigitalAssetOutput [数字化产出] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新产出维度的数字化产出指标,为财务报告附注无形资产明细中与数字化相关项目的金额合计,计算公式为:数字化无形资产金额/10000,单位为万元
- GIEGovTechSupport [政府支持力度] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新环境维度的政府支持力度指标,计算公式为:企业所在省份财政科技支出/该省财政支出总额,取值为小数
- GIEIndustryHHI [行业竞争强度] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新环境维度的行业竞争强度指标,为赫芬达尔-赫希曼指数,计算公式为:行业内各企业主营业务收入占该行业主营业务收入合计比重的平方和,在全市场同行业企业范围内计算,数值越大表示行业集中度越高、竞争越弱
- GIEEduSupport [教育支持程度] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新环境维度的教育支持程度指标,计算公式为:企业所在省份财政教育支出/该省财政支出总额,取值为小数
- GIETradeOpenness [开放程度] — 参考章秀等(2024,数量经济研究)的方法,三阶段DEA模型绿色创新环境维度的开放程度指标,计算公式为:企业所在省份货物进出口总额按当年美元兑人民币年均汇率折算后/该省地区生产总值,取值为小数
- GIECrste [绿色创新综合效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型,剔除外部环境因素与随机误差后的绿色创新综合技术效率,由调整后投入与原产出代入投入导向规模报酬不变的DEA模型求解得到,取值范围为0到1。用作研究变量,越大代表企业绿色创新的投入产出配置越接近当年效率前沿
- GIEVrste [绿色创新纯技术效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型,剔除外部环境因素与随机误差后的绿色创新纯技术效率,由调整后投入与原产出代入投入导向规模报酬可变的DEA-BCC模型求解得到,取值范围为0到1。用作研究变量,越大代表企业在既有规模下的绿色创新管理与技术水平越高
- GIEScale [绿色创新规模效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型,剔除外部环境因素与随机误差后的绿色创新规模效率,计算公式为:绿色创新综合效率/绿色创新纯技术效率,取值范围为0到1。用作研究变量,越大代表企业绿色创新的经营规模越接近最优规模
- GIECrsteStage1 [第一阶段综合效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型第一阶段结果,未剔除外部环境因素与随机误差的绿色创新综合技术效率,由原始投入产出代入投入导向规模报酬不变的DEA模型求解得到,取值范围为0到1,用作稳健性检验的替代度量
- GIEVrsteStage1 [第一阶段纯技术效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型第一阶段结果,未剔除外部环境因素与随机误差的绿色创新纯技术效率,由原始投入产出代入投入导向规模报酬可变的DEA-BCC模型求解得到,取值范围为0到1,用作稳健性检验的替代度量
- GIEScaleStage1 [第一阶段规模效率] — 参考章秀等(2024,数量经济研究)的三阶段DEA模型第一阶段结果,未剔除外部环境因素与随机误差的绿色创新规模效率,计算公式为:第一阶段综合效率/第一阶段纯技术效率,取值范围为0到1,用作稳健性检验的替代度量
- GIEFrontierDMU [前沿决策单元数] — 当年参与构建绿色创新效率前沿的企业数量。数据包络分析测算的是相对效率,决策单元数量不同的年份之间效率值不宜直接比较,该列供使用者判断跨年度可比性
常见问题
- 「企业绿色创新效率(三阶段DEA模型)」是什么数据集?
- 企业绿色创新效率(三阶段DEA模型),隶属ESG与绿色发展。按三阶段DEA模型测算的企业绿色创新效率。
- 该数据集的时间范围是?
- 覆盖 2015-2024 年。
- 包含哪些变量/指标?
- 共 28 个变量。核心指标包括:人力投入、物质投入、资金投入、技术产出、经济产出、数字化产出、政府支持力度、行业竞争强度、教育支持程度、开放程度、绿色创新综合效率、绿色创新纯技术效率、绿色创新规模效率、第一阶段综合效率、第一阶段纯技术效率、第一阶段规模效率、前沿决策单元数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 15,565 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 绿色创新兼具"创新"与"绿色"双重属性,企业在投入研发人员、固定资产与研发资金之后,既要获得绿色技术成果,也要实现经济回报。衡量这一过程的效率,关键不在于产出的绝对多少,而在于既定投入之下产出是否达到了可行的最优配置。数据包络分析正是为此设计:它不预设生产函数形式,而是由样本自身构造效率前沿,再以每个企业到前沿的距离度量其相对效率。 然而,企业的绿色创新效率并不完全由自身管理水平决定。地方政府的科技投入、所处行业的竞争格局、区域的人力资本条件与对外开放水平,都会系统性地影响投入的使用效率;同时,测算结果还会受到不可观测的随机因素干扰。若直接用传统数据包络分析的结果做比较,管理水平的高低会与外部环境和运气混杂在一起。三阶段数据包络分析的意义就在于把这三者分离开来,得到仅反映企业自身管理与技术水平的效率值。 本数据集的指标体系由三个维度构成。绿色创新投入维度包含人力、物质与资金三项:人力投入取研发人员数量占期末员工总数的比重,以相对量刻画人力资本的配置强度;物质投入取期末固定资产总额,因为厂房设备等实物资产在中长期持续发挥作用;资金投入取研发投入总额,兼含费用化与资本化两部分。绿色创新产出维度同样包含三项:技术产出取绿色专利申请量,之所以用申请量而非授权量,是因为授权环节存在审查周期与主观因素,申请量更能及时、完整地反映企业的绿色创新努力;经济产出取主营业务收入,反映创新活动最终的盈利转化;数字化产出取财务报告附注无形资产明细中与数字化相关项目的金额合计,刻画创新过程中形成的数字化资产积累。绿色创新环境维度包含四个不受企业自身控制、但对其效率有显著影响的因素:以所在地区财政科技支出占财政支出总额的比重衡量政府支持力度,以赫芬达尔—赫希曼指数衡量行业竞争强度,以所在地区财政教育支出占财政支出总额的比重衡量教育支持程度,以所在地区进出口总额占地区生产总值的比重衡量开放程度。 第一阶段采用投入导向、规模报酬可变的数据包络分析模型。对每一个企业年度观测 $i$,在当年全部样本企业构成的决策单元集合上求解 $$\min{\theta,\lambda}\ \theta \quad \text{s.t.}\quad \sum{k}\lambdak x{kj}\le \theta x{ij}\ (\forall j),\quad \sum{k}\lambdak y{kr}\ge y{ir}\ (\forall r),\quad \sum{k}\lambdak=1,\quad \lambdak\ge 0$$ 其中 $x{ij}$ 为第 $i$ 个企业的第 $j$ 项投入,$y{ir}$ 为其第 $r$ 项产出。最优解 $\theta^$ 即纯技术效率;去掉凸性约束 $\sumk\lambdak=1$ 后重新求解,得到规模报酬不变下的综合技术效率;两者之比 $Scale = Crste/Vrste$ 为规模效率。综合效率衡量投入产出配置的整体优劣,纯技术效率剥离规模因素后衡量管理与技术水平,规模效率则衡量企业经营规模与最优规模的接近程度。由最优权重可进一步得到投入松弛量 $$s{ij}=x{ij}-\sum{k}\lambdak^{}x{kj}$$ 它同时包含等比例压缩的径向部分与仍可继续削减的非径向部分,代表该企业在第 $j$ 项投入上的全部冗余。 第二阶段把投入松弛量视为环境因素、随机误差与管理无效率三者共同作用的结果,逐年度、对每一项投入分别建立类似随机前沿的回归 $$s{ij}=f(Zi;\betaj)+v{ij}+u{ij}$$ 其中 $Zi$ 为上述四个环境变量,$f$ 取线性形式,$v{ij}$ 为服从正态分布的随机误差项,$u{ij}$ 为非负的管理无效率项,参数由极大似然法估计,管理无效率项的条件期望按 Jondrow 等提出的方法分解,随机误差的估计值取复合残差与该条件期望之差。 第三阶段据此把所有企业调整到相同的外部环境与运气水平之下 $$X{ij}'=X{ij}+\left[\maxi f(Zi;\hat\betaj)-f(Zi;\hat\betaj)\right]+\left[\maxi \hat v{ij}-\hat v{ij}\right]$$ 第一个方括号把环境最有利者以外的企业投入相应上调,第二个方括号对运气做同样处理,因此环境优越或运气较好的企业投入被抬升得更多。将调整后的投入与原产出重新代入第一阶段的模型,即得到剔除外部环境与随机误差后的综合效率、纯技术效率与规模效率,这三项是本数据集的核心指标。第一阶段未经调整的三项效率一并保留,供使用者对照环境因素剥离前后的差异。 补充说明 - 样本口径:本数据集覆盖全部板块与全部行业,年份范围也较原文更宽,不预先施加回归样本常用的限制。已剔除被实施特别处理与退市风险警示的企业年度,以及资产负债率超过百分之百的观测,因为这些样本的财务结构会扭曲效率前沿的位置。数据包络分析要求投入产出均为正数,因此六项投入产出指标中任何一项缺失或非正的观测不进入测算,其中绿色专利申请量为零的企业年度被排除,这与原文的处理一致。受此约束,有绿色专利产出但研发投入、研发人员或数字化无形资产未完整披露的企业年度约占一半无法进入测算,缺口主要集中在研发信息尚未强制披露的早期年份,样本因而偏向已开展绿色创新且披露较完整的企业;建议在使用时加入行业与年份固定效应。 - 跨年度不可直接比较(使用本数据集最需注意的一点):数据包络分析度量的是相对效率,参与构建前沿的决策单元越多,前沿越靠外,平均效率越低。本数据集的样本量随研发信息披露的普及而逐年增长,实测年度平均效率与当年决策单元数量的对数呈近乎完全的负相关,前沿上的决策单元占比也随之大幅下降。这意味着效率值在年度之间的差异主要反映样本规模的变化,而非真实效率的变动。因此本数据集的效率值适用于年度内的横截面比较;若用于跨期分析,必须在回归中加入年份固定效应,不应直接解读效率值的时间趋势。数据集给出当年参与构建前沿的企业数量一列,供使用者核验这一点。 - 前沿范围与跨组可比性:原文的研究对象限定为制造业企业,本数据集覆盖全部行业,且同一年度内所有企业共用一个效率前沿。决策单元集合不同则效率值不同,因此制造业企业在本数据集中的取值与原文在制造业内部前沿下的取值不能直接等同,跨行业的生产技术差异也未加控制。使用者若需行业内可比的口径,可按行业代码筛选后另行测算,或在回归中控制行业固定效应。 - 环境变量的层级:原文将环境变量表述为"各地区",本数据集采用省级口径。判断依据是原文所报告的财政科技支出占比与财政教育支出占比的取值范围与省级数据基本吻合,且省级数据覆盖完整,不会因区域数据缺失而引入额外的样本选择。 - 变量替代:经济产出使用利润表的营业收入。上市公司自执行现行会计准则起不再单独披露主营业务收入总额,营业收入是其通行替代,对以主营业务为主的企业两者高度一致。物质投入使用固定资产净额,源数据不提供固定资产原值,该口径会低估累计折旧较多企业的实物资产规模。 - 第二阶段的方法性质:投入松弛量恒为非负且在效率前沿上的企业处取零,这与随机误差项服从正态分布的设定存在张力。实际估计中,随机误差的方差份额在多数年度被压向下界,无论采用半正态还是截断正态设定均是如此;此时投入调整主要由环境变量部分承担,第三阶段与第一阶段效率值的差异相应较小。这是该模型族在此类数据上的固有表现,而非某一年度的偶然结果。建议使用者同时观察两组效率值,并在关注环境因素剥离效果时参考环境变量对松弛量的解释力。 - 极端值处理:原文对模型中的连续变量做缩尾以控制极端值的影响。数据包络分析的效率前沿由样本中的极值点决定,个别投入被记为数量级异常偏小的观测会成为超效率前沿点,并系统性压低其余全部企业的效率值,因此本数据集逐年对六项投入产出指标做百分之一与百分之九十九的双侧缩尾。环境变量为省级宏观量,其极值反映真实的省际差异,未作缩尾;原文所报告的财政科技支出占比下界与未缩尾的省级数据一致,也支持这一处理。原文另有剔除新上市与新退市企业一项,因未给出明确的判定窗口,本数据集未施加。 - 行业竞争强度的计算范围:本数据集的赫芬达尔—赫希曼指数在全市场同行业企业的范围内计算,原文则在其受限的制造业样本内计算。样本内企业数量较少会系统性抬高该指数,因此本数据集该列的水平低于原文报告值,但更贴近真实的行业集中度。 - 其他局限:早期年份进入样本的企业其研发投入的披露口径与完整性不及后期,会使这些年度的资金投入被低估、效率被高估。绿色专利申请存在公开滞后,最近一至两个申请年的技术产出仍会随数据更新而上升。 参考文献 - 章秀,白雅萱,邵雨鑫,等.数字化转型对企业绿色创新效率的影响研究——以沪深A股上市制造业企业为例[J].数量经济研究,2024,15(4):114-133. - Fried H O, Lovell C A K, Schmidt S S, et al. Accounting for environmental effects and statistical noise in data envelopment analysis[J]. Journal of Productivity Analysis, 2002, 17(1-2): 157-174. - Banker R D, Charnes A, Cooper W W. Some models for estimating technical and scale inefficiencies in data envelopment analysis[J]. Management Science, 1984, 30(9): 1078-1092. - Jondrow J, Lovell C A K, Materov I S, et al. On the estimation of technical inefficiency in the stochastic frontier production function model[J]. Journal of Econometrics, 1982, 19(2-3): 233-238. - Aigner D, Lovell C A K, Schmidt P. Formulation and estimation of stochastic frontier production function models[J]. Journal of Econometrics, 1977, 6(1): 21-37.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。