企业颠覆式绿色创新(CD指数加一法)

「企业颠覆式绿色创新(CD指数加一法)」,覆盖 1985-2025 年,频率 年度,上市公司层级,含 26 个变量,样本量约 98,449。 复现肖泽华、李青原、孙沛竹(2026, 财经论丛)的颠覆式绿色创新测度。

时间跨度1985-2025 年
数据频率年度
层级上市公司
变量数26
样本量98,449
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年份
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • GreenPatentCount [当年授权绿色专利数] — 企业当年申请且已获授权的绿色专利去重件数。绿色专利依据世界知识产权组织绿色专利分类清单按专利IPC分类号比对识别,含发明专利与实用新型,不含外观设计。该件数是颠覆式绿色创新指数在企业层面取算术平均时的分母,取0表示当年未成功申请绿色专利
  • GreenInventionCount [授权绿色专利中发明专利数] — 企业当年授权绿色专利中发明专利的件数,其余为实用新型。实用新型不经实质审查、不产生审查员引用记录,因而极少能追溯到技术前驱,其颠覆式绿色创新指数在获得引用时会机械地取到上界。本字段供使用者构造发明专利占比作为控制变量,或据以筛选子样本作稳健性检验
  • GreenPatentCountNarrow [窄口径授权绿色专利数] — 剔除以整子类形式收录的争议条目后,企业当年授权绿色专利的件数。计算公式为:在世界知识产权组织绿色专利分类清单中剔除电气测量、商业数据处理、石油裂化三个整子类条目(保留其下的具体条目),重新按专利IPC分类号比对识别后的件数。本字段与全口径件数之比可用于判断某企业年的绿色专利在多大程度上依赖争议条目进入样本,供稳健性检验使用
  • FocalWithPredCount [可追溯技术前驱的焦点专利数] — 当年授权绿色专利中能够查到后向引用(即技术前驱)的件数。参考Funk和Owen-Smith (2017, Management Science)的方法,颠覆性的判定需要比较后续专利对焦点专利及其技术前驱的引用方式,查不到技术前驱的专利其指数会机械地取到上界,本字段用于判断企业当年指数在多大程度上由可比较的引用关系支撑
  • CitedFocalCount [获得引用的焦点专利数] — 当年授权绿色专利中在公开后三年内至少获得一次引用的件数。计算公式为:对企业当年全部授权绿色专利,统计其中三年窗口内被引次数大于零的件数。该件数即触发加一处理的焦点专利数
  • FocalCitationCount [焦点专利被引次数合计] — 企业当年各授权绿色专利在公开后三年内被引次数之和。计算公式为:对每件焦点专利统计窗口内引用了该专利的后续专利去重件数m,再在企业当年全部焦点专利上求和。参考肖泽华等 (2026, 财经论丛)的方法,m即该文献引入的焦点专利重要性参数
  • NetworkSizeCount [引用网络规模合计] — 企业当年各授权绿色专利的引用网络规模之和。计算公式为:对每件焦点专利统计公开后三年内引用了该专利或其技术前驱(或两者)的后续专利去重件数n,再在企业当年全部焦点专利上求和。参考Funk和Owen-Smith (2017, Management Science)的方法,n是颠覆式创新指数的分母;n越小该指数取值越离散,跨企业比较时建议同时控制本字段
  • FocalLastPublicationYear [焦点专利最晚公开年] — 企业当年全部授权绿色专利中最晚的公开年份,当年无授权绿色专利时取0。三年引用窗口自焦点专利公开日起算,该年份越接近数据末期,窗口走完的程度越低。本字段供使用者按各自的研究设计自行设定引用窗口成熟度条件,不必受限于数据集内置的窗口完整标识
  • GCD [颠覆式绿色创新倾向性指数] — 参考肖泽华等 (2026, 财经论丛)的方法,计算公式为:先对企业当年每件授权绿色专利计算CD=(1/n)×Σ(-2×f×b+f),其中f在后续专利引用该焦点专利时取一否则取零,b在后续专利引用该焦点专利的技术前驱时取一否则取零,n为公开后三年内引用了该焦点专利或其技术前驱的后续专利去重件数;该专利被引次数不为零时在CD基础上加一得到专利层面指数,被引次数为零时取零;再按申请年份将专利层面指数算术平均至企业层面。取值范围0到2。用作研究变量,越大代表企业的绿色创新越倾向于颠覆既往技术演化路径
  • mGCD [考虑影响力的颠覆式绿色创新指数] — 参考肖泽华等 (2026, 财经论丛)的方法,计算公式为:企业当年每件授权绿色专利的颠覆式绿色创新指数与该专利在公开后三年内被引次数之积,再按申请年份算术平均至企业层面。该指数在倾向性之外同时计入影响程度。用作研究变量,越大代表企业颠覆式绿色创新的倾向性与影响力越强
  • GCD5 [五年窗口颠覆式绿色创新倾向性指数] — 参考肖泽华等 (2026, 财经论丛)稳健性测试的方法,计算公式与颠覆式绿色创新倾向性指数完全相同,仅将焦点专利被其他专利引用的观测区间由公开后三年扩展至公开后五年,以捕捉具有滞后性的引用关系。取值范围0到2。用作稳健性检验变量
  • mGCD5 [五年窗口考虑影响力的颠覆式绿色创新指数] — 参考肖泽华等 (2026, 财经论丛)稳健性测试的方法,计算公式与考虑影响力的颠覆式绿色创新指数完全相同,仅将焦点专利被其他专利引用的观测区间由公开后三年扩展至公开后五年。用作稳健性检验变量
  • DIRGCD [企业整体口径颠覆式绿色创新倾向性指数] — 参考肖泽华等 (2026, 财经论丛)稳健性测试的方法,计算公式为:不先计算各绿色专利的指数再平均,而是将企业当年全部授权绿色专利视为一个整体,其技术前驱取并集,后续专利在企业年度层面去重后重新判定是否引用该企业当年任一焦点专利(记为F)及是否引用其任一技术前驱(记为B),代入同一公式并作加一处理。取值范围0到2。用作稳健性检验变量
  • DIRmGCD [企业整体口径考虑影响力的颠覆式绿色创新指数] — 参考肖泽华等 (2026, 财经论丛)稳健性测试的方法,计算公式为:企业整体口径颠覆式绿色创新倾向性指数与该企业当年全部授权绿色专利在整体口径下的被引次数之积。因未按专利件数取平均,该字段随企业绿色专利规模同向变动,跨企业比较时应同时控制绿色专利数量。用作稳健性检验变量
  • IsCitationWindowComplete [三年引用窗口是否完整] — 当年存在授权绿色专利且其三年引用窗口均被引用数据完整覆盖(0=否,1=是)。计算公式为:焦点专利公开年加三不晚于引用数据成熟年时该专利窗口完整,企业当年全部焦点专利均完整时取一,当年无授权绿色专利时取零。引用数据成熟年由引用数据中引用方申请年的年度边数分布动态推导。需注意该标识取企业当年全部焦点专利的最小值,而实用新型在授权时即公开、发明专利须经十八个月公开,故仅按本标识筛选会得到实用新型占比偏高的子样本;需要更贴合研究设计的成熟度条件时可改用焦点专利最晚公开年

常见问题

「企业颠覆式绿色创新(CD指数加一法)」是什么数据集?
企业颠覆式绿色创新(CD指数加一法),隶属创新与知识产权。复现肖泽华、李青原、孙沛竹(2026, 财经论丛)的颠覆式绿色创新测度。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 26 个变量。核心指标包括:当年授权绿色专利数、授权绿色专利中发明专利数、窄口径授权绿色专利数、可追溯技术前驱的焦点专利数、获得引用的焦点专利数、焦点专利被引次数合计、引用网络规模合计、焦点专利最晚公开年、颠覆式绿色创新倾向性指数、考虑影响力的颠覆式绿色创新指数、五年窗口颠覆式绿色创新倾向性指数、五年窗口考虑影响力的颠覆式绿色创新指数、企业整体口径颠覆式绿色创新倾向性指数、企业整体口径考虑影响力的颠覆式绿色创新指数、三年引用窗口是否完整。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 98,449 条观测。
数据是如何测算/获取的?
指标定义与计算方法 技术总是沿着一定的路径演化。一项新的绿色技术问世后,它与既往技术之间可能形成两种关系:一种是延续既往的演化路径,对现有前沿技术作出适当改进,属于巩固式创新;另一种是偏离既往的演化路径,开辟出一个新的技术领域,属于颠覆式创新。对于企业绿色转型而言,两者的战略含义截然不同——前者能在短期内缓解环境规制带来的成本压力,后者则通过加大竞争者的模仿难度、降低技术优势的减损速度,为企业构筑更为长远的绿色竞争优势。 以往评价企业绿色创新能力的做法大体有三类:数绿色专利的申请数量,数绿色专利被直接引用的次数,或从绿色专利的文本特征入手。这三类做法各有其局限:专利数量无法区分质量,机会主义的企业总是倾向于重数量而轻质量;文本内容可以被刻意美化甚至操纵;直接被引次数虽能在一定程度上反映专利的影响力,却未能考虑该专利嵌入技术演化体系中的性质与地位,难以评估它对既往技术的增量贡献。 专利引用网络测度方法能够克服上述局限。其基本洞察是:一项创新究竟颠覆还是巩固了既有技术轨迹,可以由后来者的引用方式来揭示。围绕一项焦点专利,存在两类与之相关的专利——焦点专利所引用的在先专利构成它的技术前驱(后向专利),此后引用了焦点专利的专利则构成它的后续专利(前向专利)。如果后来者只引用焦点专利本身而绕开了它所依赖的那些技术前驱,说明焦点专利已在相应技术领域取代了原有路径,具有颠覆性;如果后来者在引用焦点专利的同时仍继续引用那些技术前驱,说明焦点专利只是沿既有路径作了增量改进,具有巩固性。 专利层面的测度。 设 $a$ 为一项焦点专利,$i$ 遍历观测窗口内引用了焦点专利或其技术前驱(或两者)的全部后续专利。对每个 $i$ 定义两个指示变量:$fi$ 在 $i$ 引用了焦点专利时取 1、否则取 0;$bi$ 在 $i$ 引用了焦点专利的任一技术前驱时取 1、否则取 0。以 $n$ 记这些后续专利的去重件数,则焦点专利的颠覆性指数为 $$CD = \frac{1}{n}\sum{i=1}^{n}\frac{-2fi bi + fi}{wi},\qquad wi = 1$$ 式中权重 $wi$ 恒取 1,即假定焦点专利公开后任何时点上前向引用情况对它的解释力度相同。该式的含义可以逐项读出:只引用焦点专利而不引用其技术前驱的后续专利贡献 $+1$,同时引用两者的后续专利贡献 $-1$,只引用技术前驱而未引用焦点专利的后续专利贡献 $0$ 但仍计入分母。因此 $CD$ 的取值落在 $[-1,1]$ 之间,正值表示该专利更倾向于颠覆既往技术,负值表示更倾向于延续既往技术的演化路径。 直接使用 $CD$ 来刻画企业的绿色创新能力会遇到一个障碍。该指数原本是为高等学校的专利提出的,高校更多从事基础研究,其专利往往成为大量应用性研究的基础并获得广泛引用;而企业的创新成果应用性与方向性更强,相当一部分企业专利根本未获引用。在这种情形下,若企业在窗口内的专利未获任何引用、或当年根本未成功申请专利,按上式计算的结果均为零;而取值为负本身已意味着企业成功申请了绿色专利并且获得了引用,其能力显然不应与"未申请专利"等量齐观。为此,在计算专利层面的指标时对被引次数不为零的专利作加一处理: $$GCDa = \begin{cases} CDa + 1, & ma 0\\[2pt] 0, & ma = 0\end{cases}$$ 其中 $ma$ 为焦点专利 $a$ 在窗口内的被引次数,即满足 $fi=1$ 的后续专利去重件数。经此改造,$GCD$ 的取值范围变为 $[0,2]$,最小值 0 仅代表专利未获得引用或未成功申请专利这一种情形,且取值越大表示该专利颠覆以往技术演化路径的倾向性越强。 在倾向性之外,被引次数本身承载着影响程度的信息。将焦点专利的重要性参数 $ma$ 与倾向性指数相乘,得到同时测度倾向性与影响程度的指标: $$mGCDa = GCDa \times ma$$ 焦点专利的确定与观测窗口。 纳入计算的焦点专利限于企业当年申请且已获授权的绿色专利,申请但未获授权的专利不予考虑,外观设计专利亦不予考虑。绿色与否依据世界知识产权组织发布的绿色专利分类清单,按专利的 IPC 分类号逐条比对识别:一项专利的任一分类号以清单中任一条目为前缀时,即被识别为绿色专利。 一项专利从公开到获得市场认可、再到被其他专利引用并成为技术演化路径中的节点,需要经历一段时间。出于时效性的考虑,主口径将有效的引用关系限定于焦点专利公开后三年之内,即 $t=3$。考虑到该限定可能排除一些具有滞后性的引用关系、从而忽视绿色创新成果的长远影响,本数据集同时提供将观测区间扩展至公开后五年重新计算的版本。 在具体实现上,一项发明在中国专利体系下可以拥有公开、授权、更正等多个公开号,引用记录会分散挂在不同版本上。本数据集把同一项发明的全部公开号版本归并为引用网络中的同一个节点,后续专利亦按其申请号去重,使上式中 $f$、$b$、$n$ 三项计数的单位是"一项发明"而非"一份文献",这与该指数把专利视为技术演化网络节点的原义相符。焦点专利自身不计入其后续专利集合。 企业层面的汇总。 主口径先以每件绿色专利为对象计算 $GCDa$ 与 $mGCDa$,再按照相同的申请年份将专利层面的指标算术平均至企业层面: $$GCD{j,t} = \frac{1}{N{j,t}}\sum{a \in A{j,t}} GCDa, \qquad mGCD{j,t} = \frac{1}{N{j,t}}\sum{a \in A{j,t}} mGCDa$$ 其中 $A{j,t}$ 为企业 $j$ 在第 $t$ 年申请且已获授权的绿色专利集合,$N{j,t}$ 为其件数。 作为归集方法上的稳健口径,本数据集另提供一组不经专利层面平均的指标:将企业当年成功申请的全部绿色专利视为一个整体,其技术前驱取并集,后续专利在企业年度层面去重后重新判定是否引用了该企业当年的任一焦点专利、以及是否引用了其任一技术前驱,再代入同一公式并作相同的加一处理,直接得到企业—年份层面的颠覆式创新指数。属于该企业当年焦点专利集合自身的后续专利不计入网络。企业当年多件焦点专利的公开日各不相同,此处仍先按各焦点专利自身的公开日施加三年窗口,再把通过窗口的引用关系汇总到企业年度层面重新判定,以保证窗口口径与主口径完全一致。 除两组核心指标与两组稳健指标外,数据集一并给出构成计算链条的中间量:企业当年授权绿色专利的件数、在窗口内获得引用的件数、被引次数 $m$ 的合计,以及引用网络规模 $n$ 的合计。这些中间量既是上式各项的直接构件,也便于使用者判断某一企业年度的指数由多大规模的引用关系支撑。 在此之外,数据集还提供三个刻画焦点专利集构成与成熟度的诊断列,它们不参与任何指数的计算,作用是让使用者能够识别并处理下文"补充说明"所列的几类结构性情形:能够追溯到技术前驱的焦点专利件数,用于判断 $b$ 项在多大比例的焦点专利上真正可算;焦点专利中发明专利的件数,其余即为实用新型,用于构造发明专利占比;窄口径下的焦点专利件数,即在绿色清单中剔除以整子类形式收录的电气测量、商业数据处理、石油裂化三个条目(保留其下的具体条目)后重新识别的件数,用于判断绿色认定在多大程度上依赖这些争议条目;以及焦点专利的最晚公开年,使用者可据此按自身研究设计设定引用窗口的成熟度门槛。 补充说明 - 样本口径与零值的三重含义:面板覆盖全行业、全板块,不预先剔除金融业或特殊处理股票,不作缩尾,使用者可按行业代码与各自的研究设计自行筛选。取值为零兼表三种状态:当年未成功申请授权绿色专利、有绿色专利但窗口内未获引用、以及获得引用但后续专利全部同时引用了技术前驱(纯巩固)。前两种与指标定义中零值的含义一致,第三种在语义上与它们相反却取同一个值,所幸占比很低。由于取零的观测占多数,且是否取零与企业规模相关,直接对该变量做普通最小二乘加双向固定效应并不合适;建议用两部模型分别报告,或报告剔除无绿色专利行的子样本作为稳健性。面板起始年份早于部分企业的上市年份,相当一部分行属上市前观测,需要上市后子样的研究应自行按上市年过滤。 - 实用新型与技术前驱的可得性:原文仅排除外观设计专利,故焦点专利同时包含已授权的发明专利与实用新型。需要提请使用者注意的是,中国实用新型不经实质审查、不产生审查员引用记录,因而在引用数据中极少能够追溯到技术前驱;没有技术前驱意味着上式中的 $b$ 项恒为零,指数随之机械地取到上界。发明专利则绝大多数可追溯到技术前驱。这一差异会使实用新型占比较高的企业取值偏高,且该偏高与企业所处技术领域的构成相关。数据集输出"可追溯技术前驱的焦点专利数"正是为此:建议使用者在回归中同时控制该比例,或在稳健性检验中限定于该比例较高的观测。 - 指数的两个变异来源(使用者应据此设定回归设定):其一,企业层面取值的横截面差异大部分来自"绿色专利有没有被引用过"这一外延边际,而非"颠覆还是巩固"这一内涵边际——这是加一改造与零值定义的直接结果(未获引用即取零),并非实现上的取舍。因此建议在回归中同时控制获得引用的焦点专利占比,或改用两部模型分别识别"是否存在被引的绿色专利"与"条件于被引的颠覆倾向",否则被引概率的效应会被计入颠覆性。其二,分母 $n$ 由焦点专利的技术前驱有多热门决定:焦点专利若建立在被广泛引用的技术之上,会有大量"只引前驱、不引焦点"的后续专利把 $n$ 撑大,从而压低取值;实测按技术前驱被引总量分组,焦点专利自身的被引次数在各组间基本不变,而取值呈单调下降。这是该指数为人熟知的结构性特征,原文未作处理,含义是取值会对技术领域的拥挤与成熟程度载荷,做行业异质性分析时应控制引用网络规模。此外,该式是对 $n$ 个后续专利求均值,$n$ 很小时取值离散且容易触及边界,随 $n$ 增大而收敛、标准差同步收窄。 - 企业整体口径的量纲:两种归集方式下的倾向性指数同为 $[0,2]$ 区间的量、高度相关,可直接互为稳健性对照。但影响力版本不可如此对照:主口径是专利层面乘积在企业内的平均,整体口径则是指数乘以企业当年去重后的引用方总数,后者随企业绿色专利组合规模近似线性增长,两者量级相差一个数量级且相关性很低。把整体口径的影响力版本直接当作主口径影响力版本的同量纲对照,检验不通过的原因将是量纲而非结论;需要同量纲对照时应先除以绿色专利件数。 - 两组核心指标之间的关系:企业当年只有一件焦点专利时,影响力版本恰等于倾向性版本与被引次数之积;当有多件时,由于先按专利求乘积再平均与先平均再相乘并不等价,两者不再满足该关系。这是汇总口径的必然结果。 - 引用窗口的完整性,以及分母本身在末期的截断:三年窗口要求焦点专利公开后三年的引用数据齐备,最近若干个申请年份的焦点专利窗口必然尚未走完,被引情况与指数取值随之偏低。数据集提供窗口是否完整的标识列,其判据是焦点专利公开年加三不晚于引用数据的成熟年,而成熟年由引用数据中引用方申请年份的年度边数分布动态推导(取边数达到峰值年份九成的最末年份),不写死具体年份,从而在数据逐年更新后自动前移。需说明该规则无法严格区分"引用数据尚未入库"与"当年真实申请量下降",因为两者都表现为末年边数下滑;以引用方公开年份重新推导并计入申请到公开的滞后后,所得的完整年份上界与现行规则基本一致,且该结论对阈值取值不敏感。做时间趋势或跨年比较的研究应限定在窗口完整的观测上。
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。