企业绿色技术相关性

「企业绿色技术相关性」,覆盖 1988-2025 年,频率 年度,上市公司层级,含 22 个变量,样本量约 34,504。 复现Mu, Ning & Chen (2026, Technovation)式(4)-(6),度量企业既有知识基与其当年新进入的绿色技术领域之间的技术相关性。

时间跨度1988-2025 年
数据频率年度
层级上市公司
变量数22
样本量34,504
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PortfolioPatentCount [前五年专利组合技术域计次合计] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:第t-5至t-1年企业发明专利按所属IPC三位大类逐一计次后的合计,即技术相关性公式中的分母。跨多个技术域的发明专利在每个所属域各计一次,故该值不等于去重发明专利件数;分子分母同口径是加权份额自洽所必需的,需要去重专利件数作控制变量时请另取专利数量年度统计类指标
  • PortfolioDomainCount [前五年专利组合技术域数] — 计算公式为:第t-5至t-1年企业发明专利覆盖的不重复IPC三位大类个数,用以刻画企业知识基的技术宽度
  • GreenInventionCount [当年绿色发明专利数] — 计算公式为:第t年企业申请的、至少一个IPC分类号命中世界知识产权组织《国际专利分类绿色清单》(窄口径)的发明专利去重件数
  • NGTDCount [当年新进入绿色技术域数] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:第t年企业新进入的绿色技术域个数;某IPC三位大类构成新绿色技术域需同时满足前十年未在该域申请过任何专利、且当年有绿色发明专利的绿色分类号落在该域。取0表示当年未进入任何新绿色技术域,此时绿色技术相关性按定义无取值
  • NGTDPatentCount [当年新绿色技术域发明专利计次合计] — 计算公式为:第t年落在新进入绿色技术域上的绿色发明专利按域计次后的合计,即绿色技术相关性年度聚合时的权重之和;计次口径同前五年专利组合技术域计次合计
  • FirstNGTDEntryYear [首次进入新绿色技术域年份] — 企业首次进入新绿色技术域的专利申请年份,企业内各年恒定,亦为本数据集面板的起始年
  • IsNGTDEntryYear [是否当年进入新绿色技术域] — 是否当年进入新绿色技术域(0=否,1=是),用于筛出绿色技术相关性有定义的事件年。注意面板起点即企业首次进入年,故每家企业首行该值恒为1,且面板不含从未进入过新绿色技术域的企业,不可直接用作进入选择模型的被解释变量
  • GreenTechRelatedness [绿色技术相关性] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:企业前五年发明专利组合中各技术域的份额,与该技术域和当年新进入绿色技术域之间系统性相关性的乘积之和;其中系统性相关性为两技术域之间双向实际引用条数与按技术域规模份额分配的期望引用条数之比,技术域取IPC三位大类;企业当年进入多个新绿色技术域时,按各域当年绿色发明专利数加权平均。用作研究变量,越大代表企业既有知识基与新进入绿色技术领域的技术距离越近、对既有技术轨迹的依赖越强
  • GreenTechRelatednessMean [绿色技术相关性(各新绿色域简单平均)] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:同绿色技术相关性,但企业当年进入多个新绿色技术域时改取各域相关性的简单算术平均而非绿色专利数加权平均,用作年度聚合方式的稳健性口径
  • GreenTechRelatednessSub [绿色技术相关性(IPC四位小类口径)] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:同绿色技术相关性,但技术域由IPC三位大类改取IPC四位小类,相关性矩阵、新绿色技术域判定与组合份额全链条重算。进入一个新的三位大类必然同时进入一个新的四位小类而反之不然,故本字段有取值的企业年严格多于主口径,且取值水平与尾部形态不同,两者不可直接比较
  • FirstEntryGreenTechRelatedness [首次绿色进入事件的技术相关性] — 参考Mu, Ning & Chen (2026, Technovation)的方法,计算公式为:取企业在首次进入新绿色技术域当年的绿色技术相关性,并在该企业全部面板年份上广播,企业内各年恒定;用于还原原文以企业首次绿色进入事件为观测单位的横截面设定。企业首次进入之年若前五年无发明专利则该值为空

常见问题

「企业绿色技术相关性」是什么数据集?
企业绿色技术相关性,隶属创新与知识产权。复现Mu, Ning & Chen (2026, Technovation)式(4)-(6),度量企业既有知识基与其当年新进入的绿色技术领域之间的技术相关性。
该数据集的时间范围是?
覆盖 1988-2025 年。
包含哪些变量/指标?
共 22 个变量。核心指标包括:前五年专利组合技术域计次合计、前五年专利组合技术域数、当年绿色发明专利数、当年新进入绿色技术域数、当年新绿色技术域发明专利计次合计、首次进入新绿色技术域年份、是否当年进入新绿色技术域、绿色技术相关性、绿色技术相关性(各新绿色域简单平均)、绿色技术相关性(IPC四位小类口径)、首次绿色进入事件的技术相关性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 34,504 条观测。
数据是如何测算/获取的?
指标定义与计算方法 当企业把创新触角伸向一个此前从未涉足的绿色技术领域时,它并非从零开始:企业既有的专利组合构成一个知识基,新进入的绿色领域与这个知识基之间的技术距离,决定了企业能在多大程度上把已有的技术能力、研发惯例与工程经验迁移过去。技术相关性高,意味着新领域落在企业熟悉的技术轨迹附近,吸收成本低、失败风险小,但同时也意味着企业的搜索被锁定在既有路径上,难以跳脱出来形成真正颠覆既有技术秩序的绿色创新;技术相关性低,则意味着企业必须跨越更远的知识距离,学习成本高,却也更可能在远距离的知识重组中产生突破。本数据集刻画的正是这一距离:企业既有知识基与其当年新进入的绿色技术领域之间的技术相关性。 测度分三步。第一步是刻画任意两个技术领域之间的系统性相关性。两个技术领域若在知识上彼此邻近,一个领域的专利在撰写时就会更频繁地引用另一个领域的在先专利。但引用的绝对条数会被领域规模放大——大领域天然被引更多,因此必须用"实际引用相对于期望引用的超额比"来剥离规模效应。设 $O{\alpha\beta}$ 为技术领域 $\alpha$ 的专利引用技术领域 $\beta$ 在先专利的条数,期望引用条数按领域 $\beta$ 在全部被引专利中所占的规模份额分配: $$E{\alpha\beta}=\left(\sum{\beta} O{\alpha\beta}\right)\times\frac{x{\beta}}{\sum{\beta} x{\beta}}$$ 其中 $x{\beta}$ 为技术领域 $\beta$ 的专利规模。由于引用方向本身带有先后次序的偶然性,实际与期望均取双向之和后相除,得到对称的领域间系统性相关性矩阵: $$R{\alpha\beta}=\frac{O{\alpha\beta}+O{\beta\alpha}}{E{\alpha\beta}+E{\beta\alpha}}$$ 该矩阵是超额比,理论上以 1 为基准:取值大于 1 表示两领域之间的知识流动强于纯粹由规模决定的期望水平,取值小于 1 则表示两者知识上相互独立。矩阵按 IPC 三位大类划分技术领域,覆盖全部技术域而非仅绿色领域,因为它刻画的是技术知识空间本身的结构,绿色属性只在下一步进入。 第二步是识别新进入的绿色技术领域。绿色技术依据世界知识产权组织发布的《国际专利分类绿色清单》界定:专利的任一 IPC 分类号以清单条目为前缀,即判定该专利属于绿色技术,命中清单的那个分类号所在的技术领域,就是该专利所指向的绿色技术领域;搭载在同一件绿色专利上、但本身未命中清单的其它分类号不构成绿色技术领域。清单取窄口径:其中电变量测量、商业行政数据处理、石油裂化三个子类被整类纳入,前缀匹配会把万用表、电子商务、银行业务、办公行政一类与环境改善无关的专利整体判为绿色技术,故予以剔除,仅保留其中界定明确的废料炼油子组。所谓"新",指企业在此前十年内未在该技术领域申请过任何专利——长期不在某领域布局,企业在该领域的技术资产会折旧乃至失效,重新进入应当视同首次进入。十年回看的历史依据使用企业全部专利(发明与实用新型),判定标准从严;而绿色进入的计数与后续加权只取发明专利,因为实用新型属增量改良,不构成技术领域意义上的知识基。综合两个条件:某技术领域在某年对某企业构成"新绿色技术领域",当且仅当企业此前十年未在该领域申请过专利,且当年有绿色发明专利的绿色分类号落在该领域。 第三步是把领域间相关性加权聚合到企业。企业的知识基用其在进入年之前连续五年内申请的发明专利的技术领域构成刻画:设 $x{i\beta}$ 为企业 $i$ 在前五年申请的发明专利中归属技术领域 $\beta$ 的专利件数,$xi=\sum{\beta}x{i\beta}$ 为其合计。企业与新进入绿色技术领域 $g$ 之间的技术相关性,即以组合份额为权重、对该领域与知识基各领域之间系统性相关性的加权求和: $$Relatedness{ig}=\sum{\beta}\left(\frac{x{i\beta}}{xi}\right)\times R{g\beta}$$ 企业在同一年可能同时进入多个新绿色技术领域,此时核心指标对各新进入领域按其当年绿色发明专利件数加权平均,稳健性口径则给出不加权的简单算术平均。需要注意的是,跨多个技术领域的一件发明专利在每个所属领域各计一次,因此组合计次合计不等于去重专利件数;这是式中份额分子与分母保持同一口径的必然要求,若需要去重的专利件数作控制变量,应另取专利数量年度统计类指标。 数据集同时给出两类补充口径。其一是技术领域粒度的稳健性检验:把技术领域由 IPC 三位大类改为四位小类,相关性矩阵、新绿色领域判定与组合份额全链条重算。其二是首次绿色进入口径:取企业首次进入新绿色技术领域当年的相关性取值,并在该企业的全部面板年份上广播,用以还原以"企业首次绿色进入"为观测单位的横截面设定。此外,数据集保留了计算链上的中间量——前五年专利组合的计次合计与技术领域数、当年绿色发明专利件数、当年新进入绿色技术领域数及其上的绿色发明专利计次合计、企业首次绿色进入年份,以及标识当年是否发生新绿色技术领域进入的二元变量。最后这一变量本身即可作为绿色技术领域进入选择模型的被解释变量,用于处理进入行为的自选择问题。 补充说明 - 样本口径与面板构造:面板起于企业首次进入新绿色技术领域之年、止于其最后一个发明专利申请年,中间年份补齐并令新进入领域数为零。不预先剔除金融业、ST 公司或任何板块,也不做缩尾,使用者可按行业代码、上市状态与各自的缩尾惯例自行筛选。由此面板是条件于"该企业曾经进入过新绿色技术领域"的:从未进入过的有专利企业不在面板内,进入之前的年份也不在面板内,且每家企业的首行必然是一个进入年。因此数据集提供的二元进入标识只应用于筛出核心指标有定义的事件年,不能直接作为进入倾向模型或 Heckman 第一阶段的被解释变量——那需要一个包含未进入企业与进入前风险期的风险集面板,应另行构造。若只把相关性用作解释变量,需在样本说明中写明结论条件于已发生进入。 - 有效观测的时序深度:核心相关性仅在事件年有定义,每家企业的有效观测数普遍很少,相当比例的企业只有单个有效观测。这使企业固定效应在实践中会吸收掉很大一部分样本,建议改用行业与年度的双重固定效应,并报告组内与组间的方差分解。 - 无前期知识基的进入事件:若企业进入新绿色领域时其前五年没有任何发明专利,则加权份额的分母为零,该企业年的相关性无取值,不做补零处理。这一缺失并非随机:首次进入口径的缺失集中于上市前即已进入绿色领域的企业,这批主体的专利归集也最不完整。用首次进入口径做横截面分析时,建议同时限定进入年不早于上市年,并披露该筛选。 - 时间锚点与专利类型:专利一律按申请年归属,组合窗口取进入年之前连续五年的发明专利。申请日反映技术产出的实际发生时点,不受审查周期长短的影响,与本平台其它专利类指标保持一致。 - 绿色清单的粒度:《国际专利分类绿色清单》除具体分组条目外,还包含若干整类条目(如铁道、核技术、水处理、风力发电、输配电、交通管制等),落在这些条目下的专利整体被判为绿色,其中会包含并非以环境改善为直接目标的技术。除上文已剔除的三个子类外,其余整类条目予以保留——它们对应的是清单在该领域的整体性界定,剔除将偏离清单本身,也会破坏与国际文献及本平台其它绿色专利指标的横向可比。使用者可按行业与技术领域自行做敏感性检验。 - 与组合宽度的机械关系:加权求和本质是对组合份额的加权平均,企业知识基覆盖的技术领域越多,加权平均越向领域间相关性的总体水平收敛,因此该指标随组合宽度系统性下降;知识基只覆盖单一技术领域时,加权平均退化为直接取领域对相关性矩阵的一个元素,分布右尾因而偏长(已逐例核实这些取值背后的引用条数充足,属方法的固有性质而非计算错误)。后果有二:该指标的年度均值走势主要反映样本知识基宽度构成的变化,不宜解读为技术扩散的时间趋势;该指标与技术多元化类指标(赫芬达尔指数、熵)存在结构性共线。数据集同时输出前五年组合的技术领域数,主回归应一并控制并报告控制前后的系数变化——若系数在控制后消失,说明捕捉的是技术多元化而非技术相关性。 - 两个粒度口径的关系:进入一个新的三位大类必然同时是进入一个新的四位小类,反之不然,因此小类口径的有值集合严格包含主口径的有值集合,且两者的取值水平与尾部形态不同。换用小类口径会同时改变样本范围、事件定义与量纲,因而它不是"同样本换粒度"的稳健性检验。正确用法是固定在主口径有值的行上比较两者系数,或把小类口径当作一次独立的完整复现来报告。 - 与原文报告值的可比性:本指标的缩尾均值与原始文献报告的水平高度接近,但离散程度明显更大、左尾更长,原因在于观测单位与样本构成不同——原始文献只保留专利产出密集企业的单次首入事件,本数据集覆盖全部有专利产出上市公司的全部进入事件,含大量知识基很小的企业年。因此回归系数(包括按标准差标准化后的系数)不宜与原始文献直接对照,描述统计应以本数据集自身为准。 - 其他局限:领域间相关性矩阵基于可得的专利后向引用构造,该引用样本为上市公司及其关联主体的专利引用记录,窄于全国专利库的全量引用,冷门领域对的相关性估计支撑较弱(常见技术领域之间的估计稳定,实测领域对覆盖约七成);矩阵一次性构造并应用于全部年份,已实测该设定带来的前视影响可忽略(仅用较早年份引用构造的矩阵与全样本矩阵高度一致);引用中含同一主体内部的自引,未予剔除(自引主要强化矩阵对角线,而新进入领域自身在知识基中的份额为零,对角线不参与加权);专利按上市公司本身及其子公司、合营与联营企业归集,一项多主体专利对每个上市公司各计一次;面板起点由专利活动而非上市时点决定,相当比例的观测早于企业上市年份,而上市前的专利归集依赖企业名称匹配、覆盖偏低,会使早期年份的组合被低估、指标偏高;面板右端点由企业最后一次发明专利申请决定,故面板长度本身是创新活动的函数,需要平衡面板的研究应自行按上市与退市年份重建年份跨度;专利存在公开滞后,最近两个申请年的绿色专利件数与进入事件率都仍在补充中、取值系统性偏低,建议把这两年放入稳健性检验或加年度虚拟变量;专利归属主体中含少量不在公司基本信息库内的证券代码(北交所新代码与 B 股代码),其证券简称与地理行业列为空,合并公司层数据前应显式检查匹配率。 参考文献 - Mu S, Ning L, Chen J. Technological relatedness in green innovation disruptiveness: the role of entry pace and rhythm[J]. Technovation, 2026, 157: 103686. - Leten B, Belderbos R, Van Looy B. Technological diversification, coherence, and performance of firms[J]. Journal of Product Innovation Management, 2007, 24(6): 567-579. - Leten B, Belderbos R, Van Looy B.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。