各省创新集群中心—外围技术互补指数

「各省创新集群中心—外围技术互补指数」,覆盖 1985-2025 年,频率 年度,省级层级,含 10 个变量,样本量约 1,271。 在地区技术复杂度与地区间技术互补的基础上重新识别创新集群的中心地区与外围地区: 先取技术复杂度多年均值高于全国水平的地区为候选集, 再从中筛出历年复杂度排名均居

时间跨度1985-2025 年
数据频率年度
层级省级
变量数10
样本量1,271
是否可合并可与同主体数据集合并

字段字典

  • Province [省份] — 省级行政区名称
  • ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260六位码)
  • Year [年份] — 专利申请年份
  • IsClusterCenter [是否创新集群中心省份] — 参考郑江淮等(2023,数量经济技术经济研究)的中心城市界定方法,是否创新集群中心省份(0=否,1=是)。判定规则为:先取技术复杂度多年均值高于全样本均值的省份构成候选集,再从候选集中筛出识别窗口内每一年技术复杂度排名均处于候选集规模之内的省份。该字段不随年份变化。
  • IsClusterPeriphery [是否创新集群外围省份] — 参考郑江淮等(2023,数量经济技术经济研究)的外围城市识别方法,是否创新集群外围省份(0=否,1=是)。判定规则为:剔除与中心省份技术互补指数恒为零的省份后,凡识别窗口内过半年份与某一中心省份的技术互补指数高于该中心省份当年均值者,即为该中心省份的外围省份。中心省份不同时计为外围省份,一个外围省份可同时对应多个中心省份。该字段不随年份变化。
  • LinkedRegionCount [配对省份数] — 计算公式为:当年参与测算的配对省份个数——中心省份计其全部外围省份,外围省份计其全部中心省份,均只含当年有发明专利者。用作判断指数稳定性的构成量。
  • CenterPeriphComplementarity [中心—外围技术互补指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:中心省份取其与全部外围省份之间技术互补指数的算术平均,外围省份取其与全部中心省份之间技术互补指数的算术平均;技术互补指数为同一技术大类内部两省份落在不同技术小类上的专利占比交叉乘积之和,除以两省份该大类占比乘积的平方根后对全部大类求和。配对省份逐年只取当年有发明专利者;既非中心省份也非外围省份者不测算。用作研究变量,越大代表该省份在创新集群中心—外围结构中的技术分工与合作越深入。
  • CenterPeriphComplementarityWtd [中心—外围技术互补指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将中心—外围技术互补指数改按配对省份当年发明专利件数加权平均。用作稳健性检验变量,相对等权口径更侧重与创新活跃省份之间的技术互补关系。
  • CenterPeriphCompetition [中心—外围技术竞争指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:中心省份取其与全部外围省份之间技术竞争指数的算术平均,外围省份取其与全部中心省份之间技术竞争指数的算术平均;技术竞争指数为同一技术大类内部两省份落在相同技术小类上的专利占比乘积之和,除以两省份该大类占比乘积的平方根后对全部大类求和。配对省份逐年只取当年有发明专利者;既非中心省份也非外围省份者不测算。用作研究变量,越大代表该省份在创新集群中心—外围结构中面临的同技术小类正面竞争越激烈。
  • CenterPeriphCompetitionWtd [中心—外围技术竞争指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将中心—外围技术竞争指数改按配对省份当年发明专利件数加权平均。用作稳健性检验变量。

常见问题

「各省创新集群中心—外围技术互补指数」是什么数据集?
各省创新集群中心—外围技术互补指数,隶属科技创新。在地区技术复杂度与地区间技术互补的基础上重新识别创新集群的中心地区与外围地区: 先取技术复杂度多年均值高于全国水平的地区为候选集, 再从中筛出历年复杂度排名均居
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 10 个变量。核心指标包括:是否创新集群中心省份、是否创新集群外围省份、配对省份数、中心—外围技术互补指数、中心—外围技术互补指数(专利加权)、中心—外围技术竞争指数、中心—外围技术竞争指数(专利加权)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,省级层级。
样本量有多大?
约 1,271 条观测。
数据是如何测算/获取的?
指标定义与计算方法 传统上对创新集群中心地区与外围地区的划分主要基于地理区位特征,例如把各省份内的省会城市以及 人均地区生产总值排名第一的地级市划为中心城市,其余划为外围城市。这种划分方式并未考虑省份的 创新能力与省份之间日益紧密的技术关联程度。本数据集依照原文的思路,改用技术复杂度指数与省份间 技术互补指数对创新集群的中心省份与外围省份进行重新识别,并在此基础上测算中心—外围之间的技术 互补与技术竞争程度。 识别分为两个环节。中心省份的界定依据技术复杂度:先将各省份技术复杂度的多年均值与全部省份技术 复杂度的均值相比较,筛选出技术复杂度水平高于全国水平的省份构成候选集,记候选集规模为 $K$; 再从候选集中进一步筛选出识别窗口内历年技术复杂度排位均处于前 $K$ 名的省份,界定为创新集群 中心省份。这类省份不仅在全国范围内具有较高的产品复杂度和多样性,同时也具备良好稳定的发展环境。 原文在其城市层样本下由此得到41个候选城市与20个中心城市;这两个数字是其样本下的结果而非规则 本身的常数,因此本数据集按上述规则重算,而非沿用固定数量。 外围省份的识别依据技术互补指数,同样分两步。第一步,将与中心省份之间技术互补指数等于零的其他 省份剔除,以保证中心省份与外围省份之间存在技术关联性;第二步,对每一个中心省份,分别计算其与 其他省份之间技术互补指数的平均值,将识别窗口内过半年份技术互补指数大于该平均值的其他省份筛选 出来,界定为该中心省份的外围省份。进行第二步筛选的原因,一是剔除与中心省份技术互补程度均很低 的其他省份,以防止将该类省份界定为外围省份而导致回归结果有偏;二是需要考虑部分省份从技术互补 程度较低的非外围省份转化为技术互补程度较高的外围省份的发展情况,避免采用历年技术互补均大于 平均值的筛选方法造成的过度识别问题。原文以16年样本期中存在8年及以上作为门槛,即过半,故本 数据集按比例而非绝对年数实现。上述识别方法不仅打破了传统产业集群中心和外围省份界定的地理 区域限制,还揭示了中心省份与外围省份之间的多对多关系:一个中心省份对应多个外围省份的同时,一个 外围省份也可以对应多个中心省份。中心省份不同时计为其他中心省份的外围省份。 考虑到较早年份的区域统计数据存在不完整性,识别窗口的起点设定为2000年,终点为数据可得的最新 年份;识别结果在时间上是固定的,不随年份滚动。 在重新划分的中心省份与外围省份基础上,测算中心—外围技术互补指数:中心省份取其与全部外围省份之间 技术互补指数的算术平均,外围省份取其与全部中心省份之间技术互补指数的算术平均,并按原文基于各 省份专利数据赋权的做法另行给出加权平均列。技术互补指数本身的定义为,在每个技术大类内部,将两 省份分别落在不同技术小类上的专利占比两两相乘后求和,再除以两省份该技术大类专利占比乘积的平方 根,最后对全部技术大类求和;其中技术大类取国际专利分类四位码,技术小类取其下一级的大组, 专利占比均以各自省份当年发明专利总件数为分母。按同样的口径,本数据集一并给出中心—外围技术 竞争指数,其定义只将上述交叉项替换为两省份落在相同技术小类上的占比乘积,用以刻画中心—外围 技术结构由技术竞争向技术互补演变的过程。 配对集合逐年只取当年有发明专利的省份;既非中心省份也非外围省份者不参与测算,四个指数列为缺失。 本数据集同时给出是否为中心省份、是否为外围省份两个标识列与当年参与测算的配对省份数。 补充说明 - 样本口径:覆盖省级行政区全集与全部可得年份,不预先施加任何回归样本限制。识别结果本身只对 中心省份与外围省份赋值,其余省份的四个指数列为缺失,这与原文只对中心与外围测算的做法一致; 两个标识列对全部省份年均有取值,可直接用于分组。 - 识别窗口:起点沿用原文关于较早年份统计数据不完整的判断设定为2000年,终点随数据更新 而后移;指数本身仍覆盖全部可得年份,与原文给出的中心—外围技术结构长期演变趋势一致。若把 识别窗口回溯到更早年份,早年专利稀疏造成的排名波动会明显干扰识别结果。 - 方法性质:中心与外围的身份是按整个识别窗口一次性判定的,不随年份变化;识别规则中的 候选集规模与年数门槛按比例重算,因此主体数越多、识别窗口越长,"历年均在前 $K$ 名"这一 条件越严格,识别出的中心省份数量也会随主体总数与窗口长度一同变化。省级主体总数远小于市级、 且彼此都是技术谱较宽的大主体,因此省级识别出的中心省份数量明显偏少;技术布局高度集中于少数 领域的主体在省级口径下有可能不进入中心集合,关注此类主体的使用者宜以市级数据集为准。 - 身份随识别窗口变化:识别窗口的起点固定,终点随数据更新而后移,窗口因此逐年加长; 处于临界位置的省份可能在相邻两次数据更新之间翻转身份,又因身份是时不变设定,一次翻转会 改写该省份全部年份的四个指数列。做跨版本比较时应固定数据版本。 - 两个标识列的使用限制:是否为中心省份、是否为外围省份均为时不变设定,与个体固定效应 完全共线,不能作为面板回归的自变量,只宜用于分组。中心—外围技术互补指数与全域口径的 技术互补指数高度相关,两者不宜同时进入同一回归。身份由整个识别窗口一次性判定,因此较早 年份的观测中含有较晚年份的信息,做事件研究时须注意这一前瞻性。 - 技术分类口径的时间断点:早年有相当比例的发明专利缺少主分类号,须退回全部分类号的 首项代替,而两者在技术大类层面的一致性在早年明显偏低;这一缺失比例在2004至2006年间迅速 收敛到很低的水平。受此影响,2006年以前的技术分类口径与之后不完全可比,跨这一过渡带的 水平比较与趋势解读不成立,建议以2006年作为实证起点。 - 直辖市在两层重复出现:四个直辖市在省级与市级两套数据集中使用相同的行政区划代码与 相同的专利归属,但两层的样本框与归一化基数不同,数值不可互换;把两层数据堆叠会重复计入 这四个主体。 - 其他局限:发明专利自申请到公开存在约十八个月的滞后,最近一至两个申请年的件数偏低; 地理归属依据申请人地址信息匹配得到,可定位到省份的比例在样本早期远低于近期,且对高校与个人申请人的匹配率天然更低,属系统性而非随机缺失,较早年份的截面代表性有限;各省份的中心—外围技术互补程度在近年趋于接近,截面差异明显小于地级市层,省级回归的识别力相应有限;省份层与市级层的技术谱宽度不同,两层数值不可直接比较。 参考文献 - 郑江淮,陈喆,冉征.创新集群的“中心—外围结构”:技术互补与经济增长收敛性研究[J].数量经济技术经济研究,2023,40(1):66-86. - Tacchella A, Cristelli M, Caldarelli G, et al. A new metrics for countries' fitness and products' complexity[J]. Scientific Reports, 2012, 2: 723. - 郑江淮,陈喆,孙志燕,等.从竞争到互补:区域技术结构变迁的测度与理论假说[J].经济评论,2022,(1):13-29.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。