各地级市创新集群中心—外围技术互补指数
「各地级市创新集群中心—外围技术互补指数」,覆盖 1985-2025 年,频率 年度,地级市层级,含 12 个变量,样本量约 13,817。 在地区技术复杂度与地区间技术互补的基础上重新识别创新集群的中心地区与外围地区: 先取技术复杂度多年均值高于全国水平的地区为候选集, 再从中筛出历年复杂度排名均居
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 地级市 |
| 变量数 | 12 |
| 样本量 | 13,817 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 该地级行政区所属省级行政区名称
- ProvinceCode [省份代码] — 该地级行政区所属省级行政区划代码(GB/T 2260六位码)
- City [城市] — 地级行政区名称
- CityCode [城市代码] — 地级行政区划代码(GB/T 2260六位码)
- Year [年份] — 专利申请年份
- IsClusterCenter [是否创新集群中心城市] — 参考郑江淮等(2023,数量经济技术经济研究)的中心城市界定方法,是否创新集群中心城市(0=否,1=是)。判定规则为:先取技术复杂度多年均值高于全样本均值的城市构成候选集,再从候选集中筛出识别窗口内每一年技术复杂度排名均处于候选集规模之内的城市。该字段不随年份变化。
- IsClusterPeriphery [是否创新集群外围城市] — 参考郑江淮等(2023,数量经济技术经济研究)的外围城市识别方法,是否创新集群外围城市(0=否,1=是)。判定规则为:剔除与中心城市技术互补指数恒为零的城市后,凡识别窗口内过半年份与某一中心城市的技术互补指数高于该中心城市当年均值者,即为该中心城市的外围城市。中心城市不同时计为外围城市,一个外围城市可同时对应多个中心城市。该字段不随年份变化。
- LinkedRegionCount [配对城市数] — 计算公式为:当年参与测算的配对城市个数——中心城市计其全部外围城市,外围城市计其全部中心城市,均只含当年有发明专利者。用作判断指数稳定性的构成量。
- CenterPeriphComplementarity [中心—外围技术互补指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:中心城市取其与全部外围城市之间技术互补指数的算术平均,外围城市取其与全部中心城市之间技术互补指数的算术平均;技术互补指数为同一技术大类内部两城市落在不同技术小类上的专利占比交叉乘积之和,除以两城市该大类占比乘积的平方根后对全部大类求和。配对城市逐年只取当年有发明专利者;既非中心城市也非外围城市者不测算。用作研究变量,越大代表该城市在创新集群中心—外围结构中的技术分工与合作越深入。
- CenterPeriphComplementarityWtd [中心—外围技术互补指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将中心—外围技术互补指数改按配对城市当年发明专利件数加权平均。用作稳健性检验变量,相对等权口径更侧重与创新活跃城市之间的技术互补关系。
- CenterPeriphCompetition [中心—外围技术竞争指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:中心城市取其与全部外围城市之间技术竞争指数的算术平均,外围城市取其与全部中心城市之间技术竞争指数的算术平均;技术竞争指数为同一技术大类内部两城市落在相同技术小类上的专利占比乘积之和,除以两城市该大类占比乘积的平方根后对全部大类求和。配对城市逐年只取当年有发明专利者;既非中心城市也非外围城市者不测算。用作研究变量,越大代表该城市在创新集群中心—外围结构中面临的同技术小类正面竞争越激烈。
- CenterPeriphCompetitionWtd [中心—外围技术竞争指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将中心—外围技术竞争指数改按配对城市当年发明专利件数加权平均。用作稳健性检验变量。
常见问题
- 「各地级市创新集群中心—外围技术互补指数」是什么数据集?
- 各地级市创新集群中心—外围技术互补指数,隶属科技创新。在地区技术复杂度与地区间技术互补的基础上重新识别创新集群的中心地区与外围地区: 先取技术复杂度多年均值高于全国水平的地区为候选集, 再从中筛出历年复杂度排名均居
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 12 个变量。核心指标包括:是否创新集群中心城市、是否创新集群外围城市、配对城市数、中心—外围技术互补指数、中心—外围技术互补指数(专利加权)、中心—外围技术竞争指数、中心—外围技术竞争指数(专利加权)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,地级市层级。
- 样本量有多大?
- 约 13,817 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 传统上对创新集群中心地区与外围地区的划分主要基于地理区位特征,例如把各省份内的省会城市以及 人均地区生产总值排名第一的地级市划为中心城市,其余划为外围城市。这种划分方式并未考虑城市的 创新能力与城市之间日益紧密的技术关联程度。本数据集依照原文的思路,改用技术复杂度指数与城市间 技术互补指数对创新集群的中心城市与外围城市进行重新识别,并在此基础上测算中心—外围之间的技术 互补与技术竞争程度。 识别分为两个环节。中心城市的界定依据技术复杂度:先将各城市技术复杂度的多年均值与全部城市技术 复杂度的均值相比较,筛选出技术复杂度水平高于全国水平的城市构成候选集,记候选集规模为 $K$; 再从候选集中进一步筛选出识别窗口内历年技术复杂度排位均处于前 $K$ 名的城市,界定为创新集群 中心城市。这类城市不仅在全国范围内具有较高的产品复杂度和多样性,同时也具备良好稳定的发展环境。 原文在其城市层样本下由此得到41个候选城市与20个中心城市;这两个数字是其样本下的结果而非规则 本身的常数,因此本数据集按上述规则重算,而非沿用固定数量。 外围城市的识别依据技术互补指数,同样分两步。第一步,将与中心城市之间技术互补指数等于零的其他 城市剔除,以保证中心城市与外围城市之间存在技术关联性;第二步,对每一个中心城市,分别计算其与 其他城市之间技术互补指数的平均值,将识别窗口内过半年份技术互补指数大于该平均值的其他城市筛选 出来,界定为该中心城市的外围城市。进行第二步筛选的原因,一是剔除与中心城市技术互补程度均很低 的其他城市,以防止将该类城市界定为外围城市而导致回归结果有偏;二是需要考虑部分城市从技术互补 程度较低的非外围城市转化为技术互补程度较高的外围城市的发展情况,避免采用历年技术互补均大于 平均值的筛选方法造成的过度识别问题。原文以16年样本期中存在8年及以上作为门槛,即过半,故本 数据集按比例而非绝对年数实现。上述识别方法不仅打破了传统产业集群中心和外围城市界定的地理 区域限制,还揭示了中心城市与外围城市之间的多对多关系:一个中心城市对应多个外围城市的同时,一个 外围城市也可以对应多个中心城市。中心城市不同时计为其他中心城市的外围城市。 考虑到较早年份的区域统计数据存在不完整性,识别窗口的起点设定为2000年,终点为数据可得的最新 年份;识别结果在时间上是固定的,不随年份滚动。 在重新划分的中心城市与外围城市基础上,测算中心—外围技术互补指数:中心城市取其与全部外围城市之间 技术互补指数的算术平均,外围城市取其与全部中心城市之间技术互补指数的算术平均,并按原文基于各 城市专利数据赋权的做法另行给出加权平均列。技术互补指数本身的定义为,在每个技术大类内部,将两 城市分别落在不同技术小类上的专利占比两两相乘后求和,再除以两城市该技术大类专利占比乘积的平方 根,最后对全部技术大类求和;其中技术大类取国际专利分类四位码,技术小类取其下一级的大组, 专利占比均以各自城市当年发明专利总件数为分母。按同样的口径,本数据集一并给出中心—外围技术 竞争指数,其定义只将上述交叉项替换为两城市落在相同技术小类上的占比乘积,用以刻画中心—外围 技术结构由技术竞争向技术互补演变的过程。 配对集合逐年只取当年有发明专利的城市;既非中心城市也非外围城市者不参与测算,四个指数列为缺失。 本数据集同时给出是否为中心城市、是否为外围城市两个标识列与当年参与测算的配对城市数。 补充说明 - 样本口径:覆盖地级行政区全集与全部可得年份,不预先施加任何回归样本限制。识别结果本身只对 中心城市与外围城市赋值,其余城市的四个指数列为缺失,这与原文只对中心与外围测算的做法一致; 两个标识列对全部城市年均有取值,可直接用于分组。 - 识别窗口:起点沿用原文关于较早年份统计数据不完整的判断设定为2000年,终点随数据更新 而后移;指数本身仍覆盖全部可得年份,与原文给出的中心—外围技术结构长期演变趋势一致。若把 识别窗口回溯到更早年份,早年专利稀疏造成的排名波动会明显干扰识别结果。 - 方法性质:中心与外围的身份是按整个识别窗口一次性判定的,不随年份变化;识别规则中的 候选集规模与年数门槛按比例重算,因此主体数越多、识别窗口越长,"历年均在前 $K$ 名"这一 条件越严格,识别出的中心城市数量也会随主体总数与窗口长度一同变化。省级主体总数远小于市级、 且彼此都是技术谱较宽的大主体,因此省级识别出的中心城市数量明显偏少;技术布局高度集中于少数 领域的主体在省级口径下有可能不进入中心集合,关注此类主体的使用者宜以市级数据集为准。 - 身份随识别窗口变化:识别窗口的起点固定,终点随数据更新而后移,窗口因此逐年加长; 处于临界位置的城市可能在相邻两次数据更新之间翻转身份,又因身份是时不变设定,一次翻转会 改写该城市全部年份的四个指数列。做跨版本比较时应固定数据版本。 - 两个标识列的使用限制:是否为中心城市、是否为外围城市均为时不变设定,与个体固定效应 完全共线,不能作为面板回归的自变量,只宜用于分组。中心—外围技术互补指数与全域口径的 技术互补指数高度相关,两者不宜同时进入同一回归。身份由整个识别窗口一次性判定,因此较早 年份的观测中含有较晚年份的信息,做事件研究时须注意这一前瞻性。 - 技术分类口径的时间断点:早年有相当比例的发明专利缺少主分类号,须退回全部分类号的 首项代替,而两者在技术大类层面的一致性在早年明显偏低;这一缺失比例在2004至2006年间迅速 收敛到很低的水平。受此影响,2006年以前的技术分类口径与之后不完全可比,跨这一过渡带的 水平比较与趋势解读不成立,建议以2006年作为实证起点。 - 直辖市在两层重复出现:四个直辖市在省级与市级两套数据集中使用相同的行政区划代码与 相同的专利归属,但两层的样本框与归一化基数不同,数值不可互换;把两层数据堆叠会重复计入 这四个主体。 - 其他局限:发明专利自申请到公开存在约十八个月的滞后,最近一至两个申请年的件数偏低; 地理归属依据申请人地址信息匹配得到,可定位到城市的比例在样本早期明显低于近期,且个别地区的可定位比例系统性偏低,使用者在做跨年比较时宜加入年份固定效应;城市名单采用当前有效的行政区划口径,历史上已撤销或合并的地级市不在名单内,其撤销前年份的专利只能归属到省级,在本数据集中表现为缺失而非零值;城市层与省级层的技术谱宽度不同,两层数值不可直接比较。 参考文献 - 郑江淮,陈喆,冉征.创新集群的“中心—外围结构”:技术互补与经济增长收敛性研究[J].数量经济技术经济研究,2023,40(1):66-86. - Tacchella A, Cristelli M, Caldarelli G, et al. A new metrics for countries' fitness and products' complexity[J]. Scientific Reports, 2012, 2: 723. - 郑江淮,陈喆,孙志燕,等.从竞争到互补:区域技术结构变迁的测度与理论假说[J].经济评论,2022,(1):13-29.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。