各地级市技术复杂度(EFC适应度法)

「各地级市技术复杂度(EFC适应度法)」,覆盖 1985-2025 年,频率 年度,地级市层级,含 10 个变量,样本量约 13,817。 以全量中国发明专利申请构建地区-技术领域矩阵, 先按显性专利比较优势(RPCA>=1)判定地区在各 IPC 四位码技术领域上是否具有比较优势, 再用适应度-复杂

时间跨度1985-2025 年
数据频率年度
层级地级市
变量数10
样本量13,817
是否可合并可与同主体数据集合并

字段字典

  • Province [省份] — 该地级行政区所属省级行政区名称
  • ProvinceCode [省份代码] — 该地级行政区所属省级行政区划代码(GB/T 2260六位码)
  • City [城市] — 地级行政区名称
  • CityCode [城市代码] — 地级行政区划代码(GB/T 2260六位码)
  • Year [年份] — 专利申请年份
  • PatentCount [发明专利申请量] — 参考郑江淮等(2023,数量经济技术经济研究)的测度框架,计算公式为:该城市当年申请、可归入国际专利分类且按第一申请人所在地归属本城市的发明专利件数,同一申请号只计一次。该字段是各项占比与显性比较优势计算式的分母,同时用于判断样本厚度;发明专利件数很少的城市,其下列指数由个位数专利决定,稳定性较弱。
  • TechGroupCount [技术大类数] — 参考郑江淮等(2023,数量经济技术经济研究)以国际专利分类四位码作为技术大类的做法,计算公式为:该城市当年有发明专利分布的国际专利分类四位码技术大类个数。用作衡量技术活动覆盖面的构成量,越大代表该城市涉足的技术大类越多。
  • TechAdvantageCount [显性比较优势领域数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:该城市显性专利比较优势指数不低于1的技术大类个数;显性专利比较优势指数等于该城市某技术大类发明专利件数占其全部发明专利件数的比重,除以全国该技术大类件数占全国全部件数的比重。用作研究变量,越大代表该城市具备比较优势的技术领域越广。
  • TechComplexity [技术复杂度] — 参考郑江淮等(2023,数量经济技术经济研究)采用的适应度-复杂度方法(Tacchella等(2012,Scientific Reports)),计算公式为:以各城市在各技术大类上是否具有显性专利比较优势构成的二元矩阵为基础交替迭代六轮,每一轮中城市适应度更新为其全部优势技术大类复杂性之和,技术大类复杂性更新为掌握该技术的各城市适应度倒数之和的倒数,两者每轮均除以当年截面均值归一化,初始值均设为一。用作研究变量,越大代表该城市的技术体系越复杂、创新竞争力越强。因逐年按截面均值归一化,该指标刻画的是同一年度内城市之间的相对位置,不宜直接作跨年度的水平比较。
  • TechComplexityIter20 [技术复杂度(高迭代口径)] — 参考Tacchella等(2012,Scientific Reports)的方法并将迭代轮数由六轮提高至二十轮后重新测算,计算公式与技术复杂度完全一致,仅迭代轮数不同。用作稳健性检验变量,检验结论对迭代轮数的敏感程度;迭代轮数越高头部城市的取值被放大得越明显,两列量纲不同,不可直接比较。该口径下位次靠后的城市其取值指数级趋近于零,仅适合用于排序的稳健性检验,不可取对数,也不宜作水平解读。

常见问题

「各地级市技术复杂度(EFC适应度法)」是什么数据集?
各地级市技术复杂度(EFC适应度法),隶属科技创新。以全量中国发明专利申请构建地区-技术领域矩阵, 先按显性专利比较优势(RPCA>=1)判定地区在各 IPC 四位码技术领域上是否具有比较优势, 再用适应度-复杂
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 10 个变量。核心指标包括:发明专利申请量、技术大类数、显性比较优势领域数、技术复杂度、技术复杂度(高迭代口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,地级市层级。
样本量有多大?
约 13,817 条观测。
数据是如何测算/获取的?
指标定义与计算方法 创新驱动发展战略推动经济地理格局从产业集群转向创新集群,传统以地理距离为边界的区域发展 格局被逐渐打破,城市之间的技术关系日益成为区域竞争与协同的主导线索。技术复杂度指标从产品 复杂度与多样化程度两个视角刻画一个城市的竞争力:高技术复杂度的城市技术研发与产品创新能力 普遍较强,容易在相关产品尤其是高技术产品上形成比较优势,并有较高概率在关联性较强的产品上 同样形成比较优势,因而是创新资源重点集聚、在创新集群发展中更具竞争力的城市。 测度的基础是显性比较优势指数。以发明专利申请数据替代出口贸易额数据,构造显性专利比较优势 指数,衡量一个城市在某一技术领域上的专利份额相对全国该领域平均份额的高低: $$RPCA{ict}=\frac{Patent{ict}\big/\sum{c}Patent{ict}} {\sum{i}Patent{ict}\big/\sum{ic}Patent{ict}},\qquad x{ict}=\begin{cases}0, & RPCA{ict}<1\\ 1, & RPCA{ict}\geqslant 1\end{cases}$$ 其中 $i$ 代表城市,$c$ 代表以国际专利分类四位码划分的技术领域,$t$ 代表年份。当该指数不小于 $1$ 时,表明 $i$ 城市在 $c$ 技术领域上具有显性比较优势。以历年的 $x{ict}$ 构建二维矩阵 $M=(M{ic})$,即"专利空间",其行和就是本数据集给出的显性比较优势领域数。 在专利空间的基础上,采用适应度-复杂度方法构造城市适应度与技术领域复杂性的耦合迭代。相比于 基于线性平均关系的经典方法,该方法采用高度非线性的映射:一个城市的竞争力不仅取决于其掌握 技术的复杂性,还与其多样化程度密切相关;而一项技术的复杂性应由掌握它的城市中适应度最低者 主导,因为一项连低适应度城市都能掌握的技术,其复杂性必然有限。迭代形式为: $$\tilde{F}i^{(n)}=\sumc M{ic}Qc^{(n-1)},\qquad Fi^{(n)}=\frac{\tilde{F}i^{(n)}}{\big\langle \tilde{F}i^{(n)}\big\ranglei}; \qquad \tilde{Q}c^{(n)}=\frac{1}{\sumi M{ic}\dfrac{1}{Fi^{(n-1)}}},\qquad Qc^{(n)}=\frac{\tilde{Q}c^{(n)}}{\big\langle \tilde{Q}c^{(n)}\big\ranglec}$$ 其中 $F$ 表示城市的适应度,$Q$ 表示技术领域的复杂性,上标 $n$ 与 $n-1$ 表示迭代次数, $\langle\cdot\rangle$ 表示向量的算术平均值。初始状态设定为对任意 $c$ 有 $Qc^{(0)}=1$、 对任意 $i$ 有 $Fi^{(0)}=1$。每一轮迭代后两个向量都除以当年截面均值做归一化,因此同一年度 内全部有效城市的适应度均值恒为 $1$,取值可直接读作"相当于当年平均水平的多少倍"。按固定轮数 迭代后得到的 $Fi$ 即本数据集的核心指标技术复杂度。 该迭代不存在使取值稳定下来的收敛点,取值随轮数持续分化,因此轮数本身是一个需要外生给定的 参数,而原文未披露其取值。本数据集以原文报告的创新集群中心城市平均技术复杂度指数为基准做 参数标定,在候选轮数中选取使复现效果最好的六轮作为主口径;同时另行输出一列将迭代轮数提高到 二十轮后的结果,供使用者检验结论对迭代轮数的敏感程度。两列的量纲不同,不宜直接比较。 除上述指标外,本数据集一并给出参与测算的发明专利申请量与技术大类数两个构成量,前者是显性 比较优势指数的分母,也是判断样本厚度的依据,后者刻画城市技术活动的覆盖面。 补充说明 - 样本口径:覆盖地级行政区全集与全部可得年份,不预先施加任何回归样本限制。原文实证部分限定于 2000至2015年的256个地级市,使用者若需复现该口径,可自行按年份与主体筛选。 - 迭代轮数:原文未给出迭代轮数,且该迭代没有使取值稳定下来的收敛点。本实现以原文报告的 中心城市平均技术复杂度为基准,把主口径标定为六轮,并保留二十轮的高迭代列。轮数越高,头部 城市的取值被放大得越明显。 - 方法性质:该指标每年在截面上按均值归一化,刻画的是同一年度内城市之间的相对位置,宜配合 年份固定效应使用,不适合直接作跨年度的水平比较。显性比较优势是相对份额构造,专利高度集中于 少数领域的城市其优势领域数偏少,技术复杂度排名相应靠后,这是方法的固有性质。该指标与专利 规模同向变动较强,建议不与专利数量类变量同时进入同一回归。 - 技术分类口径的时间断点:早年有相当比例的发明专利缺少主分类号,须退回全部分类号的 首项代替,而两者在技术大类层面的一致性在早年明显偏低;这一缺失比例在2004至2006年间迅速 收敛到很低的水平。受此影响,2006年以前的技术分类口径与之后不完全可比,跨这一过渡带的 水平比较与趋势解读不成立,建议以2006年作为实证起点。 - 高迭代列的下尾:二十轮口径下位次靠后的城市其适应度指数级趋近于零,该列只用于检验排序 对迭代轮数的稳健性,不可取对数,也不宜作水平解读。 - 直辖市在两层重复出现:四个直辖市在省级与市级两套数据集中使用相同的行政区划代码与 相同的专利归属,但两层的样本框与归一化基数不同,数值不可互换;把两层数据堆叠会重复计入 这四个主体。 - 其他局限:发明专利自申请到公开存在约十八个月的滞后,最近一至两个申请年的件数偏低, 末年的水平值不宜作趋势解读;地理归属依据申请人地址信息匹配得到,可定位到城市的比例在样本早期明显低于近期,且个别地区的可定位比例系统性偏低,使用者在做跨年比较时宜加入年份固定效应;城市名单采用当前有效的行政区划口径,历史上已撤销或合并的地级市不在名单内,其撤销前年份的专利只能归属到省级,在本数据集中表现为缺失而非零值;专利很少的城市年,其指标由个位数专利决定, 使用者可借发明专利申请量一列自行设定样本门槛;城市层与省级层的适应度各自在本层截面上 归一化,两层数值不可直接比较。 参考文献 - 郑江淮,陈喆,冉征.创新集群的“中心—外围结构”:技术互补与经济增长收敛性研究[J].数量经济技术经济研究,2023,40(1):66-86. - Tacchella A, Cristelli M, Caldarelli G, et al. A new metrics for countries' fitness and products' complexity[J]. Scientific Reports, 2012, 2: 723.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。