各地级市技术互补(技术小类分工法)
「各地级市技术互补(技术小类分工法)」,覆盖 1985-2025 年,频率 年度,地级市层级,含 13 个变量,样本量约 13,817。 以全量中国发明专利申请测算地区之间的技术互补程度: 在每个 IPC 四位码技术大类内部, 两地区若分别专注于不同的 IPC 大组技术小类则构成互补、专注于相同小
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 地级市 |
| 变量数 | 13 |
| 样本量 | 13,817 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 该地级行政区所属省级行政区名称
- ProvinceCode [省份代码] — 该地级行政区所属省级行政区划代码(GB/T 2260六位码)
- City [城市] — 地级行政区名称
- CityCode [城市代码] — 地级行政区划代码(GB/T 2260六位码)
- Year [年份] — 专利申请年份
- PatentCount [发明专利申请量] — 参考郑江淮等(2023,数量经济技术经济研究)的测度框架,计算公式为:该城市当年申请、可归入国际专利分类且按第一申请人所在地归属本城市的发明专利件数,同一申请号只计一次。该字段是各项占比与显性比较优势计算式的分母,同时用于判断样本厚度;发明专利件数很少的城市,其下列指数由个位数专利决定,稳定性较弱。
- TechGroupCount [技术大类数] — 参考郑江淮等(2023,数量经济技术经济研究)以国际专利分类四位码作为技术大类的做法,计算公式为:该城市当年有发明专利分布的国际专利分类四位码技术大类个数。用作衡量技术活动覆盖面的构成量,越大代表该城市涉足的技术大类越多。
- TechSubgroupCount [技术小类数] — 参考郑江淮等(2023,数量经济技术经济研究)以国际专利分类大组作为技术小类的做法,计算公式为:该城市当年有发明专利分布的国际专利分类大组技术小类个数。技术小类是技术大类的下一级细分,用作衡量技术分工细度的构成量,越大代表该城市的技术布局越细分。
- LinkedRegionCount [参与配对城市数] — 计算公式为:当年有发明专利、可与本城市构成城市对的其他城市个数,即下列各项指数取算术平均时的分母。用作判断指数稳定性的构成量。
- TechComplementarity [技术互补指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:先测算城市对指数——在每个技术大类内部,将两城市分别落在不同技术小类上的专利占比两两相乘后求和,再除以两城市该技术大类专利占比乘积的平方根,最后对全部技术大类求和;其中专利占比均以各自城市当年发明专利总件数为分母;城市层面取值为该城市与当年全部有发明专利的其他城市之间上述指数的算术平均。用作研究变量,越大代表该城市与其他城市在同一技术大类内部的差异化分工与合作越紧密。
- TechComplementarityWtd [技术互补指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将技术互补指数的城市对取值按对手城市当年发明专利件数加权平均,以替代等权平均。用作稳健性检验变量,相对等权口径更侧重本城市与创新活跃城市之间的技术互补关系。
- TechCompetition [技术竞争指数] — 参考郑江淮等(2023,数量经济技术经济研究)的方法,计算公式为:先测算城市对指数——在每个技术大类内部,将两城市落在相同技术小类上的专利占比相乘后求和,再除以两城市该技术大类专利占比乘积的平方根,最后对全部技术大类求和;再对当年全部有发明专利的其他城市取算术平均。该指数与技术互补指数构成同一技术大类内部关系的两种分解,二者之和恒等于两城市各技术大类专利占比乘积平方根的总和。用作研究变量,越大代表该城市与其他城市在相同技术小类上的正面竞争越激烈。
- TechCompetitionWtd [技术竞争指数(专利加权)] — 参考郑江淮等(2023,数量经济技术经济研究)基于各地区专利数据赋权的做法,计算公式为:将技术竞争指数的城市对取值按对手城市当年发明专利件数加权平均,以替代等权平均。用作稳健性检验变量。
常见问题
- 「各地级市技术互补(技术小类分工法)」是什么数据集?
- 各地级市技术互补(技术小类分工法),隶属科技创新。以全量中国发明专利申请测算地区之间的技术互补程度: 在每个 IPC 四位码技术大类内部, 两地区若分别专注于不同的 IPC 大组技术小类则构成互补、专注于相同小
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 13 个变量。核心指标包括:发明专利申请量、技术大类数、技术小类数、参与配对城市数、技术互补指数、技术互补指数(专利加权)、技术竞争指数、技术竞争指数(专利加权)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,地级市层级。
- 样本量有多大?
- 约 13,817 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在创新集群的发展格局中,城市与城市之间的关系逐渐从受制于地理邻近性的辐射效应、同行业竞争 关系,转向打破地理半径限制的技术互补格局。所谓技术互补,是指两个城市依靠各自的比较优势, 在同一技术大类内部的不同细分方向上分别开展研发,从而形成产品内的差异化技术分工与合作; 与之相对的技术竞争,则是指两个城市在相同的细分技术方向上正面比拼。技术互补程度越高,说明 城市之间的技术分工与合作越紧密,创新资源配置的地理范围越大。 测度以发明专利申请数据为基础,按年度、城市以及国际专利分类码对专利申请信息进行分类,其中 技术大类采用四位码技术类别,技术小类采用其下一级的大组。对任意两个城市 $i$ 与 $j$,技术 互补指数定义为(该指数由原文承自作者团队此前关于区域技术结构变迁测度的研究): $$Cra{ij}=\sum{g=1}^{G}\left[\frac{1}{\sqrt{Pi^g Pj^g}} \left(\sum{m\in Sg}\sum{n\in Sg,\,n\neq m}pi^m pj^n\right)\right]$$ 其中 $g$ 为技术大类上标,$G$ 为技术大类个数,$Sg$ 为技术大类 $g$ 所含技术小类的集合, $P$ 为技术大类的专利占比(与该城市总专利数之比),$m$ 与 $n$ 分别为城市 $i$ 和 $j$ 的技术 小类上标,$p$ 为技术小类的专利占比(同样以该城市总专利数为分母)。括号内的双重求和只取 $n\neq m$ 的交叉项,即只统计两城市落在不同技术小类上的专利占比乘积,落在同一小类上的部分 被排除在外;开方项则使各技术大类按两城市在该大类上的专利布局强度加权。 与之配套,原文进一步引入技术竞争指数,表征城市间在产品生产上所涉及相同技术领域的程度: $$Tc{ij}=\sum{g=1}^{G}\left[\frac{1}{\sqrt{Pi^g Pj^g}} \left(\sum{m\in Sg}pi^m pj^m\right)\right]$$ 两者构成同一技术大类内部关系的完整分解:由于技术小类唯一归属于一个技术大类,有 $\sum{m\in Sg}pi^m=Pi^g$,因此二者之和恒等于 $\sumg\sqrt{Pi^g Pj^g}$, 这一解析恒等式在实现中用作交叉校验。某个技术大类上一方没有专利时,开方项的分母为零而分子 中相应的占比同样为零,该大类按不贡献处理。 上述两个指数都是城市对层面的度量,而本数据集提供的是城市层面的年度面板,因此需要由城市对聚合 到城市。本数据集对每个城市取其与当年全部有发明专利的其他城市之间指数的算术平均,作为该城市当年 的技术互补指数与技术竞争指数;同时按原文基于各城市专利数据赋权的做法,另行给出以对手城市当年 发明专利件数为权重的加权平均列。加权口径相对等权口径更侧重本城市与创新活跃城市之间的技术关系。 除上述四个指数外,本数据集一并给出发明专利申请量、技术大类数、技术小类数与参与配对的城市数 四个构成量,用于判断样本厚度与指数的稳定性。 补充说明 - 样本口径:覆盖地级行政区全集与全部可得年份,不预先施加任何回归样本限制。原文测度城市间技术 互补时使用1985至2015年的数据,实证部分进一步限定于256个地级市,使用者若需复现该口径, 可自行按年份与主体筛选。 - 由地区对聚合到地区:原文的两个指数都定义在城市对上,并以其全国均值呈现演变趋势;本 数据集为提供城市层面面板,对每个城市在其对手城市上取平均,等权与加权两种聚合方式的定义如 正文所述,这一聚合步骤原文未逐字规定。 - 方法性质:两个指数均为相对份额构造,取值介于零与一之间。需要区分两个层面:在城市对 层面,两个城市各自只有少量专利且恰好落在同一技术大类的不同小类时,互补指数可以趋近上界; 而本数据集交付的是对全部对手城市取平均之后的城市面板列,其方向相反——专利越少的城市年, 面板取值越低。使用者可借发明专利申请量一列自行设定样本门槛,剔除由个位数专利决定的观测。 技术互补与技术竞争互为补集,不宜作为两个独立维度同时进入同一回归。 - 技术分类口径的时间断点:早年有相当比例的发明专利缺少主分类号,须退回全部分类号的 首项代替,而两者在技术大类层面的一致性在早年明显偏低;这一缺失比例在2004至2006年间迅速 收敛到很低的水平。受此影响,2006年以前的技术分类口径与之后不完全可比,跨这一过渡带的 水平比较与趋势解读不成立,建议以2006年作为实证起点。 - 直辖市在两层重复出现:四个直辖市在省级与市级两套数据集中使用相同的行政区划代码与 相同的专利归属,但两层的样本框与归一化基数不同,数值不可互换;把两层数据堆叠会重复计入 这四个主体。 - 其他局限:发明专利自申请到公开存在约十八个月的滞后,最近一至两个申请年的件数偏低, 比率型指标受此影响小于水平型指标;地理归属依据申请人地址信息匹配得到,可定位到城市的比例在样本早期明显低于近期,且个别地区的可定位比例系统性偏低,使用者在做跨年比较时宜加入年份固定效应;城市名单采用当前有效的行政区划口径,历史上已撤销或合并的地级市不在名单内,其撤销前年份的专利只能归属到省级,在本数据集中表现为缺失而非零值;城市层与省级层的技术谱宽度不同,同年 省级层的指数系统性高于城市层,两层数值不可直接比较。 参考文献 - 郑江淮,陈喆,冉征.创新集群的“中心—外围结构”:技术互补与经济增长收敛性研究[J].数量经济技术经济研究,2023,40(1):66-86. - 郑江淮,陈喆,孙志燕,等.从竞争到互补:区域技术结构变迁的测度与理论假说[J].经济评论,2022,(1):13-29.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。