各地级市技术关联性与多样性
「各地级市技术关联性与多样性」,覆盖 1985-2025 年,频率 年度,地级市层级,含 10 个变量,样本量约 12,910。 参考冉征等(2025,中国工业经济)的技术空间指标体系,基于全量中国发明专利的IPC小类显性比较优势与技术领域引用联系矩阵,测度各地级市技术集群结构的集约边际(
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 地级市 |
| 变量数 | 10 |
| 样本量 | 12,910 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260六位码)
- City [城市] — 地级行政区名称
- CityCode [城市代码] — 地级行政区划代码(GB/T 2260六位码)
- Year [年份] — 专利申请年份
- TechRelatedness [技术关联性] — 参考冉征等(2025,中国工业经济)的方法,衡量技术集群的集约边际,计算公式为:该市各显性优势技术领域之间跨领域技术联系强度的加总除以优势技术领域个数,即link=(X·Φ·X^T-对角项)/diver,其中X为该市在各IPC小类上是否具有显性技术优势的0/1向量,Φ为技术联系矩阵(由全部年份发明专利跨领域引用频次按引用方作行标准化得到,不随年份变化),diver为优势技术领域个数;主口径剔除Φ对角元即不计同一技术领域内部的自我引用。取值介于0与1之间。用作研究变量,越大代表该市各技术领域之间知识联系越紧密、技术结构越趋于专业化集聚
- TechDiversity [技术多样性] — 参考冉征等(2025,中国工业经济)的方法,衡量技术集群的广延边际,计算公式为:该市显性技术比较优势指数RTCA大于等于1的IPC小类个数,其中RTCA=(该市某技术领域发明专利件数/该市全部领域件数)/(全国该领域件数/全国全部领域件数)。用作研究变量,越大代表该市具备比较优势的技术领域越广
- TechRelatednessInclDiag [技术关联性(含同领域自引)] — 参考冉征等(2025,中国工业经济)的方法并保留技术联系矩阵对角元后计算,计算公式为:在技术关联性的分子中一并计入同一IPC小类内部的自我引用,即link=X·Φ·X^T/diver。用作稳健性检验变量,与主口径的差额即同技术领域内部知识循环的贡献
- TechRelatedness08 [技术关联性(优势阈值0.8)] — 参考冉征等(2025,中国工业经济)稳健性检验中调整优势技术领域标准的做法,计算公式为:将显性技术优势的判定阈值由RTCA大于等于1放宽至RTCA大于等于0.8后重新构造0/1优势向量,再按技术关联性主口径同一公式(剔除对角元)计算。用作稳健性检验变量
- TechDiversity08 [技术多样性(优势阈值0.8)] — 参考冉征等(2025,中国工业经济)稳健性检验中调整优势技术领域标准的做法,计算公式为:该市显性技术比较优势指数RTCA大于等于0.8的IPC小类个数。用作稳健性检验变量
常见问题
- 「各地级市技术关联性与多样性」是什么数据集?
- 各地级市技术关联性与多样性,隶属科技创新。参考冉征等(2025,中国工业经济)的技术空间指标体系,基于全量中国发明专利的IPC小类显性比较优势与技术领域引用联系矩阵,测度各地级市技术集群结构的集约边际(
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 10 个变量。核心指标包括:技术关联性、技术多样性、技术关联性(含同领域自引)、技术关联性(优势阈值0.8)、技术多样性(优势阈值0.8)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,地级市层级。
- 样本量有多大?
- 约 12,910 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 技术集群是以新技术和新产业培育为导向、由创新主体与研发资源在地理上集聚形成的技术空间结构。与强调生产关联的产业集群不同,技术集群刻画的是一个地区所掌握的技术领域组合及这些领域之间的知识联系。冉征、刘修岩和陈露(2025)在《中国工业经济》上提出,可以从两个维度描述地区的技术集群结构:广延边际衡量地区掌握的技术领域范围有多宽,对应技术多样性;集约边际衡量这些领域之间的知识联系有多紧密,对应技术关联性。二者对后续创新活动的影响方向并不相同——技术多样性的提升为突破性创新营造了更好的外部环境,而技术关联性的提高在降低学习成本的同时,也可能强化路径依赖、挤出真正的颠覆式创新,形成所谓关联性"陷阱"。本数据集依照该文的技术空间指标体系,在地级行政区层面测度这两个指标。 测度的基础是地区在各技术领域上的显性技术比较优势。技术领域以国际专利分类中的小类(四位码,如 H04L)为划分标准,专利数量以发明专利申请件数计。对于地区 $c$ 在技术领域 $i$ 上的显性比较优势指数,有 $$RTCA{ci}=\frac{Patent{ci}\big/\sum{i}Patent{ci}}{\sum{c}Patent{ci}\big/\sum{ci}Patent{ci}}$$ 其中 $Patent{ci}$ 为地区 $c$ 在技术领域 $i$ 的发明专利申请件数。该式的含义是:当地区 $c$ 在领域 $i$ 上的专利份额高于该领域在全国的占比时,该地区在这一领域具备比较优势。据此定义二值化的优势指示变量 $x{ci}$,当 $RTCA{ci}\ge 1$ 时取 1,否则取 0。逐年对全部地区与领域构造 $x{ci}$,即得到当年的地区—技术二维优势矩阵 $X$。以显性比较优势而非专利绝对数量为基础,目的是排除专利数量快速增长对技术空间规模的干扰。 技术领域之间的联系强度由技术联系矩阵刻画。其思路是:若大量属于领域 $i$ 的专利在研发中引用了领域 $i'$ 的专利,说明两个领域共同依赖的科学原理更广泛、彼此之间的知识溢出效应更强。利用发明专利的后向引用信息,匹配引用双方各自的技术领域,得到"引用领域—被引领域"的发生频次,再按引用方所在领域作行标准化: $$\Phi{ii'}=\frac{cite{i\leftarrow i'}}{\sum{i'}cite{i\leftarrow i'}}$$ 式中 $cite{i\leftarrow i'}$ 为领域 $i$ 的专利引用领域 $i'$ 专利的频次,分母为领域 $i$ 对外引用的总频次。该矩阵使用全部可得年份的发明专利相互引用样本一次性构造,不随年份变化,以保证技术领域间联系的客观性、外生性与稳定性;由于按引用方标准化,$\Phi$ 是非对称矩阵且每行元素之和为 1。 在优势矩阵与联系矩阵的基础上构造两个核心指标。技术多样性为地区拥有显性优势的技术领域个数,反映技术集群的广延边际: $$diverc=\big|\vec{Xc}\big|=\sum{i}x{ci}$$ 技术关联性为地区各优势领域之间联系强度的加总,经标准化后反映技术集群的集约边际: $$linkc=\frac{\vec{Xc}\,\Phi\,(\vec{Xc})^{T}}{kc^{2}}$$ 其中 $\vec{Xc}$ 为矩阵 $X$ 的第 $c$ 行即该地区的显性比较优势向量。分母遵循余弦相似度的思路作标准化处理,$kc$ 取该向量的欧几里得范数,故 $kc^{2}=\sumi x{ci}^{2}=diverc$。由此得到的技术关联性取值介于 0 与 1 之间,数值越大表示该地区所掌握的各技术领域之间知识联系越紧密、技术结构越趋于专业化集聚;技术多样性数值越大表示该地区具备比较优势的技术领域越广。 除上述主口径外,本数据集一并提供两组稳健性度量。其一是将判定显性技术优势的阈值由 1 放宽至 0.8 后重新计算的技术关联性与技术多样性,对应原文稳健性检验中"调整优势技术领域标准"的处理。其二是在技术关联性的分子中保留联系矩阵对角元后的版本,即把同一技术领域内部的自我引用也计入联系强度。 补充说明 - 分母的标准化项:原文的技术关联性表达式中分母记为 $kc^2$ 而未对 $kc$ 另作定义。本数据集据其“遵循余弦相似度的思路”的表述,取 $kc$ 为优势向量的欧几里得范数,故 $kc^2$ 等于优势领域个数。该取法可由量纲约束确认:联系矩阵每行之和恒为 1,分子不会超过优势领域个数;若把分母理解为优势领域个数的平方,指标上界将随多样性增大迅速趋零,与原文报告的取值范围不相容。 - 同领域自引的处理:原文未说明分子是否包含联系矩阵的对角元。本数据集以剔除对角元者为主口径,依据是对原文所报告取值范围的标定——按原文展示口径复算,剔除对角元的版本恰好铺满原文给出的区间,而保留对角元的版本有六成以上观测超出其上限、最小值也明显高于该区间下端;同一图上技术多样性的范围两者一致,说明差异仅来自对角元。保留对角元的版本作为稳健性字段一并提供,两者地区排序高度一致、水平值存在系统性差距。 - 计数与矩阵构造口径:一件专利涉及多个技术领域或多个地区申请人时,在每个领域、每个地区各计一件,同一件专利在同一“地区—领域”组合内只计一次;地区归属采用全部申请人而非仅第一申请人。这与技术空间文献的通行做法一致,且显性比较优势是份额比值、分子分母同口径,不引入系统性偏向。技术联系矩阵只保留引用双方均为中国发明专利的引用关系(被引方为境外专利时无从匹配技术领域),每条引用关系按双方各自的全部领域组合计入,因此同时归入多个领域的专利会被相应加权。 - 指标解读要点:技术多样性衡量的是相对专业化的广度而非创新的绝对规模;专利高度集中于少数前沿领域的地区,其优势领域个数可能低于技术门类均衡的地区,即便前者专利总量更大,以创新规模为对象的研究应另行控制专利总量。技术多样性取 0 表示该地区当年没有任何可归属的发明专利,而非“有专利但无优势领域”——只要有一件可归属专利,显性比较优势的加权平均恒为 1,必有领域达到阈值。优势领域个数很小时两个关联性指标会退化:只有一个优势领域时主口径结构性地取 0、保留对角元的版本等于该领域的对角值;地区当年专利较少时,个别领域的少量专利即可越过判定阈值。建议为回归样本设定最小优势领域数或最小专利规模门槛。 - 两个指标的共线性:技术关联性可展开为“优势领域集合内各领域引用回流份额的均值”,对该集合按包含关系单调不减,因而与技术多样性高度相关,不宜当作彼此独立的两个维度放进同一个回归。建议先把技术关联性对技术多样性的对数做年度内残差化,或改用与“同等多样性下随机基准”之差的正交化度量。 - 地理归属的覆盖特征:专利的地区归属依据申请人名称与企业注册登记信息识别,覆盖率在样本期内大幅上升,前段一度有九成以上的发明专利无法归属到具体地区。以专利规模最大的一组地区构成固定子样本重算可见,指标水平在样本期中段之后才趋于平稳,故更早年份的水平值不具跨年可比性,建议回归样本起始年设在样本期中段之后,更早年份仅作描述性背景。此外注册登记信息在部分地区收录相对稀薄,其定位率系统性偏低,属非随机缺失,建议纳入地区与年份固定效应;个人申请人与境外主体无法归属到具体地区。 - 主体口径与末年数据:地区名单采用当前有效的行政区划,历史上已撤销或合并的地级市不在名单内,其撤销前年份的专利只能归入省级,在市级层面表现为系统性缺失而非真实的零。各城市进入面板的起始年取自其在区域统计数据中的覆盖首年而非行政建制年,故部分长期存在的城市其面板起始年晚于样本期开端,这些城市更早年份虽可算出取值但不在交付面板内;省级层不存在该情形。四个直辖市在本数据集与省级数据集中使用相同的行政区划代码但取值不同——显性比较优势的全国分母在两层分别由各自的地区集合加总,省级分母包含仅能归属到省的专利而市级不含,跨层拼接控制变量时请择一使用。发明专利自申请到公开存在法定滞后期,最近一个申请年度的可见量低于完整年份;因该指标为相对份额,全局缺口大体自抵,末年未出现水平塌陷,但计数型的技术多样性仍比比率型的技术关联性更敏感。 参考文献 [1]冉征,刘修岩,陈露.技术集群结构与颠覆式创新——兼论关联性"陷阱"的突破路径[J].中国工业经济,2025,(10):78-96. [2]Pinheiro F L, Hartmann D, Boschma R, et al. The time and frequency of unrelated diversification[J]. Research Policy, 2022, 51(8): 104323. [3]Hidalgo C A, Klinger B, Barabasi A L, et al. The product space conditions the development of nations[J]. Science, 2007, 317(5837): 482-487. [4]Rigby D L. Technological relatedness and knowledge space: entry and exit of US cities from patent classes[J]. Regional Studies, 2015, 49(11): 1922-1937. [5]Boschma R, Balland P A, Kogler D F. Relatedness and technological change in cities: the rise and fall of technological knowledge in US metropolitan areas from 1981 to 2010[J]. Industrial and Corporate Change, 2015, 24(1): 223-250.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。