各地级市技术相关与非相关多样化(IPC熵分解法)

「各地级市技术相关与非相关多样化(IPC熵分解法)」,覆盖 2000-2025 年,频率 年度,地级市层级,含 13 个变量,样本量约 8,753。 参考高旻昱等(2020)的方法,基于全量中国专利的国际专利分类(IPC)在不同聚合层级上的熵值,将各地级及以上城市知识结构的技术多样化分解为相关多样化与非相关多

时间跨度2000-2025 年
数据频率年度
层级地级市
变量数13
样本量8,753
是否可合并可与同主体数据集合并

字段字典

  • Province [省份] — 该城市所属省级行政区名称
  • ProvinceCode [省份代码] — 该城市所属省级行政区划代码(GB/T 2260六位码)
  • City [城市] — 地级及以上城市名称
  • CityCode [城市代码] — 地级行政区划代码(GB/T 2260六位码)
  • Year [年份] — 专利申请年份
  • PatentCount [专利申请件数] — 该市当年可归属到本级行政区的专利申请件数,按申请号去重后计数。用于判断熵指标所依据的样本是否充分,件数很少时熵值的统计不确定性较大
  • SectionCount [活跃技术部数] — 该市当年专利所涉及的国际专利分类(IPC)部的数量,取值范围为0至8。为非相关多样化的求和项数,其自然对数即该指标的理论上限
  • ClassCount [活跃技术大类数] — 该市当年专利所涉及的国际专利分类(IPC)大类(二位数分类)的数量。为二位数分类熵的求和项数,其自然对数即该熵的理论上限
  • SubclassCount [活跃技术小类数] — 该市当年专利所涉及的国际专利分类(IPC)小类(三位数分类)的数量。为三位数分类熵的求和项数,其自然对数即该熵的理论上限
  • ClassEntropy [二位数分类熵] — 参考高旻昱等(2020,人文地理)式(3)的方法,计算公式为:sum_n P_n*ln(1/P_n),其中P_n为该市当年落入IPC大类n的计数占该地当年全部计数的比重。计数以专利与其涉及的每个不同IPC小类的配对为单位,大类计数由小类计数聚合得到。为相关多样化的减项
  • SubclassEntropy [三位数分类熵] — 参考高旻昱等(2020,人文地理)式(3)的方法,计算公式为:sum_m P_m*ln(1/P_m),其中P_m为该市当年落入IPC小类m的计数占该地当年全部计数的比重。计数以专利与其涉及的每个不同IPC小类的配对为单位。为相关多样化的被减项
  • RelatedVariety [相关多样化] — 参考高旻昱等(2020,人文地理)式(3)的方法,按Theil熵分解计算,计算公式为:三位数分类熵减去二位数分类熵,即sum_m P_m*ln(1/P_m)-sum_n P_n*ln(1/P_n)。由于大类份额由其下属小类份额加总得到,该差值恒等于各大类内部熵值以大类份额为权重的加权平均,因而恒为非负。用作研究变量,越大代表该市的技术在认知邻近的同一大类内部分布越分散、知识溢出的基础越好
  • UnrelatedVariety [非相关多样化] — 参考高旻昱等(2020,人文地理)式(2)的方法,计算公式为:sum_k P_k*ln(1/P_k),其中k遍历IPC的8个部,P_k为该市当年落入部k的计数占该地当年全部计数的比重,部的计数由小类计数聚合得到。取值范围为0至ln(8)。用作研究变量,越大代表该市的技术在彼此技术壁垒很高的门类之间分布越广、跨领域重组与抗风险的潜力越强

常见问题

「各地级市技术相关与非相关多样化(IPC熵分解法)」是什么数据集?
各地级市技术相关与非相关多样化(IPC熵分解法),隶属科技创新。参考高旻昱等(2020)的方法,基于全量中国专利的国际专利分类(IPC)在不同聚合层级上的熵值,将各地级及以上城市知识结构的技术多样化分解为相关多样化与非相关多
该数据集的时间范围是?
覆盖 2000-2025 年。
包含哪些变量/指标?
共 13 个变量。核心指标包括:专利申请件数、活跃技术部数、活跃技术大类数、活跃技术小类数、二位数分类熵、三位数分类熵、相关多样化、非相关多样化。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,地级市层级。
样本量有多大?
约 8,753 条观测。
数据是如何测算/获取的?
指标定义与计算方法 城市的技术知识结构不仅体现在创新数量上,更体现在知识的构成方式上。经济地理学的一个基本判断是:并非所有形式的多样化都以同样的方式推动创新。当一座城市聚集的技术分属彼此认知邻近、共享相似知识基础与技能要求的领域时,跨领域的人员流动、信息交流与技术重组更容易发生,知识溢出的渠道更为顺畅,这种结构被称为相关多样化;而当一座城市同时拥有彼此差异极大、认知距离遥远的技术门类时,城市获得的是抵御单一产业冲击的稳健性,以及在互不相干的知识体系之间实现突破性重组的可能,这种结构被称为非相关多样化。两者并非同一维度上的高低,而是对同一构念——区域知识结构的多样化程度——从两个互为反面的角度所作的分解。 本数据集参考高旻昱、曾刚、王丰龙(2020)的方法,以国际专利分类(IPC)在不同聚合层级上的熵值来测度这两类多样化,构造层级与原文一致。这一思路最早由 Frenken、Van Oort 和 Verburg(2007)提出并用于分析区域经济增长,其核心洞察在于:技术分类体系本身是分层嵌套的,粗层级之间的差异对应"不相关",而细层级在同一粗层级内部的差异对应"相关",因此只要选定分类体系的聚合层级,多样化就可以被熵指标干净地分解。IPC 恰好提供了这样一个层层嵌套的体系,本数据集使用其中三个层级:最粗的部、居中的大类、最细的小类。八个部之间的技术壁垒很高,跨部的知识很难直接互通;而同一大类下的若干小类在技术原理上高度接近。 计算的基本计数单位是"一件专利申请与其所涉及的每一个不同技术小类的配对"。一件专利常常同时标注多个分类号,原文明确要求在这种情况下让该专利在其所属的每个类别中都计入;相应地,当一件专利的多个分类号恰好落在同一个小类之内时,它只被视作属于这一个类别,计入一次。在此基础上,更粗层级的计数由小类计数聚合得到,而不是在每一层各自重新去重。这一处理是熵分解得以严格成立的前提:只有当三个层级共用同一个分母、且粗层级的份额恰好等于其下各细层级份额之和时,两个层级的熵之差才恰好等于分解式中的组内项。 记 $P{k,it}$ 为城市 $i$ 在第 $t$ 年落入部 $k$ 的计数占该城市当年全部计数的比重,非相关多样化取部层的分布熵: $$UV{it}=\sum{k=1}^{8}P{k,it}\ln\left(\frac{1}{P{k,it}}\right)$$ 求和遍历 IPC 的八个部。该指标在城市的专利全部集中于单一技术部时取到最小值零,在八个部之间均匀分布时取到最大值 $\ln 8$。它衡量的是城市知识在互不相关的技术门类之间铺开的广度。 相关多样化则按 Theil 熵分解构造,取小类层熵值与大类层熵值之差: $$RV{it}=\sum{m}P{m,it}\ln\left(\frac{1}{P{m,it}}\right)-\sum{n}P{n,it}\ln\left(\frac{1}{P{n,it}}\right)$$ 其中 $P{m,it}$ 与 $P{n,it}$ 分别为小类 $m$ 与大类 $n$ 的计数占比,$m$ 遍历全部小类、$n$ 遍历全部大类。由于大类份额由其下属小类份额加总得到,这一差值恒等于各大类内部熵值以该大类份额为权重的加权平均,即 $RV{it}=\sum{n}P{n,it}H{n,it}$,因而恒为非负。其经济含义十分明确:它度量的是在已经知道一件专利属于哪个大类之后,该城市的技术在这个大类内部仍然表现出的分散程度——这正是认知邻近、易于相互溢出的那部分多样性。两式中出现零份额的类别按熵的标准约定处理,即 $0\cdot\ln(1/0)$ 记为零,实际计算中只对份额为正的类别求和。 为便于判断测度所依据的样本是否充分,数据集同时给出该城市当年按申请号去重后的专利申请件数,以及在部、大类、小类三个层级上各自涉及的活跃技术类别数量。这些量是熵计算的直接构件——熵值的理论上限即为活跃类别数的自然对数——它们本身不是独立的研究指标,但在专利规模较小的城市年份上,它们能够直接提示熵指标的统计不确定性。作为中间量,大类层与小类层的分布熵也一并给出,使用者可据此复核相关多样化的构成。 补充说明 - 样本口径:覆盖全部地级及以上城市与全部可得年份,不预先施加任何地区或时段筛选,也不对指标作缩尾处理。原文的样本限定为长三角城市群,本数据集不作此收窄,使用者可按城市编码自行筛选。专利件数很少的城市年份,其熵值的统计不确定性较大;建议结合专利申请件数自行设定样本门槛,并在回归中加入城市与年份固定效应。 - 无专利年份的取值:当某城市某年没有可归属的专利时,熵的分母为零、指标在数学上无定义,此时各熵指标记为缺失而非零;专利件数与活跃类别数则记为零。仅涉及单一技术小类的城市年份,其两项多样化指标均为零,这是真实的取值而非缺失。 - 与原文的可比性:原文的专利数据来自官方的城市统计口径,本数据集则基于全量专利库并依据申请人地址完成地理归属,两者在专利的地理可定位性与每件专利的分类标注完备程度上存在差异。以原文样本区间与城市范围复算的结果显示,非相关多样化的水平与分布区间同原文报告值高度一致,城市间专利规模的排序结构也与原文描述相符;相关多样化的离散程度以及两项指标之间的相关结构与原文吻合,但其水平值高于原文报告值。水平差异的具体来源无法确知:实测显示本数据库中多数专利仅涉及单一技术小类,因此差异并非分类标注过多所致;可能的来源包括原文所用官方统计在分类标注方式上的差异,以及无法完成地理归属的个人申请(其技术分布更为集中)未能进入样本。因此本指标适合用于城市之间和年份之间的比较,其绝对水平不宜与原文报告的数值直接对照。 - 测度与创新规模的关系:熵值与城市的专利规模正相关——专利越少,被观测到的技术类别越少,熵的取值上限也越低。因此本指标在跨城市比较时隐含地包含了城市创新规模的影响,并非纯粹的结构指标。专利规模较小的城市,其较低的多样化取值中有相当一部分来自样本量而非真实的技术集中;在回归中使用固定效应或控制专利件数可缓解这一点。 - 时间维度的解读(重要):两项多样化指标在样本期内呈明显上升,但这一上升主要由专利规模的扩张所驱动。若在同一专利规模区间内比较不同年份,上升趋势即告消失并转为下降——也就是说,在给定的创新规模下,城市技术结构实际上略微趋向专业化。使用者在做时间维度的分析时,应加入年份固定效应,或将专利申请件数作为控制变量,否则会把专利规模扩张与地理归属覆盖改善误读为知识结构本身的多样化。 - 与创新水平的区别:非相关多样化与城市的技术门类构成密切相关,专利高度集中于信息与电子技术的地区,其非相关多样化必然偏低。这是指标的应有之义——专业化的反面即为非多样化,因此创新强度很高但技术门类集中的城市会呈现较低的非相关多样化取值。两项指标刻画的是知识结构而非创新水平,不宜作为创新能力的代理变量使用。 - 专利公开滞后:专利从申请到公开存在约一年半的滞后,最近一至两个申请年度的专利件数尚未完全进入数据库。由于这种缺失在各城市之间近似均匀,而熵属于比率型指标、对规模不敏感,两项多样化指标在末尾年份的变动幅度远小于它们在城市之间的离散程度,受影响有限;但专利申请件数本身明显低于最终值,涉及件数的分析应避开末尾年份。 - 地理归属的覆盖与缺口:可完成城市级归属的专利比例在样本期内由不足六成升至接近九成,跨年度比较受此影响,年份固定效应可吸收其中的共同成分。此外,工商登记信息在部分地区收录相对稀薄,这些城市的归属率明显低于同类城市;个人申请人的专利无法归属到城市,且这部分在经济欠发达城市占比更高。后两者属系统性而非随机缺失。相应地,没有可归属专利的城市年份绝大多数出现在样本期前段并集中于西部省份的自治州,它们在回归中会被成列剔除,使早期样本偏向东中部城市。 - 行政区划口径:城市名单采用当前有效的行政区划,历史上已撤销或并入其他城市的地级市不在名单之内,其撤销前年份的专利只能归入省级层面,对这些地区表现为缺失而非零值。平衡面板按各城市的实际存续区间展开,设立之前的年份不产生观测。 参考文献 - 高旻昱,曾刚,王丰龙.相关多样化、非相关多样化与区域创新产出——以长三角地区为例[J].人文地理,2020,35(5):103-110. - Frenken K, Van Oort F, Verburg T. Related variety, unrelated variety and regional economic growth[J]. Regional Studies, 2007,41(5):685-697. - Castaldi C, Frenken K, Los B. Related variety, unrelated variety and technological breakthroughs: An analysis on US state-level patenting[J]. Regional Studies, 2015,49(5):767-781.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。