各省知识复杂度(专利双峰网络法)
「各省知识复杂度(专利双峰网络法)」,覆盖 1985-2025 年,频率 年度,省级层级,含 8 个变量,样本量约 1,271。 基于中国全量专利构建区域-技术双峰网络, 按相对技术优势(RTA)判定区域在各技术类别上是否具有比较优势, 经反射迭代/特征向量法测算区域知识复杂度(KCI),
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 8 |
| 样本量 | 1,271 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260,6位数字)
- Year [年份] — 专利申请年度
- PatentCount [测度用专利件数] — 参考张翼鸥和谷人旭(2018,地理学报)的双峰网络模型与杨君等(2022,南京财经大学学报)的方法,计算公式为:该省份当年申请且可归入国际专利分类大类的专利件数(同一申请号只计一次)。该字段是相对技术优势计算式的分母,同时用于判断样本厚度;专利件数很少的省份,其下列复杂度指标由个位数专利决定,稳定性较弱。
- Diversity [技术多样性] — 参考张翼鸥和谷人旭(2018,地理学报)的方法,计算公式为:该省份当年具有相对技术优势的国际专利分类大类数量,即该省份在省份-技术双峰网络中的度数中心性。某技术类别具有相对技术优势,是指该省份在该技术类别上的专利占其全部专利的比例,不低于全国该技术类别专利占全国全部专利的比例。用作研究变量,越大代表该地区技术结构越多元。
- Ubiquity [技术平均遍在性] — 参考张翼鸥和谷人旭(2018,地理学报)的方法,计算公式为:该省份具有相对技术优势的各技术类别,分别统计全国有多少个省份同样在该技术类别上具有相对技术优势,再对这些数量取算术平均。用作研究变量,越大代表该地区掌握的技术越普遍、越容易被其他地区模仿,知识的创新门槛越低。
- KCI [知识复杂度] — 参考张翼鸥和谷人旭(2018,地理学报)的双峰网络模型,计算公式为:将省份-技术二元双峰矩阵作行标准化,与其转置矩阵的行标准化结果相乘得到省份间方阵,取该方阵按特征值降序排列的第二个特征向量作为原始知识复杂度;其符号取与技术平均遍在性负相关的方向;再按杨君等(2022,南京财经大学学报)的做法逐年标准化,即减去当年所有省份的均值后除以当年标准差。用作研究变量,越大代表该地区生产的知识越复杂、越难被其他地区模仿。因按年度标准化,该指标刻画的是同一年度内地区之间的相对位置,不宜直接作跨年度的水平比较。
- KCIReflection [知识复杂度(反射迭代法)] — 参考杨君等(2022,南京财经大学学报)的方法,计算公式为:以技术多样性与技术遍在度为初始值,按反射法交替迭代20次,每一轮中省份取值更新为其具有相对技术优势的各技术上一轮取值的平均数,技术取值更新为具有该技术相对优势的各省份上一轮取值的平均数;迭代结果的符号取与技术平均遍在性负相关的方向,再逐年标准化。用作稳健性检验变量,与知识复杂度互为交叉验证;当双峰网络的第二、第三特征值接近时,反射迭代在有限步内难以完全分离,两者可能出现分歧。
常见问题
- 「各省知识复杂度(专利双峰网络法)」是什么数据集?
- 各省知识复杂度(专利双峰网络法),隶属科技创新。基于中国全量专利构建区域-技术双峰网络, 按相对技术优势(RTA)判定区域在各技术类别上是否具有比较优势, 经反射迭代/特征向量法测算区域知识复杂度(KCI),
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 8 个变量。核心指标包括:测度用专利件数、技术多样性、技术平均遍在性、知识复杂度、知识复杂度(反射迭代法)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 1,271 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识复杂度刻画一个地区所生产知识的稀缺程度与不可模仿性。其出发点是:并非所有知识都具有同等价值,少数知识因难以被复制而成为地区长期竞争优势的根源。一个地区如果能够生产其他地区难以模仿的知识,就拥有复杂的知识构成;反之,如果它所掌握的技术在各地普遍存在,则其知识处在创新门槛较低的领域。与专利数量这类规模指标不同,知识复杂度衡量的是知识结构的质量维度,两者虽然正相关,但在排序上会出现明显分化。 测度的核心分析对象是地区与技术类别构成的双峰网络。以专利申请年份标定新知识的生产时间,按主分类号将每件专利归入唯一的国际专利分类大类,并以第一申请人所在地确定其地区归属,由此得到"地区—技术类别"的专利计数矩阵。在此基础上判定地区在各技术类别上是否具有相对技术优势:若某地区在某技术类别上的专利占其全部专利的比例,不低于该技术类别专利占全国全部专利的比例,则认为该地区在该技术上具有相对优势,取值为一,否则为零。设 $patents{c,p}$ 为地区 $c$ 在技术类别 $p$ 上的专利件数,则二元双峰矩阵 $M$ 的元素定义为 $$M{c,p}=\begin{cases}1, & \dfrac{patents{c,p}\big/\sum{p}patents{c,p}}{\sum{c}patents{c,p}\big/\sum{c}\sum{p}patents{c,p}}\ \ge\ 1\\[2ex] 0, & \text{其他}\end{cases}$$ 由该矩阵可直接得到网络中两类节点的度数中心性。地区一侧的度数中心性即技术多样性 $K{c,0}=\sum{p}M{c,p}$,表示该地区具有相对技术优势的技术类别总数,反映其技术结构的广度。技术一侧的度数中心性 $K{p,0}=\sum{c}M{c,p}$ 表示全国有多少个地区同样在该技术上具有相对优势,是该技术遍在程度的直接度量。把某地区所拥有的各项优势技术的遍在程度取平均,即得到地区层面的技术平均遍在性 $$K{c,1}=\frac{1}{K{c,0}}\sum{p}M{c,p}K{p,0}$$ 技术多样性与技术平均遍在性通常呈负向关系:在少数技术领域拥有优势、且这些技术并不普遍的地区,往往生产着最为复杂的新知识;而技术种类繁多但集中于低门槛领域的地区,其知识复杂度并不高。单独使用其中任何一个都不足以刻画知识复杂度,需要把两者的信息反复交换、逐层提炼。 这一提炼通过反射法实现:地区的取值更新为其全部优势技术上一轮取值的平均数,技术的取值更新为掌握该技术的各地区上一轮取值的平均数,两者交替进行 $$K{c,m}=\frac{1}{K{c,0}}\sum{p}M{c,p}K{p,m-1},\qquad K{p,m}=\frac{1}{K{p,0}}\sum{c}M{c,p}K{c,m-1}$$ 每一次迭代都会提升估计的精细程度,当两侧取值趋于稳定时迭代停止,此时的地区取值即知识复杂度的原始指标。本数据集取二十次迭代作为稳健性口径。 主口径则采用该反射过程的等价谱解法,它不依赖迭代次数的人为选择,数值上唯一确定。具体做法是先对双峰矩阵 $M$ 作行标准化得到 $\tilde{M}$,再对其转置矩阵作行标准化得到 $\tilde{M}'$,构造地区之间的方阵 $B=\tilde{M}\tilde{M}'$。该方阵主对角线上的元素对应技术的平均遍在性,其按特征值降序排列的第二个特征向量即各地区的知识复杂度。由于特征向量的符号在数学上是任意的,需要外部锚定方向;本数据集依据"遍在性越高则知识越易被模仿、复杂度越低"这一构念本身,取与技术平均遍在性负相关的方向。 最后对原始指标作标准化处理,减去当年全部地区的均值再除以当年的标准差 $$KCI'{c}=\frac{KCI{c}-\langle KCI\rangle}{Stdev(KCI)}$$ 标准化后的指标取值越大,代表该地区生产的知识越复杂、越难被其他地区模仿。数据集同时提供谱解法与反射迭代法两套结果,两者互为交叉验证。 补充说明 - 样本口径:覆盖全部省级行政区与全部可得的专利申请年份,不预先施加行业、专利类型或地域限制。原文分别限定在二百九十三个和二百六十六个地级市、并截取特定年段,本数据集不作此收窄,使用者可按研究需要自行筛选年份与主体。 - 样本厚度与指标稳定性:相对技术优势由地区自身的技术构成比例决定,专利件数很少的地区,其优势判定可能由个位数专利左右,知识复杂度会随之出现较大波动并可能取到极端值。数据集提供测度用专利件数字段,建议在回归中设定最低专利量门槛,或加入地区与年份固定效应。 - 技术类别口径:原文剔除个别非常规类别后分别保留一百二十二类和一百一十七类,本数据集不预先剔除,采用数据中实际出现且编码规范的全部国际专利分类大类。多保留的均为极稀有类别,对相对技术优势判定与复杂度排序的影响很小。 - 主分类号的补充规则:测度要求按主分类号归类,但早期年份的主分类号标注存在较大比例缺失。缺失时改取该专利分类列表中的首个分类号。两者同时存在时,在大类层面的一致比例较高,仅含单一分类号的专利则完全一致。该规则使早期年份得以进入测度,代价是早期的技术类别归属含有一定误分类,会使早期技术多样性略偏高。 - 专利授权状态:其中一篇原文使用授权专利。本数据集使用全部申请专利,因为在按申请年份标定的框架下限定授权状态会叠加审查周期的滞后,系统性压低近年数值。 - 时间窗口与标准化的含义:原文按十年期分段构建网络,本数据集逐年独立构建,以配合年度面板的使用需求;窗口更短意味着专利量较小的地区年际波动更大。又因标准化按年度截面进行,知识复杂度反映的是同一年度内地区之间的相对位置,其年度均值恒为零,不宜直接作跨年度的水平比较;若需考察演化趋势,建议使用技术多样性与技术平均遍在性,或在模型中引入年份固定效应。 - 两套口径的分歧:谱解法与反射迭代法在理论上收敛到同一结果。当双峰网络的第二与第三特征值较为接近时,有限步的反射迭代难以完全分离两者,此时两列会出现分歧,这属于反射法本身的性质。 - 其他局限:专利自申请至公开存在约十八个月的滞后,最近一至两个申请年的专利件数偏低,水平型字段受影响更直接,按年度标准化的复杂度指标受影响相对较小。 参考文献 - 张翼鸥,谷人旭.中国城市知识复杂性的空间特征及影响研究[J].地理学报,2018,73(8):1421-1432. - 杨君,叶世杰,肖明月,等.创新型城市试点政策与中国城市创新"量增质降"困境[J].南京财经大学学报,2022,(4):1-11.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。