各省技术关联度(IPC共现法)

「各省技术关联度(IPC共现法)」,覆盖 1985-2025 年,频率 年度,省级层级,含 14 个变量,样本量约 1,271。 参考马双等(2020)的技术生产密度方法,基于全量中国专利的IPC技术类别共现网络,测度各省级行政区已有优势技术组合与候选技术之间的关联紧密程度。

时间跨度1985-2025 年
数据频率年度
层级省级
变量数14
样本量1,271
是否可合并可与同主体数据集合并

字段字典

  • Province [省份] — 省级行政区名称
  • ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260六位码)
  • Year [年份] — 专利申请年
  • PatentCount [专利件数] — 该省当年第一申请人所在地为本省、且具有IPC分类的专利申请件数,同一申请的公开与授权两条记录按申请号归并后只计一件
  • TechClassCount [有产出技术类别数] — 该省当年有专利产出的IPC三位技术类别个数,不论是否具备相对技术优势
  • RTATechCount [优势技术类别数] — 参考马双等(2020,地理研究)的方法,计算公式为:该省当年相对技术优势指数RTA大于等于1的IPC三位技术类别个数,其中相对技术优势指数RTA=(该省某技术类别专利件数/该省全部类别件数)/(全国该类别件数/全国全部类别件数),大于等于1记为具备优势。用作研究变量,越大代表该省具备相对技术优势的技术领域越广
  • NewTechRelatedness [新技术本地关联度] — 参考马双等(2020,地理研究)的技术生产密度方法,计算公式为:先对该省当年不具相对技术优势的每个技术类别i计算技术生产密度RD_i=(该省具优势的各技术类别j与i的关联度之和)/(全部技术类别j与i的关联度之和)乘以100,其中关联度为两技术类别共同出现在同一专利上的件数(按含当年在内的近十年滚动窗口统计);再对这些类别取算术平均。用作研究变量,越大代表该省尚未形成优势的候选技术与本地既有技术基础的关联越紧密、越有可能被引入
  • ExistingTechRelatedness [现有技术本地关联度] — 参考马双等(2020,地理研究)的技术生产密度方法,计算公式为:先对该省当年具有相对技术优势的每个技术类别i计算技术生产密度RD_i=(该省具优势的各技术类别j与i的关联度之和)/(全部技术类别j与i的关联度之和)乘以100,其中关联度为两技术类别共同出现在同一专利上的件数(按含当年在内的近十年滚动窗口统计);再对这些类别取算术平均。用作研究变量,越大代表该省既有优势技术之间的关联越紧密、技术结构越集聚
  • EntryTechRelatedness [进入技术平均关联度] — 参考马双等(2020,地理研究)图3的做法,计算公式为:对该省上年不具备而本年具备相对技术优势的技术类别,取其技术生产密度的算术平均。用作研究变量,越大代表新进入该省的技术与本地既有技术基础的关联越紧密
  • NonEntryTechRelatedness [非进入技术平均关联度] — 参考马双等(2020,地理研究)图3的做法,计算公式为:对该省连续两年均不具备相对技术优势的技术类别,取其技术生产密度的算术平均。用作对照变量,与进入技术平均关联度比较可检验技术关联性对技术进入的促进作用
  • ExitTechRelatedness [退出技术平均关联度] — 参考马双等(2020,地理研究)图4的做法,计算公式为:对该省上年具备而本年不具备相对技术优势的技术类别,取其技术生产密度的算术平均。用作研究变量,越小代表退出该省的技术与本地既有技术基础的关联越弱
  • NonExitTechRelatedness [非退出技术平均关联度] — 参考马双等(2020,地理研究)图4的做法,计算公式为:对该省连续两年均具备相对技术优势的技术类别,取其技术生产密度的算术平均。用作对照变量,与退出技术平均关联度比较可检验技术关联性对技术退出的抑制作用
  • NewTechRelatednessCos [新技术本地关联度(余弦标准化)] — 对技术关联网络作余弦(Salton)标准化后的稳健性口径,计算公式为:将两技术类别的共现件数除以各自出现件数乘积的平方根,代入技术生产密度公式后,对该省当年不具相对技术优势的技术类别取算术平均。用作稳健性检验变量
  • ExistingTechRelatednessCos [现有技术本地关联度(余弦标准化)] — 对技术关联网络作余弦(Salton)标准化后的稳健性口径,计算公式为:将两技术类别的共现件数除以各自出现件数乘积的平方根,代入技术生产密度公式后,对该省当年具有相对技术优势的技术类别取算术平均。用作稳健性检验变量

常见问题

「各省技术关联度(IPC共现法)」是什么数据集?
各省技术关联度(IPC共现法),隶属科技创新。参考马双等(2020)的技术生产密度方法,基于全量中国专利的IPC技术类别共现网络,测度各省级行政区已有优势技术组合与候选技术之间的关联紧密程度。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 14 个变量。核心指标包括:专利件数、有产出技术类别数、优势技术类别数、新技术本地关联度、现有技术本地关联度、进入技术平均关联度、非进入技术平均关联度、退出技术平均关联度、非退出技术平均关联度、新技术本地关联度(余弦标准化)、现有技术本地关联度(余弦标准化)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,省级层级。
样本量有多大?
约 1,271 条观测。
数据是如何测算/获取的?
指标定义与计算方法 区域的技术演化并非随机发生。一项新技术能否在某地扎根,很大程度上取决于它与该地既有技术基础之间的关联程度。马双、曾刚与张翼鸥提出,可以用专利分类号的共现结构刻画技术之间的关联网络,再由此测算每一项技术与特定区域现有技术组合的贴近程度。本数据集按该文的技术生产密度方法,在省级行政区层面实现这一测度。测度分三步展开。 第一步是判定区域的核心技术。 一个地区有专利产出的技术领域并不都构成它的技术基础,只有那些相对全国而言产出份额偏高的领域,才称得上具备相对技术优势。沿用原文的区位熵式定义,区域 $r$ 在技术类别 $i$ 上第 $t$ 年的相对技术优势为 $$RTA{r,i,t}=\begin{cases}1, & \dfrac{patents{r,i,t}\big/\sumi patents{r,i,t}}{\sumr patents{r,i,t}\big/\sumr\sumi patents{r,i,t}}\ \ge\ 1\\[2mm] 0, & \text{其他}\end{cases}$$ 其中 $patents{r,i,t}$ 为区域 $r$ 在第 $t$ 年、技术类别 $i$ 上的专利申请件数。分子是该区域内部的技术结构份额,分母是全国层面同一技术类别的份额,二者之比不小于 1 意味着该区域在这一技术上的专业化程度高于全国平均水平。这一构造与区位熵同形:它衡量的是相对专业化而非绝对规模,因此专利总量很大但高度集中于少数领域的地区,其优势技术领域数未必多于总量较小而门类均衡的地区,使用者若关心创新规模需另行控制专利总量。分子与分母均按当年的全国口径构造,逐年独立判定。技术类别依专利分类号的三位分类码划分,原文将全部专利划分为 124 类;本数据集不固定这一数目,而取样本期内实际观测到的分类码全集,以保证数据每年重新生成时不会因新分类码出现而失效。 第二步是构造技术关联网络。 原文将两个技术类别共同出现在同一件专利上的次数定义为二者的技术相关性 $\varphi{ij}$,全部技术类别由此形成一个对称的 $n\times n$ 关联网络。原文按三个互不重叠的十年期各构造一次网络;本数据集需要给出逐年的面板数值,改为以当年及此前九年构成的十年滚动窗口逐年构造,窗口长度与原文一致。网络的对角元置零,技术与自身的关联不参与后续计算。 第三步是计算技术生产密度并汇总到区域层面。 对区域 $r$、年份 $t$ 的每一个技术类别 $i$,其技术生产密度为 $$Relatedness\density{i,r,t}=\frac{\sum{j\in R{r,t},\,j\neq i}\varphi{ij}}{\sum{j\neq i}\varphi{ij}}\times 100$$ 式中 $R{r,t}$ 是该区域当年具备相对技术优势的技术类别集合。分子度量技术 $i$ 与该地核心技术之间的关联总量,分母是技术 $i$ 与全部技术之间的关联总量,因而该比值反映技术 $i$ 在多大比例上被当地已有的优势技术所环绕,取值介于 0 与 100 之间。 在此基础上,本数据集按两种方式将技术层面的密度汇总到区域层面。截面口径依当年是否具备相对技术优势把全部技术类别一分为二:对不具备优势的类别取密度均值,得到新技术本地关联度,它刻画该地尚未形成优势的候选技术与本地技术基础的贴近程度;对具备优势的类别取密度均值,得到现有技术本地关联度,它刻画该地既有优势技术彼此之间的集聚紧密程度。动态口径则依相邻两年优势状态的变化把技术类别分为四组——上年不具而本年具备的为进入技术,连续两年均不具备的为非进入技术,上年具备而本年不具的为退出技术,连续两年均具备的为非退出技术——各自取密度均值。这四个量对应原文图 3 与图 4 的横纵坐标:原文发现进入技术的关联度普遍高于非进入技术,而退出技术的关联度普遍低于非退出技术,即与本地技术密切相关的技术更容易进入,缺乏本地关联的技术更容易退出。 关联网络的标准化方式原文未给出具体公式。技术生产密度是一个比值,对关联网络作任何全局的标量缩放都不改变结果,因此主口径直接采用窗口内的共现件数,这是最贴近原文字面表述的实现。作为稳健性口径,本数据集另对网络作余弦(Salton)标准化,即以 $\varphi{ij}=C{ij}\big/\sqrt{Ci Cj}$ 替代共现件数,其中 $Ci$ 为窗口内涉及技术类别 $i$ 的专利件数。这一变换压低高频技术类别的权重,余弦口径下的关联度水平系统性低于主口径,但区域间的相对排序高度一致。 补充说明 - 专利的计数与归类:同一件专利申请在公开与授权两个阶段各有一条记录,按申请号归并后只计一件。原文要求"单个专利只划分到某一特定的技术小项中,以保证每个专利具有相同的权重",但同时又将关联性定义为两个技术类别在同一件专利上的共现次数——若每件专利只归入一个类别,共现将恒为零。本数据集的自洽处理是:相对技术优势的专利计数只用主分类号,保证每件专利权重相同;关联网络的共现计数则用该专利的全部分类号。 - 地区归属:专利归属于第一申请人所在地。原文未明示归属规则,采用第一申请人同样是为满足每件专利权重相同这一要求——若按全部申请人归属,一件跨地区合作专利会在每个地区各计一件。代价是跨地区合作专利的非第一申请人所在地不计入其专利产出。 - 优势判定的时间窗口:相对技术优势基于当年专利判定,进入与退出按相邻两年比较。原文在描述空间格局时使用三个十年期,但其表 1 报告的是逐年的技术进入与退出数量,本数据集取可与该表直接对标的逐年口径。逐年口径反映年度波动,专利产出规模较小的地区在少量专利变动下即可能越过优势阈值。 - 空间单元:原文实证在地级市层展开,本数据集为省级层实现,配套的地级市层数据集与原文一致。省级聚合度更高,优势技术类别数与关联度水平均系统性高于市级,两层数值不宜直接混用。 - 孤立技术类别:滚动窗口内从未与任何其他类别共现于同一件专利的技术类别,其关联网络行和为零,技术生产密度的分母为零而无定义,不参与区域层的均值。这类类别多为专利分类体系中的杂项类与极冷门类别,数量随年份下降。若按零计入均值,会系统性压低不具优势技术一侧的关联度水平。 - 面板口径:平衡面板按主体在区域统计数据中的可得年份区间展开,而非全部主体乘以全部年份的完全笛卡尔积。部分地级市的统计数据起始年晚于样本首年,其更早年份不进入面板,用意是避免"该地当年尚无统计口径"被当成真实观测的零;省级层不受影响。 - 样本与零值:覆盖全部省级行政区与全部可得年份,不按原文的样本区间收窄,不作缩尾。地区当年无可归属专利时,计数类字段记零,关联度字段记缺失——无本地技术基础时关联密度无定义;首年无上一年可比,四个动态口径字段记缺失。 - 其他局限:专利自申请至公开存在约十八个月的滞后,最近一至两个申请年的件数尚未完整,末年的水平值偏低,不宜作趋势解读,比率型的关联度字段受此影响小于计数型字段;专利的地理定位率随年份上升,早期年份计数类字段的绝对水平偏低;用于地址匹配的登记信息在部分地区收录较薄,其定位率偏低属非随机缺失,使用时建议加入地区与年份固定效应。 参考文献 - 马双,曾刚,张翼鸥.技术关联性、复杂性与区域多样化——来自中国地级市的证据[J].地理研究,2020,39(4):865-879.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。