各地级市创新网络中心度(联合申请专利网络)

「各地级市创新网络中心度(联合申请专利网络)」,覆盖 1985-2025 年,频率 年度,地级市层级,含 10 个变量,样本量约 13,817。 以区域间联合申请发明专利构建的创新合作网络为基础,刻画各地级及以上城市在全国创新合作网络中的位置重要性。

时间跨度1985-2025 年
数据频率年度
层级地级市
变量数10
样本量13,817
是否可合并可与同主体数据集合并

字段字典

  • Province [省份] — 城市所属省级行政区名称
  • ProvinceCode [省份代码] — 城市所属省级行政区的六位行政区划代码
  • City [城市] — 地级及以上城市名称
  • CityCode [城市代码] — 地级及以上城市的六位行政区划代码
  • Year [年份] — 观测年份,按专利申请年归集
  • NetworkSize [网络规模] — 参考周锐波等(2021,经济地理)的方法,当年全国创新合作网络的节点数,计算公式为:当年至少与另一个地级及以上城市共同申请过一件发明专利的地级及以上城市个数。该值在同一年内所有地级市取值相同,是度中心性的分母;用于判断各年度中心性的可比性,网络规模过小的年份其中心度不宜与规模较大的年份直接比较
  • DegreeCount [度数] — 参考周锐波等(2021,经济地理)的方法,该地级市当年在创新合作网络中直接相连的其他地级及以上城市个数,计算公式为:当年与该地级市共同申请过至少一件发明专利的其他地级及以上城市个数。是度中心性的分子,用作研究变量,越大代表该地的合作伙伴覆盖面越广
  • CrossRegionJointPatentCount [跨地级市联合申请发明专利数] — 参考周锐波等(2021,经济地理)的方法,计算公式为:该地级市当年参与申请、且申请人分属两个及以上不同地级及以上城市的发明专利件数(按专利申请号去重,一件专利对参与的每个地级及以上城市各计一次)。刻画合作强度而非合作广度,用作研究变量,越大代表该地的区域间创新合作越频繁
  • DegreeCentrality [度中心性] — 参考周锐波等(2021,经济地理)的方法,衡量节点在创新合作网络中的联系广度,计算公式为:该地级市直接连接的节点数占网络全部节点数之比,即度数除以当年网络规模。注意分母为网络节点数 n 而非 n-1,故取值上限为(n-1)/n。用作研究变量,越大代表该地在全国创新合作网络中的联系面越广
  • EigenvectorCentrality [特征向量中心性] — 参考周锐波等(2021,经济地理)的方法,衡量节点在创新合作网络中的重要程度,计算公式为:节点所连接的其他节点的重要程度之和除以邻接矩阵的最大特征值,其中邻接矩阵元素在两地相连时取 1、否则取 0;对所有节点先设初始值为 1,按该式迭代至收敛,结果按向量的平方和为 1 标准化。与度中心性同属节点重要性构念,区别在于它对合作伙伴本身的重要性加权。用作研究变量,越大代表该地在全国创新合作网络中的枢纽地位越高

常见问题

「各地级市创新网络中心度(联合申请专利网络)」是什么数据集?
各地级市创新网络中心度(联合申请专利网络),隶属科技创新。以区域间联合申请发明专利构建的创新合作网络为基础,刻画各地级及以上城市在全国创新合作网络中的位置重要性。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 10 个变量。核心指标包括:网络规模、度数、跨地级市联合申请发明专利数、度中心性、特征向量中心性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,地级市层级。
样本量有多大?
约 13,817 条观测。
数据是如何测算/获取的?
指标定义与计算方法 创新活动的组织方式正在由"地方空间"向"流动空间"转变,知识交流与技术合作日益跨越行政边界,一个城市能否嵌入全国性的创新合作网络、在网络中占据何种位置,构成了其获取外部知识、实现协同创新的重要条件。联合申请专利是组织间知识共享、交流并取得共有成果的直接体现,其中发明专利代表原创技术研发成果、技术含量与商业转化价值相对较高,因此被广泛用于刻画城市间的技术合作关系。本数据集参考周锐波等(2021, 经济地理)的做法,以地级及以上城市为节点、城市间联合申请发明专利为无向边构建逐年的中国城市创新网络,给出两个个体网络指标,用以衡量各城市在全国创新合作网络中的位置重要性。 网络的构建遵循原文的处理步骤。首先从全量中国专利中筛出申请人数量不少于两个的联合申请发明专利;其次剔除无法匹配到具体城市的申请人,港澳台及其他国家的申请人由此一并排除;对于申请人在三个及以上的专利,采用两两交叉的方式记成多条合作关系;再将每个申请人的地址匹配到所在城市;最后统计城市间联合申请发明专利数量并建立无向矩阵。同一件专利内若有多个申请人同属一地,在城市间网络中构成自环而非城市间的边,因此只对去重后的城市集合做两两配对;一件专利只要其申请人分属两个不同的城市,这两个城市之间就存在一条边。专利按申请号去重后按申请年归集,同一件申请的公开文献与授权文献合为一件计算。 在此基础上构造两个个体层面的网络指标。度中心性衡量节点在网络中的联系广度,指节点直接连接的节点数占所有节点之比: $$ADi = \frac{\sumj l{ij}}{n}$$ 其中 $l{ij}$ 在节点 $i$ 与节点 $j$ 直接相连时取 1、否则取 0,$n$ 为当年网络的节点数,即当年至少发生过一次城市间联合申请的城市个数。需要注意公式的分母是网络节点数 $n$ 而非节点数减一,因此该指标的取值上限为 $(n-1)/n$ 而不是 1,这是原文的原始设定,本数据集未作调整。 特征向量中心性衡量节点在网络中的重要程度,其思想是一个节点的重要性不仅取决于它连接了多少节点,还取决于它所连接的节点本身有多重要: $$ECi = a^{-1} \sumj A{ij} \cdot ECj$$ 其中 $A$ 为网络的邻接矩阵,城市 $i$ 与城市 $j$ 相连时 $A{ij}$ 取 1、否则取 0;$a$ 为矩阵 $A$ 的最大特征值。对所有节点先设其特征向量中心性初始值 $ECi = 1$,按上式迭代至收敛,即得到每个节点的特征向量中心性。原文未明示收敛结果的最终标度方式,本数据集统一按向量平方和为 1 标准化,这一处理只改变量纲,不影响同一年内节点之间的相对大小与排序。 除两个中心度外,数据集另给出三个计算构件。网络规模即上式中的分母 $n$,在同一年内所有城市取值相同,其意义在于提示各年度中心性的可比性;度数是度中心性的分子,即该城市当年直接相连的其他城市个数;跨地级市联合申请发明专利数则是该城市当年参与的、申请人分属两个及以上不同城市的发明专利件数,一件专利对参与的每个城市各计一次。前两者刻画合作的广度,后者刻画合作的强度,三者与两个中心度构成完整可核的计算链。按本方法计算的网络,其规模、边数与密度的量级同原文报告的拓扑结构指标一致,中心度居前的城市与原文所刻画的以北京为绝对枢纽、中心城市彼此紧密联系的网络结构相符。 补充说明 - 样本口径:面板覆盖全部地级及以上城市与全部可得年份,不预先施加任何区域或年份限制。原文仅构建了五个年份的截面网络,本数据集扩展为逐年面板;使用者可按年份自行截取所需区间,并建议加入城市与年份固定效应。 - 节点集与网络规模的区别:数据集给出的是全部地级及以上城市的平衡面板,未参与合作的城市记零值;而度中心性的分母仍按原文取当年网络的节点数,即当年至少有一条城市间合作边的城市个数,不是城市总数。早期年份参与合作的城市较少、分母较小,中心度的跨年水平因此不可直接比较;数据集给出的网络规模列即为当年的分母,可据以判断各年的可比性。 - 未定位申请人的处理:原文剔除申请人含有个人的联合申请专利,理由是个人申请人难以匹配到对应城市。本数据集的城市归属来自企业登记信息匹配,个人申请人与未能匹配上的机构在数据中表现相同、无法区分,因此不整篇剔除含未定位申请人的专利,而是忽略这些申请人、只用已定位的申请人两两配对。与整篇剔除相比,这一处理保留的合作关系更多、所得网络的规模与边数更接近原文报告的基准值,且避免把匹配率的年际上升按申请人数放大成合作关系的虚假增长。 - 同一件申请的多条文献记录如何取舍:一件发明专利申请通常留下公开与授权两条文献记录,少数情形下两条记录上的申请人地址信息并不一致,授权记录往往更完整。原文未涉及这一取舍。本数据集按申请号去重时保留已成功定位到城市的申请人最多的那条记录,信息量相同时按文献种类码升序取定以保证结果可复现。该规则并不把样本收窄为已授权专利,去重后保留下来的绝大多数仍是公开记录。 - 面板不按统计数据的可得起点裁剪:本库的区域数据集通常按各主体在区域统计数据中的可得年份区间展开面板,本数据集不采用该裁剪。原因是那个可得起点反映的是统计数据的收录起点而非行政区的设立年份,若据以裁剪,若干老工业城市在早期年份真实发生的城市间合作会被整行丢掉,且网络规模与特征向量中心性将同面板内容对不上。代价是晚近设立的地级市在其设立前的年份会出现零值,这部分零值应理解为"当年该行政区尚不存在"而非"当年无合作"。 - 不连通网络下的特征向量中心性:网络高度稀疏且分裂为多个互不相连的部分时,特征向量中心性会集中在最大的那一部分上,其余部分的节点取值趋近于零。这是该指标的固有数学性质而非计算结果的缺陷,在早期年份判读时应与度数一并使用。 - 专利公开滞后的影响是分字段的:受专利从申请到公开的时滞影响,最近一至两个申请年的专利尚未全部进入数据。计数类的跨地级市联合申请发明专利数因此在末年偏低,不宜作水平或趋势解读;两个中心度只取决于两地之间是否存在合作关系,一件专利即可使边成立,受时滞的影响相对小得多。 - 其他局限:专利申请人的城市匹配率随年份上升,早期年份的网络规模与边数系统性偏低,会把数据覆盖的改善部分地表现为网络的扩张;企业登记信息在部分地区收录较薄,这些地区的匹配率偏低、中心度会被系统性低估,属非随机缺失;城市名单采用当前有效的行政区划口径,历史上已撤销或合并的地级市不在名单内,其撤销前的专利匹配不到市级归属,对这些地区在撤销前的年份构成系统性缺失而非真实的零。 参考文献 - 周锐波,邱奕锋,胡耀宗.中国城市创新网络演化特征及多维邻近性机制[J].经济地理,2021,41(5):1-10.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。