各省数字知识共享
「各省数字知识共享」,覆盖 2010-2025 年,频率 年度,省级层级,含 17 个变量,样本量约 496。 基于全量中国专利的共同申请关系测度区域数字知识共享水平。
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 17 |
| 样本量 | 496 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260,6位数字)
- Year [年份] — 专利申请年度
- DigiCoopWithin [省内数字专利合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:当年申请的数字技术专利中,同一省份出现两位及以上申请人的专利件数(每件专利对该省份计一次)。用作研究变量,越大代表该地区内部创新主体之间的数字知识共享越活跃。
- DigiCoopBetween [跨省数字专利合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:当年申请的数字技术专利中,将每件专利申请人所属省份去重后两两配对,逐对记为一次跨省份合作,再累加该省份参与的全部配对次数。用作研究变量,越大代表该地区与外部地区之间的数字知识共享越活跃。
- DigiCoopTotal [数字专利合作总次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:省内数字专利合作次数与跨省数字专利合作次数之和。用作研究变量,越大代表该地区数字知识共享总量越高。
- LnDigiCoopWithin [省内数字知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+省内数字专利合作次数)。用作研究变量,越大代表该地区内部数字知识共享水平越高。
- LnDigiCoopBetween [跨省数字知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+跨省数字专利合作次数)。用作研究变量,越大代表该地区与外部地区的数字知识共享水平越高。
- LnDigiCoopTotal [数字知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+数字专利合作总次数)。用作研究变量,越大代表该地区数字知识共享总体水平越高。
- DigiCoopWithinInvent [省内数字发明专利合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:在省内数字专利合作次数的基础上,仅统计专利类型为发明专利的合作次数。用作稳健性检验变量。
- DigiCoopWithinUtility [省内数字实用新型合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:在省内数字专利合作次数的基础上,仅统计专利类型为实用新型专利的合作次数。用作稳健性检验变量。
- DigiCoopBetweenInvent [跨省数字发明专利合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:在跨省数字专利合作次数的基础上,仅统计专利类型为发明专利的合作次数。用作稳健性检验变量。
- DigiCoopBetweenUtility [跨省数字实用新型合作次数] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:在跨省数字专利合作次数的基础上,仅统计专利类型为实用新型专利的合作次数。用作稳健性检验变量。
- LnDigiCoopWithinInvent [省内数字发明专利知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+省内数字发明专利合作次数)。用作稳健性检验变量。
- LnDigiCoopWithinUtility [省内数字实用新型知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+省内数字实用新型专利合作次数)。用作稳健性检验变量。
- LnDigiCoopBetweenInvent [跨省数字发明专利知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+跨省数字发明专利合作次数)。用作稳健性检验变量。
- LnDigiCoopBetweenUtility [跨省数字实用新型知识共享] — 参考史本叶和齐瑞卿(2026,上海财经大学学报)的方法,数字技术专利依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》识别,样本限定为申请人数量在2至10位之间的专利。计算公式为:ln(1+跨省数字实用新型专利合作次数)。用作稳健性检验变量。
常见问题
- 「各省数字知识共享」是什么数据集?
- 各省数字知识共享,隶属科技创新。基于全量中国专利的共同申请关系测度区域数字知识共享水平。
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:省内数字专利合作次数、跨省数字专利合作次数、数字专利合作总次数、省内数字知识共享、跨省数字知识共享、数字知识共享、省内数字发明专利合作次数、省内数字实用新型合作次数、跨省数字发明专利合作次数、跨省数字实用新型合作次数、省内数字发明专利知识共享、省内数字实用新型知识共享、跨省数字发明专利知识共享、跨省数字实用新型知识共享。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 496 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 数字知识共享刻画的是数字知识要素在创新主体之间扩散与协同的程度。与强调知识单向转移的"数字知识流动"不同,共享强调的是多个主体围绕同一项数字技术成果形成的协同创新关系:当两个及以上创新主体联合申请同一件数字技术专利时,意味着它们在研发过程中共同使用并交换了数字知识。本数据集参考史本叶和齐瑞卿(2026)的做法,以数字技术专利的共同申请关系为载体,在省级层面测度区域内部与区域之间的数字知识共享水平。 测算分三步完成。 第一步是识别数字技术专利。依据《数字经济核心产业分类与国际专利分类参照关系表(2023)》,将数字经济核心产业的四个大类、十五个中类与八十六个小类映射到国际专利分类号,形成一套覆盖八个部的分类号规则集。规则集同时包含三个匹配层级:标注星号的子类级规则匹配该子类下的全部分类号,标注星号的主组级规则匹配该主组下的全部分类号,未标注星号的规则则要求分类号精确相等。一件专利只要其任一分类号命中规则集,即被认定为数字技术专利;这一"任一命中即可"的处理与对照表关于一件专利可同时对应多个产业小类的注解一致。 第二步是筛选合作型专利并确定申请人的地区归属。沿用原文口径,仅保留申请人数量在两位及以上的专利,同时剔除申请人数量超过十位的专利——前者是合作关系存在的前提,后者多为产业联盟或专利池式的批量申请,其申请人之间未必存在实质性的研发协同。需要说明的是,专利底表中一件发明专利的申请公开与授权公告是两条独立记录且申请号相同,因此在按件计数之前已按申请号去重,避免同一件专利被重复计入。每位申请人的省份归属通过其名称与企业登记注册信息中的登记住所进行匹配确定,并辅以上市公司注册地、高校与科研院所名录以及名称中行政区划前缀的解析作为补充。 第三步是展开合作关系并聚合到省份-年度。设 $Pt$ 为第 $t$ 年申请的全部合作型数字技术专利集合,对其中一件专利 $p$,记其可定位申请人所属省份构成的多重集为 $Mp$、去重后的省份集合为 $Rp$。至少需要两位申请人可定位,该专利才进入计算。省内数字专利合作按专利计数:若某省在 $Mp$ 中出现两次及以上,则该省记录一次省内合作,无论其在该专利上有多少位申请人。跨省数字专利合作按省份对计数:对 $Rp$ 中任意两个不同省份构成的无序对,记该对省份之间发生一次合作,聚合到省份层面即该省与集合中其余每个省份各形成一次合作。两个指标的定义为 $$\text{Within}{r,t}=\sum{p\in Pt}\mathbf{1}\Big[\big|\{i\in Ap:\operatorname{loc}(i)=r\}\big|\ge 2\Big]$$ $$\text{Between}{r,t}=\sum{p\in Pt}\mathbf{1}\big[r\in Rp\big]\cdot\big(|Rp|-1\big)$$ 其中 $Ap$ 为专利 $p$ 的申请人集合,$\operatorname{loc}(i)$ 为申请人 $i$ 所属省份,$\mathbf{1}[\cdot]$ 为示性函数。两者之和构成该省当年的数字专利合作总次数。考虑到合作次数为典型的右偏计数变量,核心研究变量取其对数形式 $\ln(1+\text{Within})$、$\ln(1+\text{Between})$ 与 $\ln(1+\text{Within}+\text{Between})$,分别对应省内、跨省与总体的数字知识共享水平。 为便于按创新质量区分共享强度,上述两个层次的合作次数还按专利类型拆分为发明专利与实用新型专利两个子口径并同样给出对数形式。发明专利的技术含量与审查标准高于实用新型,两个子口径的差异可用于判断区域间的数字知识共享是集中于高质量技术成果还是以渐进式改良为主。 补充说明 - 样本口径:覆盖全部省级行政区与全部可得年度,构成平衡面板。某省某年未观察到数字专利合作时计数取零、对数取零,这是真实的零而非缺测。数据集不预先施加回归样本限制,也未做缩尾处理;使用者可根据研究设计自行截取年份区间或剔除零值观测。原文样本区间为2010年至2023年,本数据集不按该年段收窄,起始年沿用原文起点并覆盖全部可得年度。原文在机制回归中使用未加一的对数形式,因而丢弃了零值观测,本数据集统一采用加一的对数形式以保留完整面板。需说明的是,原文分别报告区域内与区域之间两个层次,并未给出合计列;本数据集的合作总次数及其对数是对这两个层次的直接加总,参照原文在数字知识流动部分同时给出区域内、区域外与全部三列的结构,未引入新的口径。 - 观测单位与原文的差异:原文机制检验的观测单位是"城市对-年度",被解释变量为特定两地之间的合作次数;本数据集的观测单位是"地区-年度",跨区指标为该地区参与的全部跨区合作次数之和。省内指标与原文的区域内口径完全一致。因此跨区指标是地区层面的总量,不宜与原文城市对层面的估计系数直接比较。 - 省级层的定位:原文是城市层面的研究,省级层由本数据库按完全相同的方法另行测算。由于省份的地理范围大于城市,原本跨城市但同省的合作在省级口径下计为区域内合作,故省内合作占比系统性高于市级口径,两个层级的数值不可直接比较。 - 地区归属的覆盖:原文使用专利数据库中著录的申请人地址,本数据集改由申请人名称匹配登记住所推断。自然人申请与境外主体无法归属,登记信息在部分地区收录相对稀薄,这些地区的合作次数会偏低,属非随机缺失。更需注意的是,申请人可被定位的比例在样本期内由不足一半上升至九成以上,因此直接比较不同年份的水平值会把数据覆盖的改善与真实增长叠加在一起;建议在回归中纳入年份固定效应,或改用份额型、排名型口径。 - 末年数据的完整性:受专利公开滞后影响,样本最后一个申请年度的专利尚未全部公开,其合作次数偏低,且由于实用新型须经授权方才公告、发明专利在申请后即可公开,末年的专利类型结构也与常年不同。末年数值适合作为存在性证据而非趋势解读,对末年完整性敏感的研究建议截取至倒数第二年。 - 其他局限:专利共同申请只能反映已形成正式知识产权成果的协同创新,无法覆盖未申请专利的技术交流、人员流动与数据共享;分类号对照表按数字经济核心产业界定数字技术,对嵌入传统产业的数字化应用可能识别不足。 参考文献 - 史本叶,齐瑞卿.城市算力基础设施建设、数字知识流动与数实产业技术融合[J].上海财经大学学报,2026,28(4):60-73. - 吕爽,孙铁山,张兴鸣.高铁网络如何促进城市间合作创新——基于高铁网络通达性与合作专利的实证分析[J].经济评论,2024,(3). - 杨震宇.数字创新网络嵌入与关键核心技术攻关[J].中国工业经济,2025,(5).
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。