各省本地与异地合作率
「各省本地与异地合作率」,覆盖 1985-2025 年,频率 年度,省级层级,含 14 个变量,样本量约 1,271。 参考张一帆等(2025)的方法,把各省级行政区参与的合作型专利按申请人所在地是否同属本省划分为本地合作与异地合作,测度合作创新在地理上的本地化程度。
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 14 |
| 样本量 | 1,271 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260六位码)
- Year [年份] — 专利申请年份
- CollabPatentCount [合作专利件数] — 参考张一帆等(2025,地理科学)的方法,计算公式为:当年申请人中至少有一人所在地位于该省、且申请单位数量达到2个及以上的中国专利件数(按申请号去重)。用作中间变量。
- CollabGeoResolvedCount [可判定合作专利件数] — 计算公式为:上述合作专利中全部申请人均已定位到具体地区、从而可判定本地与异地的件数;只要有一个申请人未能定位即不计入。用作中间变量,是本地合作率与异地合作率的分母。
- CollabGeoResolvedRate [合作专利可判定率] — 计算公式为:可判定合作专利件数除以合作专利件数。用作中间变量,越大代表该省当年的本地与异地合作率建立在越充分的样本上,使用者可据此筛除判定覆盖过低的观测。分母为0时取缺失值。
- LocalCollabCount [本地合作专利件数] — 参考张一帆等(2025,地理科学)的方法,计算公式为:可判定合作专利中全部申请人所在地同属本省的件数。原文将申请人所在地属于同一地区的合作模式定义为本地合作。用作中间变量。
- NonLocalCollabCount [异地合作专利件数] — 参考张一帆等(2025,地理科学)的方法,计算公式为:可判定合作专利中存在本省以外申请人的件数。用作中间变量。
- LocalCollabRate [本地合作率] — 参考张一帆等(2025,地理科学)的方法,计算公式为:本地合作专利件数除以可判定合作专利件数。用作研究变量,越大代表该省的合作创新越集中于省内,地理本地化程度越高。分母为0时取缺失值。
- NonLocalCollabRate [异地合作率] — 参考张一帆等(2025,地理科学)的方法,计算公式为:异地合作专利件数除以可判定合作专利件数。与本地合作率互为反面,分母非零时两者相加恒为1。用作研究变量,越大代表该省的合作创新越依赖跨区域联系。分母为0时取缺失值。
- InventCollabGeoResolvedCount [发明可判定合作专利件数] — 计算公式为:可判定合作专利中专利类型为发明的件数。用作中间变量,是发明专利本地合作率的分母。
- InventLocalCollabCount [发明本地合作专利件数] — 计算公式为:发明可判定合作专利中全部申请人所在地同属本省的件数。用作中间变量,是发明专利本地合作率的分子。
- LocalCollabRateInvent [发明专利本地合作率] — 参考张一帆等(2025,地理科学)的方法在发明专利子样本上的稳健性口径,计算公式为:发明本地合作专利件数除以发明可判定合作专利件数。用作稳健性变量,越大代表该省的发明专利合作越集中于省内。分母为0时取缺失值。
- NonLocalCollabRateInvent [发明专利异地合作率] — 参考张一帆等(2025,地理科学)的方法在发明专利子样本上的稳健性口径,计算公式为:发明可判定合作专利件数减去发明本地合作专利件数后除以发明可判定合作专利件数。与发明专利本地合作率互为反面。用作稳健性变量。分母为0时取缺失值。
常见问题
- 「各省本地与异地合作率」是什么数据集?
- 各省本地与异地合作率,隶属科技创新。参考张一帆等(2025)的方法,把各省级行政区参与的合作型专利按申请人所在地是否同属本省划分为本地合作与异地合作,测度合作创新在地理上的本地化程度。
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:合作专利件数、可判定合作专利件数、合作专利可判定率、本地合作专利件数、异地合作专利件数、本地合作率、异地合作率、发明可判定合作专利件数、发明本地合作专利件数、发明专利本地合作率、发明专利异地合作率。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 1,271 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 创新合作既可能发生在同一地区内部,也可能跨越地理边界。经济地理学长期关注这一区分:本地合作依托面对面交流与地方社会网络,有利于缄默知识的传递与既有知识基础的重组;跨地区合作则能突破本地技术锁定,引入外部互补性知识。参考张一帆等(2025)的做法,本数据集把地区参与的合作型专利按申请人所在地是否同属一个省级行政区划分为本地合作与非本地合作,据此度量合作创新在地理上的本地化程度。本层为原文方法在省级行政单位上的实现,省内跨地级市的合作在此计为本地合作。 判别分两步。首先识别合作型专利:凡所涉及的申请单位数量超过 1 个的专利即为合作型专利。其次判别其地理模式:设合作专利 $p$ 的申请人所在地区集合为 $Rp$,则 $$LocalCollab{p}=\begin{cases}1, & \left|R{p}\right|=1\\[2pt] 0, & \left|R{p}\right|1\end{cases}$$ 即全部申请人同属一个地区时记为本地合作,存在地区外申请人时记为非本地合作。地区 $r$ 在年份 $t$ 的本地合作率与异地合作率分别为 $$LocalCollabRate{r,t}=\frac{\sum{p\in C{r,t}}LocalCollab{p}}{\left|C{r,t}\right|},\qquad NonLocalCollabRate{r,t}=1-LocalCollabRate{r,t}$$ 其中 $C{r,t}$ 为该地区当年参与的、可判定地理模式的合作专利集合。两个比率互为反面,在分母非零时相加恒为 1。 分母的界定是本指标的关键。地区归属依赖申请人名称与其登记注册地的匹配,并非每一个申请人都能匹配成功。本数据集采用严格口径:只有当一件合作专利的全部申请人均已定位到具体地区时,才判别其为本地或非本地合作;只要有一个申请人未能定位,该专利仍计入合作专利件数,但不进入本地与异地合作率的分母。之所以不采用"按已定位申请人判别"的宽口径,是因为两个申请人只定位到其中一个时,宽口径会因"已定位者同属一地"而把它判为本地合作,从而系统性高估本地合作率。为使这一取舍透明可核,本数据集同时输出合作专利可判定率,即可判定件数占合作专利件数的比重,使用者可据此评估每个地区年份的判别覆盖程度,并自行筛除覆盖过低的观测。 地区归属采用参与口径:只要有一个申请人所在地位于地区 $r$,该合作专利即计入 $C{r,t}$。一件跨地区合作专利因而在其每一个参与地区各计一次,且在每一端都被判为非本地合作。这与原文以区域连线刻画合作网络的做法一致,并使本地与异地合作率在合作两端保持对称。 申请单位数量取自专利的申请人地区归属串,该串对每一个申请人保留恰好一段,未能定位者留空段,因此段数即申请人总数,与能否定位无关。底层数据中一件专利可能对应多条公开记录,发明专利的申请公开与授权公告各占一条且申请号相同,故在按件计数之前先按申请号去重,以免发明专利被系统性重复计入。 除全样本口径外,本数据集另给出发明专利子样本上的同一组比率。专利类型按公开记录的类别码划分为发明与实用新型两类。该口径的意义在于:实用新型没有申请公开程序、须待授权后才公告,越接近当前的申请年份,数据中留存的专利越以发明为主,发明专利口径可用于检验结论是否受专利类型构成变化的影响。 输出为地区与年份构成的面板。面板的起始年因地区而异——取该地区在区域统计资料中的序列起点与其首个有专利活动年份的较早者,这样既不会丢弃早年确有专利的地区观测,也不会给尚未设立的行政区造出一串并不存在的零;各地区的末年一致。计数型字段在该地区当年没有相应专利时取零,这是真实的零而非缺测;比率型字段在分母为零时取缺失值,不取零。全部字段均不作缩尾处理。 补充说明 - 样本口径:覆盖全部省级行政区与全部可得申请年份,不预先施加原文的年段限制,也不限定申请主体类型。原文将样本限定为企业、高校及科研机构的专利,本数据集则纳入包括自然人在内的全部申请主体。 - 与原文报告值的关系:原文以同一地级市定义本地合作,报告 2000—2017 年本地合作占比约为 26%—31%。本数据集是省级口径,省内跨地级市的合作在此计为本地合作,取值必然高于该市级基准,这是口径更宽的结果而非偏误。需要与原文基准对照者应使用地级市层的同名数据集。 - 2007 年前后的断点:同城合作率在 2006 与 2007 之间有一次明显下折。该下折在发明与实用新型两个子样本内部各自都可见,合作专利的申请人数分布同期平稳,地理定位覆盖率同期仅小幅上升,因此既非专利类型构成变化所致,也非覆盖率改善所致,成因尚未确证。跨越该年份作时序比较时建议加入年份固定效应或分段考察。 - 申请人与发明者口径:原文在变量定义处采用申请人所在地,而在部分图表标注处写作发明者是否位于同一城市。本数据集按变量定义实现,即使用申请人所在地;若原文实际采用的是发明人地址,本指标的本地合作率会相对偏高,因为同一申请人旗下的发明人可能分处异地。 - 年份基准:按专利申请年份归年,而原文以授权数据为基础,同一件专利在两种口径下会落入不同年份。 - 地区归属的覆盖差异:自然人申请与境外主体无法归属到国内地区;含境外申请人的合作专利因无法满足"全部申请人均已定位"而整体退出分母,故本指标刻画的是境内合作的地理分布。申请人名称与登记注册地的匹配在部分地区相对稀薄,这些地区的可判定件数偏低,属非随机缺失。匹配覆盖率在样本期内随年份上升,早期年份的比率建立在较小的可判定子样本上,抽样噪声更大,使用者可借助可判定率字段加以控制。 - 末期年份:受专利公开滞后影响,最近一两个申请年份的专利尚未全部公开,计数型字段偏低,不宜作趋势解读。同期专利类型构成亦在漂移,但本地与异地合作率基本不受其影响——全样本口径与发明专利口径的取值高度接近,故比率型字段的跨年可比性好于计数型字段。 - 集团内关联主体共同申请:本指标把同一地区内多个申请主体的共同申请一律计为本地合作,其中相当一部分并非跨组织的地方协同,而是同一企业集团内部关联主体(同城子公司之间,或外地母公司与本地分公司之间)的共同申请。抽样核查显示,本地合作率长期居高的地区往往由单一集团的多家同城子公司相互共同申请所主导;而本地合作率长期为零的地区则多为"外地母公司加本地分公司"的分厂型结构。把本指标直接解读为本地创新协同网络的强度会产生误读;需要剔除集团内部关联申请的使用者,须自行在申请人名称层面做同一控制人或名称前缀的聚类。 - 小分母观测:相当一部分地区年份的可判定合作专利件数很少,此时比率只能取到有限几个离散值,噪声很大。本数据集随指标一并输出可判定件数与可判定率,建议在回归中设定最小观测量门槛(例如可判定件数不低于 20),或以可判定件数加权。 - 编码对齐:地区编码以六位定长字符串存储。与以数值型存储地区编码的其他数据合并前,须先把两侧统一为等宽字符串,否则数值与字符串不相等,合并会得到空结果而不报错。 - 其他局限:主体名单为当前有效行政区划下的省级行政区,港澳台地区不在名单之列,其专利已在归属时排除。合作专利极少的地区年份上,比率取值可能落在端点附近,使用者可借助随数据集提供的计数字段加以控制。 参考文献 - 张一帆,金文纨,徐龑,等.技术复杂度视角下中国专利合作的空间特征[J].地理科学,2025,45(12):2563-2573.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。