异地合作创新(跨地级市联合申请专利)
「异地合作创新(跨地级市联合申请专利)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 71,565。 参考戴宏伟等(2026,中国工业经济)的方法,以联合申请专利作为企业异地合作创新成果的代理指标。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 71,565 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- JointPatentCount [联合申请专利数量] — 参考戴宏伟等(2026,中国工业经济)的方法,计算公式为:当年以该上市公司名义申请、且申请人数量在两个及以上的专利申请件数之和。该字段是异地合作创新识别的样本基础,用作研究变量时可作为合作创新总量的规模控制,越大代表当年联合申请的专利越多。注意本字段为上市公司本体口径,不是合并报表口径异地联合申请专利数量的分母,两者口径不同不得相除。
- CrossCityJointPatent [异地联合申请专利数量] — 参考戴宏伟等(2026,中国工业经济)的方法,计算公式为:当年以该上市公司名义申请的联合申请专利中,全部申请人注册地级市去重后不止一个(或注册省份去重后不止一个)的专利件数之和;并用省级判据是因为省份不同必然地级市不同,可补回只能定位到省的高校院所与分公司类申请人,无法检索到注册地址的申请人(自然人、境外主体)不参与地区比较。用作研究变量,越大代表企业跨地级市开展的合作创新成果越多;需注意其中相当部分为同一企业集团内部主体的异地联署,而非跨越组织边界的外部合作。
- LnCrossCityJointPatent [异地合作创新水平(加1取对数)] — 参考戴宏伟等(2026,中国工业经济)的方法,计算公式为:异地联合申请专利数量加1后取自然对数。因异地联合申请专利数量取0值较多,该对数形式为原文基准回归的被解释变量之一。用作研究变量,越大代表企业异地合作创新水平越高。
- IhsCrossCityJointPatent [异地合作创新水平(反双曲正弦变换)] — 参考戴宏伟等(2026,中国工业经济)的方法,计算公式为:对异地联合申请专利数量作反双曲正弦变换,即ln(x+根号(x的平方+1))。该形式在保留零值观测的同时压缩右偏,为原文基准回归的被解释变量之一。用作研究变量,越大代表企业异地合作创新水平越高。
- CrossCityJointPatentCons [异地联合申请专利数量(合并报表口径)] — 参考戴宏伟等(2026,中国工业经济)的方法,跨地区判定规则与异地联合申请专利数量完全一致,但专利归属主体由上市公司名义放宽至合并报表主体,即同时计入上市公司子公司名下的专利,仍不计入联营企业与合营企业。用作替代度量而非等比例的稳健性放大,相当一部分企业年在本字段为正而核心字段为零,换用本字段会同时改变估计样本与零非零判定,越大代表企业集团层面的异地合作创新成果越多。注意本字段与联合申请专利数量口径不同(后者为本体口径),两者不得相除。
常见问题
- 「异地合作创新(跨地级市联合申请专利)」是什么数据集?
- 异地合作创新(跨地级市联合申请专利),隶属创新与知识产权。参考戴宏伟等(2026,中国工业经济)的方法,以联合申请专利作为企业异地合作创新成果的代理指标。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:联合申请专利数量、异地联合申请专利数量、异地合作创新水平(加1取对数)、异地合作创新水平(反双曲正弦变换)、异地联合申请专利数量(合并报表口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,565 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业异地合作创新,指的是分处不同地区的创新主体联合开展研发活动并共同形成创新成果。与本地合作相比,跨区域的合作意味着知识来源更异质、要素组合的空间跨度更大,因而常被用来刻画企业嵌入跨区域创新网络的深度,也被用作观察产业转移、区域一体化等空间政策如何作用于微观创新行为的落点。戴宏伟、乔莹莹与贺茜(2026)在研究国家级承接产业转移示范区政策效应时,将联合申请专利作为企业异地合作创新成果的代理指标,本数据集即按该文的操作定义构建。 构建的起点是联合申请专利。对每一件专利,观察其申请人的数量,凡申请人在两个及以上者,即认为该专利是由多个主体共同投入研发资源、共享权利归属的合作成果;申请人只有一个的专利属于独立创新,不进入后续判定。以上市公司名义申请的这部分联合申请专利,按其专利申请年度归集到企业当年,得到基础变量"联合申请专利数量",记为 $Joint{it}$。之所以以申请年度而非授权年度定位时间,是因为合作关系在提交申请时即已确立,授权环节的审查时滞会把合作行为的发生时点向后推移并带入审查不确定性。 在联合申请专利的基础上,进一步引入申请人的注册地信息以判定合作是否跨越地区。对每一件联合申请专利,逐个检索其申请人的注册地址并定位到行政区划;自然人申请人没有可比的注册地,不参与这一比较,境外主体同理。若某件联合申请专利的申请人所归属的地级行政区去重之后不止一个,即申请人并非全部位于同一地级市,则判定该专利是企业开展异地合作创新的成果。按此逐件判定后,对企业当年的这类专利求和,得到核心指标"异地联合申请专利数量",即 $$Cro\app{it}=\sum{p\in P{it}}\mathbf{1}\!\left\{\left|\,\{\,r(a):a\in Ap,\ r(a)\neq\varnothing\,\}\,\right|\geq 2\right\}$$ 其中 $P{it}$ 为企业 $i$ 在第 $t$ 年的全部联合申请专利,$Ap$ 为专利 $p$ 的申请人集合,$r(a)$ 为申请人 $a$ 的注册地行政区划,$r(a)=\varnothing$ 表示该申请人没有可供比较的注册地。 判定时同时使用地级与省级两层行政区划码:地级码去重不止一个,或省级码去重不止一个,均判为异地。之所以并用省级码,是因为行政区划码的前两位即为省级码,省份不同必然意味着地级市不同,故省级判据只会补回真实的跨地区合作而不会产生误判;而有一类申请人——高等院校与科研院所、以"某公司某地分公司"形态登记的主体、以及省名与市名相同的主体——只能定位到省而定位不到地级市,若只看地级码,这一整类跨省合作会被整体漏判为本地合作,而它们恰恰是产学研跨区域协作最典型的形态。判定基准是"申请人不全在同一地级市",而不是指认某一个特定申请人再与之比较——申请人名录中的主体可能是上市公司的分支机构或变更前名称,无法逐位可靠指认;在两个申请人的常见情形下,两种写法是等价的。 由于相当比例的企业在给定年度并未产生任何异地联合申请专利,该计数是一个零值占多数的右偏计数变量,直接进入线性模型并不合适。因此按原文的做法给出两种回归可用形式:一是加一后取自然对数 $lnapp{it}=\ln(1+Cro\app{it})$;二是反双曲正弦变换 $ihs\cro\app{it}=\operatorname{arcsinh}(Cro\app{it})=\ln\!\left(Cro\app{it}+\sqrt{Cro\app{it}^{2}+1}\right)$。两者都在保留零值观测的同时压缩右尾,后者对零值附近的处理更平滑,在原文中与对数形式并列作为被解释变量。 核心指标的专利归属限于以上市公司名义申请的专利,不并入被标注为子公司、联营企业或合营企业名下的专利,对应原文"以上市公司为申请主体"的表述。考虑到不少企业的研发活动实际由子公司承担,数据集另给出一个放宽归属口径的替代指标:在完全相同的跨地区判定规则下,将归属主体扩展至合并报表范围,即上市公司连同其子公司,但仍不计入联营企业与合营企业名下的专利。 补充说明 - 构念边界(使用前必读):跨地区的判定只看申请人的注册地是否相同,不区分申请人之间是否同属一个企业集团。多数被计入的异地合作,其合作方是同一集团的子公司、兄弟公司或同一法人的异地分公司、研究院,真正跨越组织边界的外部合作只占其中一部分,且这一比重在企业之间从接近零到接近全部都有分布。因此同一个数值,对多厂区制造企业意味着内部跨地申报的组织方式,对另一些企业才意味着真实的对外合作。这与原文口径一致,属于忠实复现下的固有性质。关注跨组织外部合作的研究,宜控制企业专利总规模,并结合控股关系数据自行剔除同集团申请人。 - 面板结构与估计方法:该变量高度集中且零膨胀——少数专利规模极大的企业贡献了总量的很大一部分,多数企业在全样本期内恒为零,加入企业固定效应后真正提供组内变异的企业只是其中一小部分。规模越大、国有控股的企业取值越高,而这一梯度的机制主要是异地分支机构的数量而非合作意愿。尤其要注意零值的构成:占多数的零并不是"有创新但没有异地合作",而是当年根本没有提交任何专利申请,其次才是有专利但无任何联合申请,真正"有联合申请而均在同城"的只占很小一部分。也就是说主导零过程的是是否从事可专利化研发这一外延边际,而非合作决策。因此建议采用泊松固定效应或 Tobit 等适配角点解的估计量,而非对加一取对数的结果直接做最小二乘;要条件于有创新活动的子样本,须自行合并专利计数类数据。并建议报告剔除专利大户后的稳健性,研究窗口起点不早于 2007 年,更早年份的零值多为专利制度意义上的结构性零。 - 两列口径不同,不得相除:核心列按上游关系标注取"上市公司本身",该标注并非严格的法人本体,其中一小部分实为与上市公司同名的集团下属制造主体,因此核心列实际是"以上市公司名义匹配的主体"口径。合并报表口径列不是核心列的等比例放大,而是另一个口径的替代度量:相当一部分观测在核心列为零而在该列为正,两列的秩相关明显低于一,换用该列会同时改变估计样本与零非零判定,系数变化不能简单归因于口径宽窄。特别提示:联合申请专利数量是本体口径的总数,不是合并报表口径异地计数的分母,两者相除会得到大于一甚至数十倍的无意义强度值;合并口径的分母需自行另行统计。 - 地址定位与地理列:申请人注册地由企业登记信息与机构名录匹配得到,自然人与境外主体无法定位,部分早年成立或已注销的主体也可能匹配不上;未能定位的申请人不参与比较,其后果是这类专利更容易被判为非异地,方向上偏低估。可定位申请人的比例在样本期内随年份上升,因此异地专利占联合申请专利的比率含有随时间上升的测量成分,时序比较应加入年份固定效应。数据集自带的省市区县字段是企业注册地的静态快照,其中地级市代码存在两类缺失:一类的城市字段填的是县级市(江阴、张家港、昆山、诸暨、海宁等),这类多数带有区县代码,可用"区县代码整除一百再乘一百"上卷到地级;另一类的城市字段本身就是合法地级市却仍缺代码,集中在东莞与中山这两个不设区的地级市,需按名称直接补码。按城市代码匹配地级市层政策名单前务必先处理这两类,否则相关企业会静默落入对照组。 - 末年与其他局限:专利底库收录发明专利与实用新型,不含外观设计;发明专利自申请到公开存在约十八个月的滞后,最近一个申请年度通常只覆盖其最终件数的一半左右,数据集按统一规则截断至上一自然年并保留该年,但该年的水平相对前一年会出现纯由披露滞后造成的下折,末年及由其计算的年度均值均不适合用于推断,终点落在末年的事件研究会在最后一期观察到虚假的负效应。上市之前年度的联合申请专利不进入面板,被丢弃的观测集中于上市较晚且上市前研发活跃的大型企业。一件联合申请专利若同时归属两家及以上上市公司,会在各自的企业年记一次,这符合合作对参与各方均成立的含义,但同一件专利在不同企业之间并非独立观测。此外,上游的专利主体匹配存在少数股票代码成对串位的情形,表现为以 003 开头的代码与同尾号的 600 开头代码共享专利,落在这些代码上的取值应予剔除。 参考文献 - 戴宏伟, 乔莹莹, 贺茜. 产业转移如何促进企业异地合作创新——基于产业链供应链优化视角[J]. 中国工业经济, 2026, (6): 138-162.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。