企业创新突破度(专利引用CD指数)
「企业创新突破度(专利引用CD指数)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 69,272。 参考王雄元、秦江缘(2023,经济研究)的方法测度企业创新突破度(CD指数)。
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 69,272 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PatentCount [当年专利申请件数] — 企业当年申请的专利件数,含发明专利与实用新型;由多家上市公司联合申请的专利计入每一家参与企业。用作企业创新突破度指标的分母。
- PatentWithPredecessorCount [可追溯技术前驱的专利件数] — 企业当年申请的专利中能够查到后向引用(技术前驱)记录的件数,计算公式为:当年专利中后向引用记录数大于0的件数。该件数占当年专利件数的比重越低,说明企业创新突破度指标中由缺乏技术前驱记录而机械取上界的成分越高。
- CitedPatentCount [获得后续引用的专利件数] — 企业当年申请的专利中获得过后续专利引用的件数,计算公式为:当年专利中前向引用次数大于0的件数。
- ForwardCitationCount [后续引用总次数] — 企业当年申请的专利获得的后续引用件次合计,计算公式为:当年各项专利被后续专利引用的件次之和,同一后续专利的多个公开号版本合并计为一次。
- DisruptiveCitationCount [突破型引用次数] — 参考王雄元、秦江缘(2023,经济研究)的方法,计算公式为:后续专利只引用本专利而未引用本专利任何技术前驱的引用件次合计,即单次引用突破程度CD1指数取值为1的引用次数。
- ConsolidatingCitationCount [巩固型引用次数] — 参考王雄元、秦江缘(2023,经济研究)的方法,计算公式为:后续专利既引用本专利又引用本专利技术前驱中任意一项的引用件次合计,即单次引用突破程度CD1指数取值为-1的引用次数。
- CD [企业创新突破度] — 参考王雄元、秦江缘(2023,经济研究)的方法,计算公式为:企业当年全部专利的CD2指数的算术平均值。其中单项专利的CD2指数等于该专利突破型引用次数与巩固型引用次数之差除以其被引用总次数;后续专利只引用本专利而未引用其技术前驱时该次引用计为突破型(取值1),既引用本专利又引用其技术前驱时计为巩固型(取值-1);未获得后续引用的专利其CD2指数记为0。取值范围为-1到1。用作研究变量,越大代表企业创新突破度越高。
常见问题
- 「企业创新突破度(专利引用CD指数)」是什么数据集?
- 企业创新突破度(专利引用CD指数),隶属创新与知识产权。参考王雄元、秦江缘(2023,经济研究)的方法测度企业创新突破度(CD指数)。
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:当年专利申请件数、可追溯技术前驱的专利件数、获得后续引用的专利件数、后续引用总次数、突破型引用次数、巩固型引用次数、企业创新突破度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,272 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的创新产出并非同质。有的创新开辟出一条新的技术路径,使后来者不必再回到它所依赖的旧技术上去;有的创新则只是沿着既有轨迹做增量改进,后来者在借鉴它的同时仍然要继续依赖那些旧技术。前者构成技术轨迹的突破,后者构成对既有轨迹的巩固。这一区分无法从专利的数量或被引次数直接读出,但可以从后续专利的引用方式中揭示出来:若后来者只引用这项创新本身而绕开了它的技术前驱,说明这项创新已经取代了原有技术路径;若后来者在引用它的同时也继续引用那些技术前驱,说明它只是原有路径上的一次改良。本数据集依据这一思想,参考王雄元、秦江缘(2023)的研究测度企业的创新突破度。 指标的构造从单次引用出发,逐层向上汇总,共三步。 第一步,判定每一次被引用的性质。 设 $i$ 为焦点专利,$j$ 为在其之后引用了它的某项专利。记 $f{ij}$ 为 $j$ 是否引用了 $i$,$b{ij}$ 为 $j$ 是否引用了 $i$ 的技术前驱(即 $i$ 自身在申请文件中所引用的那些在先专利)中的任意一项。该次引用的突破程度为 $$CD1{ij} = -2 f{ij} b{ij} + f{ij}$$ 由于 $j$ 已经引用了 $i$,$f{ij}$ 恒等于 1,上式化简为 $CD1{ij} = 1 - 2 b{ij}$。于是:当 $j$ 只引用了 $i$ 而未触及 $i$ 的任何技术前驱时,$CD1{ij} = 1$,这一次引用是突破型的;当 $j$ 既引用了 $i$ 又继续引用其技术前驱时,$CD1{ij} = -1$,这一次引用是巩固型的。判定只关心 $j$ 是否引用了前驱集合中的任意一项,不关心引用了几项。 第二步,汇总到每一项专利。 一项专利可能被若干项后续专利引用,将其全部被引用的突破程度按被引用数量取平均,得到该项专利的突破程度 $$CD2i = \frac{1}{ni} \sum{j} CD1{ij}$$ 其中 $ni$ 为引用了专利 $i$ 的后续专利件数。等价地,$CD2i$ 等于该专利的突破型引用次数与巩固型引用次数之差除以两者之和。取值落在 $-1$ 到 $1$ 之间:全部后续引用都绕开了技术前驱时取 1,全部后续引用都同时保留了技术前驱时取 $-1$。未获得任何后续引用的专利不存在可供判定的引用行为,其 $CD2i$ 记为 0,这与第三步按专利件数取平均的口径相一致。 第三步,汇总到企业年度。 企业当年申请的全部专利,其突破程度的算术平均即为该企业当年的创新突破度 $$CD = \frac{1}{N} \sum{i} CD2i$$ 其中 $N$ 为企业当年申请的专利件数。取值同样落在 $-1$ 到 $1$ 之间,越大表示企业当年的创新越倾向于开辟新的技术路径,越小表示越倾向于在既有轨迹上做增量改进。 在引用关系的处理上有两点需要交代。其一,引用网络以"一项发明"而非"一份专利文献"为节点。同一项发明在中国专利体系下可能先后产生公开、授权等多个公开号,引用记录会分散挂在不同的公开号上。本数据集将同一申请号下的全部公开号版本归并为一个节点,引用边按节点对去重。不作这一归并会在两处造成偏误:一是同一后续专利的不同版本引用同一焦点专利时被重复计数,二是"焦点专利的前驱"与"后续专利的引用列表"因公开号版本不同而错失本应成立的交集,从而低估巩固型引用。其二,由多家上市公司联合申请的专利计入每一家参与企业,即该专利同时进入各参与企业当年的专利件数与突破度计算。 除核心指标外,数据集一并给出构造过程中的分项:企业当年的专利申请件数、其中可追溯到技术前驱的件数、其中获得后续引用的件数,以及后续引用的总次数及其按突破型与巩固型的分解。这些分项既是核心指标的计算构件,也便于使用者判断指标在特定企业年度上的信息基础。 指标的构成性质需要特别说明。由于第三步的分母是企业当年的全部专利件数,而未获引用的专利其 $CD2$ 记为 0,核心指标可以精确分解为两个部分的乘积:一是当年专利中获得后续引用的比例,二是仅在这些被引专利上计算的突破程度条件均值。前者刻画创新成果被后续技术关注的广度,后者刻画被关注的那部分创新在多大程度上偏离了既有技术轨迹。实测条件均值在各年度之间相当稳定,因此核心指标在时间与横截面上的变异有相当部分来自被引比例这一数量维度,而非突破与巩固的结构差异。两个分项都可以由数据集给出的字段直接还原:条件均值等于 $CD \times PatentCount / CitedPatentCount$。使用者若只关心"被关注的创新有多突破",可直接使用该条件均值;若关心广度与结构的综合,则使用核心指标本身;若以核心指标作被解释变量,建议将被引比例一并作为控制变量。 还需注意,突破型与巩固型引用次数是引用次数口径的合计,而核心指标是专利等权口径——它先对每项专利求出自身的突破程度,再在专利之间等权平均。因此由两个计数列直接相除得到的比值是引用次数加权的版本,与核心指标并不相等,也不能替代它。两个计数列与后续引用总次数满足加和关系,但该关系不蕴含可以反推核心指标。 补充说明 - 样本口径:覆盖全部行业与全部板块,不预先剔除金融业与特别处理公司,使用者可按行业代码自行筛选。专利归属采全口径,含上市公司本身及其子公司、联营企业与合营企业,并包含少量北交所与新三板主体。仅当企业当年申请过专利时才生成观测,当年无专利的企业年度不补零行,因此企业的年度序列可能存在断档;使用者按股票代码与年度合并后,可依其研究设计自行决定按零值还是按缺失处理,做滞后项时需注意断档处的错位。年度按专利申请年归属,数据不作缩尾处理,保留原始取值区间。 - 技术前驱记录的完整性:突破与巩固的判定依赖焦点专利自身的在先引用记录。未能查到此类记录的专利缺少可供比较的基准,其 $b$ 值恒为 0,在获得后续引用时突破程度取到上界。实用新型因不经实质审查,普遍不产生审查员引用记录,受此影响明显大于发明专利。与之独立的另一重影响是:实用新型同样几乎不作为引用方出现在引用网络中,因此被引次数与条件均值的分母实际上只统计了来自发明专利的引用,以实用新型为主要引用来源的技术领域(机械与低技术制造等)其被引比例被系统性低估。这两重影响都随企业的实用新型占比放大。数据集给出可追溯技术前驱的专利件数,使用者可据此评估其在企业当年专利中的比重并按需筛选。 - 时间维度的可比性:接近数据末端的申请年度同时受三重不成熟影响——后续引用尚未积累、专利本身尚未全部公开因而分母偏小、且实用新型的公开滞后长于发明专利因而专利类型构成明显偏向发明。后两者改变的是企业当年专利的组合成分,年份固定效应无法吸收。核心指标因而在时间维度上呈现随年份递减的形态,这一形态主要反映引用与公开的积累程度。指标适合用于同一年度内的企业间比较;跨年度使用时建议加入年份固定效应,关心可比性的研究可考虑剔除最近两个申请年。基于同样的原因,面板起点设在引用记录覆盖趋于稳定之后。 - 引用网络范围与自引:引用关系覆盖中国专利对在先专利的引用,境外专利引用中国专利的部分不在其中;突破型与巩固型两项计数因此同向减少,对二者之比的影响相互抵消,但被引用总次数系统性偏小。自引未作剔除——王雄元、秦江缘(2023)与 Funk、Owen-Smith(2017)均未要求剔除。企业自己的后续专利通常沿同一技术脉络展开、倾向于继续引用同一批技术前驱,因而多被判为巩固型,内部连续研发强度高的企业取值偏低。 - 与原始指数的口径差异:本数据集遵循王雄元、秦江缘(2023)的定义,第二步的分母为焦点专利的被引用数量。Funk 与 Owen-Smith(2017)及 Park 等(2023)提出的原始指数,其分母还包含"只引用了焦点专利的技术前驱而未引用焦点专利"的后续专利。分母更小使本指标在同等引用结构下绝对值更大,两者不可直接比较。原始指数的实现还普遍采用固定引用窗口,本数据集则采用开放窗口。这些约定的差异足以使同名指标之间取值不同,跨数据集比较前应先核对口径。 - 小分母与离散取值:专利件数很少的企业年,其取值由少数几次引用决定,方差明显大于专利众多的企业,且集中在少数几个分数质点上;专利仅一件时取值只能是 $-1$、$0$ 或 $1$。这一异方差由指标构造本身产生,聚类稳健标准误不予处理。建议报告按专利件数分组或设最低件数门槛的稳健性结果。 - 其他说明:联合申请使同一专利进入多家企业的计算,企业间观测并非相互独立。少数企业存在新旧证券代码并存的情形,会产生数值相同的两行观测。 参考文献 - 王雄元,秦江缘.创新竞争与企业高质量创新模式选择——来自专利被无效宣告的经验证据[J].经济研究,2023,58(11):80-98. - Park M, Leahey E, Funk R J. Papers and patents are becoming less disruptive over time[J]. Nature, 2023, 613(7942): 138-144. - Funk R J, Owen-Smith J. A dynamic network measure of technological change[J]. Management Science, 2017, 63(3): 791-817.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。