企业专利碎片化指数

「企业专利碎片化指数」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 71,565。 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法构建企业专利权碎片化指数。

时间跨度1990-2025 年
数据频率年度
层级上市公司
变量数18
样本量71,565
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 面板年度,本数据集各指标均为截至该年度的累计口径
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • CumExternalCitationCount [累计对外专利引用数] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法,为碎片化指数各份额的分母,计算公式为:企业截至当年申请的全部发明专利与实用新型对外部专利权人所持专利形成的后向引用条数之和,剔除引用自身专利的部分,并剔除无法识别专利权人的引用
  • CumCitedAssigneeCount [累计被引专利权人数] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法,计算公式为:企业截至当年在其专利中引用到的不同外部专利权人的个数,剔除引用自身专利的部分。该数值越大表明企业的技术来源越广
  • Top4CitationShare [前四大被引专利权人引用份额] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法,计算公式为:将企业截至当年对各外部专利权人的引用条数占对外引用总条数的比重按降序排列,取前四位比重之和;累计被引专利权人不足四家时该值为1
  • Top8CitationShare [前八大被引专利权人引用份额] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法,计算公式为:将企业截至当年对各外部专利权人的引用条数占对外引用总条数的比重按降序排列,取前八位比重之和;累计被引专利权人不足八家时该值为1
  • PatentFragmentationIndex [专利碎片化指数] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)的原始公式,计算公式为:1减去前四大被引专利权人引用份额。用作研究变量,越大代表企业引用的先行技术越分散于众多不同专利权人手中、为保持研发自由度需要交涉的对象越多、专利纠纷与许可谈判的交易成本越高
  • PatentFragmentationIndex8 [八企业专利碎片化指数] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)正文列举的替代度量,用于专利碎片化指数的稳健性检验,计算公式为:1减去前八大被引专利权人引用份额
  • PatentFragmentationHHI [赫芬达尔式专利碎片化指数] — 参考Noel和Schankerman (2013, The Journal of Industrial Economics)正文列举的替代度量,用于专利碎片化指数的稳健性检验,计算公式为:1减去各外部专利权人引用份额的平方和

常见问题

「企业专利碎片化指数」是什么数据集?
企业专利碎片化指数,隶属创新与知识产权。参考Noel和Schankerman (2013, The Journal of Industrial Economics)的方法构建企业专利权碎片化指数。
该数据集的时间范围是?
覆盖 1990-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:累计对外专利引用数、累计被引专利权人数、前四大被引专利权人引用份额、前八大被引专利权人引用份额、专利碎片化指数、八企业专利碎片化指数、赫芬达尔式专利碎片化指数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 71,565 条观测。
数据是如何测算/获取的?
指标定义与计算方法 在累积性创新特征明显的技术领域中,一项新发明往往必须建立在大量在先专利之上。当这些在先专利分散掌握在众多互不隶属的权利主体手中时,企业为保持自身研发与生产的自由度,就不得不同时与多个权利人展开许可谈判或纠纷交涉。由于专利争议通常是双边而非集体解决的,交涉对象数目越多,谈判破裂的概率越高,并会产生所谓的互补品问题——价值最大化要求各权利人协调一致地让渡权利,而彼此独立的权利主张者并不会顾及这一点。这种由权利分散所引致的交易成本上升,就是文献中所称的专利丛林。Noel 和 Schankerman (2013, The Journal of Industrial Economics) 把它与专利组合规模并列,视为战略性专利行为的两个核心侧面,并据此构造了一个直接可观测的权利分散度量。 与更早一脉的做法不同,该文并不去测量焦点专利所在技术领域内部专利在企业间的分散程度,而是把测量对象定位在焦点企业自己引用到的那些外部主体上。其理由在于,后向引用标识的正是该项发明所实际借鉴的在先技术,而已有研究表明技术相似度越高,专利诉讼发生的可能性越大;因此企业真正需要交涉的对手,最可能出现在它引用过的那批权利人之中。 具体构造分三步。第一步确定引用关系的归属。对企业 $i$ 截至第 $t$ 年申请的全部发明专利与实用新型,逐一识别其引用的每一件在先专利,并进一步识别该在先专利的权利人。凡被引专利属于企业 $i$ 自身专利集合的,作为自引予以剔除;无法识别权利人的引用同样不予采计。由此得到企业 $i$ 到第 $t$ 年为止对外部权利人 $j$ 形成的累计引用条数 $cite{ijt}$,以及剔除自引后的累计对外引用总条数 $$ cite{it} = \sum{j \neq i} cite{ijt} $$ 第二步把引用条数转换为份额分布。企业 $i$ 在第 $t$ 年对权利人 $j$ 的引用份额为 $s{ijt} = cite{ijt} / cite{it}$,并将全部份额按由大到小排列。这一分布刻画了企业技术来源的集中程度:若企业的引用高度集中于少数几家主体,则份额分布陡峭;若引用零散地落在大量互不相关的主体上,则分布平坦。需要强调的是,这里的份额是累计到第 $t$ 年的存量口径而非当年流量口径,与原文的界定一致;企业在某一年度没有产生新的对外引用时,其份额分布相应保持不变。 第三步以份额分布的头部集中度反向定义碎片化。核心指标取降序排列后前四位份额之和的补数 $$ Fragcites{it} = 1 - \sum{j=1}^{4} s{ijt} $$ 其取值落在零到一之间。当企业累计引用到的外部权利人不足四家时,前四位份额之和恰为一,指标取零,表示企业的技术来源完全集中于极少数主体、不存在需要广泛交涉的权利分散问题;反之,指标越接近一,意味着企业引用的在先技术越分散于众多不同权利人手中,为保持研发自由度所需交涉的对象越多,专利纠纷与许可谈判的交易成本越高。原文进一步指出,由该指标的取值可以反推企业面对的交涉对手规模:在份额均等分布的对称情形下,指标数值与所引用的权利人家数之间存在确定的对应关系。 原文在正文中还列举了两个基于同一份额分布的替代度量,用于检验结论对头部截断位置与集中度函数形式的敏感性。一是把截断位置由前四位放宽到前八位,得到 $Fragcites8{it} = 1 - \sum{j=1}^{8} s{ijt}$;二是改用赫芬达尔形式的集中度,即以份额平方和的补数度量分散程度,$FragHHI{it} = 1 - \sum{j \neq i} s{ijt}^{2}$。前者对头部之外的长尾更不敏感,后者则对全部权利人的份额差异同时赋权。原文报告使用这两个替代度量所得的计量结果与主度量基本一致。 了解原文如何使用该指标,有助于判断把它放进哪一个方程、并预期何种系数方向。原文把碎片化与专利组合规模一并嵌入一个同时刻画市场价值、专利产出与研发投入的三方程体系。理论上,权利分散程度上升直接推高企业的专利执行成本,因而对市场价值的影响方向是确定的负向;而它对专利产出与研发投入的影响则是不确定的:一方面执行成本上升压低了创新活动的盈利性,另一方面当需要与更多权利人交涉时,积累自有专利组合以换取谈判筹码的边际价值也随之提高,两股力量方向相反。原文正是利用这一不确定性来构造识别——若实证上观察到碎片化提高了专利产出或研发投入,即可反推执行成本函数中的交叉项为负,也就是权利分散确实强化了防御性专利积累的动机。原文在其样本上报告的结果为:碎片化程度越高,企业市场价值越低,而专利与研发水平越高。 数据集在给出上述三个指数的同时,一并提供份额分布的分子分母与头部集中度本身,即累计对外引用条数、累计被引专利权人家数,以及前四大与前八大权利人的引用份额之和,便于使用者复核指标构造、或直接以头部集中度作为反向度量进入模型。 补充说明 - 样本口径:面板覆盖全部 A 股上市公司自上市年度至退市年度(或数据可得的最后一年)的全部年度,包含全部行业与全部板块,不预先剔除金融业。四个指数在构造上已落在零到一的有界区间,无需再做缩尾。原文为服务其识别策略将样本限定为软件行业企业并限于该文写作时可得的年份区间,本数据集不施加这类限制,使用者可按行业代码与年份自行收窄。 - 指标与交涉对手规模的关系(最重要的使用限制):在份额均等的对称情形下,前四位份额之和等于四除以权利人家数,指标因此存在一个由家数唯一决定的机械上界,实际取值稳定落在该上界的一个较窄的固定比例附近。这是该度量的定义性质而非实现偏差——原文正是由样本均值反推出"对称情形下企业平均引用约八家外部主体",明确把它读作交涉对手规模的度量。但本数据集覆盖企业的权利人家数高出原文样本若干个数量级,指标因而被压进接近上界的窄区间,水平系统性高于原文报告值、组内离散在家数较多的区间明显收窄(分布形态的左偏与原文一致)。因此:跨样本比较绝对水平意义有限;若要把它解释为超出"技术来源广度"之外的独立效应,应同时纳入累计被引权利人家数或累计对外引用条数的对数作为控制变量,并报告加入该控制前后的系数变化。 - 时间趋势与回归窗口:累计口径使指标随引用存量积累而逐年抬升,年度均值的时序变化主要来自存量积累而非权利分散度本身的波动;企业在某年度没有新增对外引用时取值保持不变,低专利强度的零售、房地产与公用事业企业因此可能出现长期不变的取值,在含年份固定效应的回归中相对年度均值形成单调扩大的偏离。此外,引用记录的覆盖率在样本期两端低于中段:早段存在一处显著跃升,跃升之前年份的取值主要由数据可得性决定;最末若干申请年因引用记录尚未成熟而依次下降。年份固定效应只能吸收共同水平,吸收不了存量积累速度随企业规模而异所形成的企业特定斜率。建议把回归窗口设在覆盖率跃升之后、末端若干年之前的稳定区间并与全样本对照,同时对累计引用条数过低的观测做敏感性检验——经双向固定效应与家数控制后,剩余可用变异主要来自引用条数最少的那一组企业。 - 专利权人的识别粒度:被引专利的权利人取其规范化申请人名称的首位,该规范化只统一名称写法而不做集团实体层面的归并,同一法人可能以多个名称串出现、被计为多个交涉对象;共有专利只计首位权利人。原文则对其样本企业做过母子公司口径的人工匹配。这会压低头部份额、使本指标偏高,且影响程度与技术领域相关:引用电网、电子科技、铁路建设等大型集团系专利的企业,其对手方被拆分的空间远大于引用少数国际大厂的半导体与通信企业。这一部分偏差作用于行业组内的相对位置,行业固定效应无法吸收,故不宜跨技术领域比较绝对水平。 - 施引方专利的界定:原文把施引方表述为企业截至该年已获授权的专利,同时又声明专利一律按申请年标定。本数据集按申请年累计且不另行筛选授权状态,故尚未授权的发明申请也计入,引用基数略大。归属到企业名下的专利除母公司自身与子公司外还含联营与合营企业的专利,后两类不纳入合并报表,计入会使交涉对象范围偏大;原文只把子公司专利并入母公司。 - 替代度量与其他局限:八企业版与赫芬达尔版建立在同一份额分布之上,与主度量并非独立口径,其中赫芬达尔版在权利人家数较多时区分度有限(家数越多份额平方和越趋于零,取值越集中于接近一的窄区间,原文样本的家数仅个位数才有充分变异),做稳健性检验时宜同时报告三列的相关矩阵与分位数分布。企业在某年度尚无任何可识别的对外引用时份额分布无从定义,四个指数取缺失而非零——零已被赋予"权利人不足四家"的实义,故缺失不可填零;缺失以累计零专利的企业为主,另有一部分是只申请实用新型而无发明专利的真实申请者(实用新型不作实质审查、几乎不产生引用记录,本指标实际由发明专利驱动),行业缺失率在住宿餐饮、房地产、批发零售明显高于科学研究与技术服务业、制造业与信息传输业,研究全行业样本时须说明有效样本已偏向专利活跃行业。后向引用是在专利公开与实质审查阶段才形成的记录、晚于申请年,故累计快照含前视信息,对时效敏感的识别策略宜改用滞后项。归属到企业名下的专利在上游存在多代码串共享的情形,既含真实的集团内归属也含名称词典的误挂,对个别公司做案例解释前宜先核对其多代码归属比例。企业引用自身境外同族专利、以及引用同一集团内非隶属主体的专利,均按外部权利人计入。 参考文献 - Noel M, Schankerman M. Strategic patenting and software innovation[J]. The Journal of Industrial Economics, 2013, 61(3): 481-520.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。