企业专利丛林密度与质量

「企业专利丛林密度与质量」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 71,817。 衡量企业所处专利丛林的两个维度:密度维度用企业后向引用在不同外部专利权人间的分散程度(专利分散指数)刻画产权碎片化成本,质量维度用累计专利在IPC大组间的分布宽

时间跨度1990-2025 年
数据频率年度
层级上市公司
变量数17
样本量71,817
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • ExternalCitationCount [对外专利引用数] — 企业当年申请的发明专利与实用新型对外部专利权人所持专利的后向引用总次数,已剔除引用本企业自有专利的自引。用作专利丛林密度的分母。
  • CitedAssigneeCount [被引专利权人数] — 企业当年申请专利所引用的不同外部专利权人数量,已剔除自引。数值越大代表企业所需互补性技术分属越多的权利主体。
  • CumPatentCount [累计专利申请量] — 企业截至当年累计申请的发明专利与实用新型总数,不含外观设计。用作专利丛林质量的分母。
  • CumMaingroupCount [累计IPC大组数] — 企业截至当年累计申请专利的主分类号所覆盖的不同国际专利分类大组数量。数值越大代表企业知识基础横跨的技术领域越多。
  • PatentThicketDensity [专利丛林密度] — 参考李鹏等 (2026, 科学学研究)与Ziedonis (2004, Management Science)的方法,计算公式为:1减去企业当年对各外部专利权人的引用次数占其对外引用总次数比重的平方和,取值范围为0至1。当年没有对外引用时该指标为空。用作研究变量,越大代表企业所需的互补性专利越分散于不同权利主体,所处专利丛林密度越高,许可谈判与侵权诉讼成本越大。
  • PatentThicketQuality [专利丛林质量] — 参考李鹏等 (2026, 科学学研究)与李宏等 (2021, 世界经济研究)知识宽度的方法,计算公式为:1减去企业截至当年累计申请专利在各国际专利分类大组上分布比重的平方和,取值范围为0至1。没有累计专利时该指标为空。用作研究变量,越大代表企业专利组合覆盖的技术领域越宽,知识基础越丰富,越有利于跨领域技术重组。

常见问题

「企业专利丛林密度与质量」是什么数据集?
企业专利丛林密度与质量,隶属创新与知识产权。衡量企业所处专利丛林的两个维度:密度维度用企业后向引用在不同外部专利权人间的分散程度(专利分散指数)刻画产权碎片化成本,质量维度用累计专利在IPC大组间的分布宽
该数据集的时间范围是?
覆盖 1990-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:对外专利引用数、被引专利权人数、累计专利申请量、累计IPC大组数、专利丛林密度、专利丛林质量。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 71,817 条观测。
数据是如何测算/获取的?
指标定义与计算方法 专利丛林指某一技术领域内大量互补性专利分属不同权利主体所构成的复杂网络。企业若要合法实施自身技术,往往需要同时取得多个主体持有的互补专利授权,由此产生的许可谈判费用与侵权诉讼风险构成产权碎片化的代价;另一方面,企业自身专利组合覆盖的技术领域越宽,越有条件通过交叉许可与跨领域重组化解这一代价。本数据集把专利丛林拆解为密度与质量两个维度,分别刻画这两种方向相反的力量。 密度维度衡量企业获取外部技术时面对的权利主体分散程度。企业当年申请的专利会引证一批既有专利,这些被引专利各自归属于不同的专利权人。若引证高度集中于少数几个权利人,企业只需与少数对手谈判即可获得所需技术;若引证广泛散布于大量互不相干的权利人,企业便陷入典型的专利丛林。据此,以企业当年对各外部专利权人引证次数的份额构造赫芬达尔指数,取其补数作为专利分散指数: $$Frag{it}=1-\sum{j\neq i}\left(\frac{cite{ijt}}{cite{it}}\right)^{2}$$ 其中 $cite{ijt}$ 为企业 $i$ 在第 $t$ 年对专利权人 $j$ 的专利引证次数,$cite{it}$ 为企业 $i$ 当年的引证总次数。求和下标 $j\neq i$ 表示剔除企业引证自身专利的自引部分,分子与分母作同一口径处理。指标落在 0 至 1 区间:取值越小说明企业在该技术领域内掌握的专利权越完整,取值越大说明专利权越分散、企业所处的专利丛林密度越大。企业当年申请的专利没有产生任何对外引证时,该指标不予定义。 引证的年度归属以施引专利的申请年为准,与质量维度保持一致。自引的识别方式是判断被引专利是否属于该企业自身的专利集合。 质量维度衡量企业专利组合所承载知识的广度。国际专利分类把技术层层细分为部、大类、小类、大组与分组,本数据集在大组层面上考察企业专利的分布: $$PQ{it}=1-\sum{j}\left(\frac{N{ijt}}{N{it}}\right)^{2}$$ 其中 $N{ijt}$ 为企业 $i$ 截至第 $t$ 年在大组 $j$ 下累计申请的发明专利与实用新型数量,$N{it}$ 为其截至当年在全部大组下的累计申请总量。为准确衡量专利所应用知识的复杂程度,外观设计专利不纳入计算;每件专利按其主分类号归入唯一一个大组。取值越大说明企业知识基础横跨的技术领域越多,越有条件通过跨领域技术交叉融合降低知识重组成本、提升技术商业化效率。 数据集同时给出两式的分母与分项个数,即当年对外引证总次数、被引专利权人个数、累计专利申请量与累计大组数,便于使用者复核指标构造或按自身需要调整口径。 面板覆盖全部A股上市公司,自上市当年至退市当年或数据可得的最后一年。质量维度为累计存量,企业某年没有新申请时沿用上一年取值;密度维度为当年流量。受专利公开滞后影响,最新申请年份的专利只公开了其中一部分,因此年份上限统一取当前自然年的前一年。 补充说明 - 样本口径:不预先剔除金融业、ST 公司与亏损企业,也不做缩尾,两个指标按构造均落在 0 至 1 区间;原文在回归样本上另有剔除,使用者可按各自的研究设计施加。 - 引文收录范围:原文所用引文数据以境内专利为主,本数据集的引证记录同时覆盖境内外被引专利并包含审查环节补充的引证,单位企业年的引证条数明显更多。由于分散指数随引证条数上升而趋近上限,本数据集密度维度的水平高于原文报告值、离散程度低于原文;直接对照其绝对水平意义有限,建议加入年份固定效应,并同时控制引证条数的对数。 - 权利人识别粒度:被引专利的权利人以名称为单位识别,同一集团下的不同法人主体、以及同一法人的不同名称写法会被视为不同的权利人,方向上放大分散指数。 - 被引专利的处理细节:一件被引专利由多个权利人共有时,以其首位权利人代表该专利归属;少数被引专利没有权利人记录,无法归入任何一个权利人,不计入引证总次数;少数专利的主分类号缺失或不符合分类格式,不计入知识广度的分子与分母。 - 自引识别的边界:自引以境内专利公开号为匹配依据,企业引证自身境外同族专利、或引证同一集团内其他法人主体的专利,会计入外部引证。 - 施引专利的实际构成:实用新型在国内不做实质审查、不出具检索报告,进入引文记录的比例极低,密度维度实际上主要由发明专利驱动。 - 专利归属关系:上市公司本身、子公司以及联营与合营企业的专利一并计入。联营与合营企业不纳入合并报表,对此敏感的研究设计可自行收窄口径。 - 其他局限:引文记录对样本期最早与最近若干年的覆盖低于中间年份,密度维度在两端的水平变化部分反映收录进度;累计口径的质量维度逐年不减且与专利组合规模同向变动,在双向固定效应设定下可识别的变异主要来自组合广度的增速。 参考文献 - 李鹏,黄文静,彭华涛.专利丛林对企业高质量发展的影响机制研究[J].科学学研究,2026,44(7):1501-1513. - Ziedonis R H. Don't fence me in: Fragmented markets for technology and the patent acquisition strategies of firms[J]. Management Science, 2004, 50(6): 804-820. - 李宏,王云廷,吴东松.专利质量对企业出口竞争力的影响机制:基于知识宽度视角的探究[J].世界经济研究,2021(1):32-46,134.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。