企业创新质量(专利被引法)

「企业创新质量(专利被引法)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 96,731。 参考李仲泽(2020,山西财经大学学报)借鉴Balsmeier等(2017,JFE)的方法,以上市公司本身及控股子公司当年申请专利中获得前向引用(剔除自引)的专

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数17
样本量96,731
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentApplications [当年申请专利总数] — 参考李仲泽(2020,山西财经大学学报)的方法,计算公式为:上市公司本身及其控股子公司当年申请的发明专利与实用新型专利去重总数(联合申请按参与公司分别计入)。用作创新质量分箱的计算链构件,越大代表当年专利产出规模越大
  • LnCitations [创新质量(被引专利数)] — 参考李仲泽(2020,山西财经大学学报)借鉴Balsmeier等(2017,JFE)的方法,计算公式为:ln(1+当年申请专利中获得他方前向引用(剔除自引)至少1次的专利数量)。专利被引率越高其实质性价值越大,用作企业创新质量核心研究变量,越大代表创新总体质量越高
  • LnTop1 [前1%高被引专利数] — 参考李仲泽(2020,山西财经大学学报)的方法,计算公式为:ln(1+当年申请专利中被引次数位于同申请年队列前1%的专利数量)。用作顶尖质量创新的稳健性度量,越大代表企业最高质量专利越多
  • LnTop2To10 [前2-10%高被引专利数] — 参考李仲泽(2020,山西财经大学学报)的方法,计算公式为:ln(1+当年申请专利中被引次数位于同申请年队列前2%至前10%的专利数量)。用作较高质量创新的稳健性度量,越大代表企业较高质量专利越多
  • LnCited [一般被引专利数] — 参考李仲泽(2020,山西财经大学学报)的方法,计算公式为:ln(1+当年申请专利中被引次数排名位于同申请年队列前10%以后但被引次数大于0的专利数量)。用作一般质量创新的稳健性度量,越大代表企业获得一般引用的专利越多
  • LnUncited [未被引专利数] — 参考李仲泽(2020,山西财经大学学报)的方法,计算公式为:ln(1+当年申请专利中被引次数为0的专利数量)。用作未被认可创新的稳健性度量,越大代表企业未被引用的专利越多

常见问题

「企业创新质量(专利被引法)」是什么数据集?
企业创新质量(专利被引法),隶属创新与知识产权。参考李仲泽(2020,山西财经大学学报)借鉴Balsmeier等(2017,JFE)的方法,以上市公司本身及控股子公司当年申请专利中获得前向引用(剔除自引)的专
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:当年申请专利总数、创新质量(被引专利数)、前1%高被引专利数、前2-10%高被引专利数、一般被引专利数、未被引专利数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,731 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业创新质量衡量的是企业创新产出的实质性价值,而非单纯的创新数量。熊彼特的创新理论指出,只有当技术发明被真正应用于经济活动、并被后续技术所借鉴时,其才具备实质性的经济价值。前向专利引用(一项专利被后续专利引用的次数)正是刻画这种实质性价值的经典代理:一项专利被引用得越多,说明其技术贡献被后来者认可与利用得越充分,所承载的创新质量也就越高。本数据集参照李仲泽(2020)借鉴 Balsmeier、Fleming 与 Manso(2017)的做法,以企业当年申请专利中"获得引用的专利数量"衡量企业创新的总体质量,并进一步按被引率高低将专利分层,刻画不同质量层次的创新产出。 计算的第一步是确定每一项专利的前向被引次数。对企业当年申请的每一项专利,统计其被其他主体的后续专利所引用的次数,并剔除企业对自身专利的引用(自引),以避免企业通过自我引用人为抬高创新质量。记第 $i$ 项专利的(剔除自引后)前向被引次数为 $Ci$。 第二步是在同一申请年队列内对专利按质量分层。将同一申请年份的全部样本专利放在一起,按被引次数 $Ci$ 由高到低排名(同一申请年队列内按被引次数排名与按被引率排名完全等价),得到每项专利的百分位位次 $pi$。以申请年为参照队列的设计,控制了前向引用随时间累积所导致的截断偏差——越晚申请的专利可供累积引用的时间越短,只有在同一申请年内相互比较才具可比性。据此将专利划入四个互斥区间:被引次数为零者归为"未被引";被引次数大于零且百分位位次进入前 1% 者归为"前 1% 高被引";位次进入前 2% 至前 10% 者归为"前 2-10% 高被引";位次在前 10% 之后但被引次数仍大于零者归为"一般被引"。 第三步是聚合到企业—年层面并作对数变换。对企业当年申请的专利,分别统计落入各区间的专利数量。核心指标为企业创新总体质量,等于当年申请专利中获得至少一次引用的专利数量(即前 1%、前 2-10% 与一般被引三个区间的专利数量之和)加一后取自然对数: $$LnCitations = \ln\left(1 + N{cited}\right),\quad N{cited} = N{top1} + N{top2\text{-}10} + N{cited\bin}$$ 其中 $N{top1}$、$N{top2\text{-}10}$、$N{cited\bin}$ 分别为落入前 1%、前 2-10%、一般被引区间的专利数量。四个分层指标同样以各区间专利数量加一后取自然对数构造:前 1% 高被引专利数 $\ln(1 + N{top1})$、前 2-10% 高被引专利数 $\ln(1 + N{top2\text{-}10})$、一般被引专利数 $\ln(1 + N{cited\bin})$、未被引专利数 $\ln(1 + N{uncited})$。之所以采用"加一取对数"的形式,是因为大量企业—年的被引专利数量为零,直接取对数无定义。此外提供企业当年申请专利总数作为分层计算的构件,便于研究者观察创新数量与质量的关系。被引专利越多、尤其是高被引专利越多,代表企业创新的实质性质量越高。 补充说明 专利归属采用合并口径,即将上市公司本身及其控股子公司申请的专利均计入企业名下;联营企业、合营企业因采用权益法核算、未纳入合并报表,不计入。少数由多家上市公司联合申请的专利,分别计入每一家参与的上市公司,各计一次。专利类型涵盖发明专利与实用新型。企业—年面板覆盖全部 A 股(含北交所)上市公司,当年无专利申请或无被引专利者,各指标取零值。 需特别提示两点使用限制。其一,前向引用需要时间累积,最近若干个申请年份(约 2021 年起,尤其 2023 年之后)的被引数据严重不完整,核心指标会随之机械性回落,这并非创新质量的真实下滑;四个分层指标经同申请年队列内排名,对"相对位次"较为稳健,但总体质量指标对绝对被引数量仍然敏感。使用时建议将回归样本截止于约 2020 申请年,或对申请年份加以控制。其二,本指标的绝对水平高于早期文献的报告值:这是因为引用数据的观测窗口更长,使更多历史专利已获得引用;由于采用了同申请年队列内的相对排名,跨年可比性得以保持,故指标的分层结构与横截面差异依然可靠,仅在绝对水平上不宜与早期文献直接比较。 参考文献 - 李仲泽. 机构持股能否提升企业创新质量[J]. 山西财经大学学报, 2020, 42(11): 85-98. - Balsmeier B, Fleming L, Manso G. Independent boards and innovation[J]. Journal of Financial Economics, 2017, 123(3): 536-557.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。