企业尾部创新指数

「企业尾部创新指数」,覆盖 1985-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 59,955。 企业当年申请并最终获得授权的发明专利中,创新质量跻身同申请年份同技术领域最高一档的专利所占比例。

时间跨度1985-2025 年
数据频率年度
层级上市公司
变量数19
样本量59,955
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年份
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • GrantedInventionCount [当年授权发明专利数] — 企业当年申请且最终获得授权的发明专利件数,为尾部创新指数的分母。由多家上市公司联合申请的专利分别完整计入每一家参与企业,故该列为企业口径计数,跨企业加总会重复计数
  • TailPatentCount10 [右尾10%专利数] — 企业当年授权发明专利中,创新质量位于同申请年份同技术领域右尾10%的件数,为尾部创新指数的分子
  • TailPatentCount20 [右尾20%专利数] — 企业当年授权发明专利中,创新质量位于同申请年份同技术领域右尾20%的件数,为稳健口径的分子
  • TailPatentCount50 [右尾50%专利数] — 企业当年授权发明专利中,创新质量位于同申请年份同技术领域右尾50%的件数,为稳健口径的分母
  • AvgCitation3Y [平均3年期被引件数] — 计算公式为:企业当年授权发明专利各自被引件数的算术平均,其中单件专利的被引件数为申请当年起连续3个自然年内引用过该专利的不同专利件数。该变量即划分右尾所依据的专利创新质量
  • TailInnovation10 [尾部创新指数(P10)] — 参考王群勇、张慧敏 (2026, 世界经济)的方法,计算公式为:企业当年落入右尾10%的授权发明专利件数除以当年授权发明专利总数。取值介于0与1之间。用作研究变量,越大代表企业的创新产出越集中于质量分布顶端、突破性创新能力越强
  • TailInnovation2050 [尾部创新指数(P20/P50)] — 参考王群勇、张慧敏 (2026, 世界经济)的稳健性口径,计算公式为:企业当年落入右尾20%的授权发明专利件数除以落入右尾50%的件数;企业当年无专利进入右尾50%时分子必然同时为零,该值取0。取值介于0与1之间。用作研究变量,越大代表企业已进入质量上半区的专利越集中于更高一档
  • IsMatureWindow [3年被引窗口是否完整(0=否,1=是)] — 标识该企业年的3年被引窗口与专利授权是否均已补齐(0=否,1=是)。专利从申请到公开、从申请到授权均存在法定滞后,最近若干申请年的被引件数与授权件数尚未补齐,取值为0的观测其指数会系统性偏低

常见问题

「企业尾部创新指数」是什么数据集?
企业尾部创新指数,隶属创新与知识产权。企业当年申请并最终获得授权的发明专利中,创新质量跻身同申请年份同技术领域最高一档的专利所占比例。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:当年授权发明专利数、右尾10%专利数、右尾20%专利数、右尾50%专利数、平均3年期被引件数、尾部创新指数(P10)、尾部创新指数(P20/P50)、3年被引窗口是否完整(0=否,1=是)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 59,955 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的创新产出在质量上高度不均衡:绝大多数专利只获得零星引用,少数专利则构成技术轨道上的关键跳跃。仅以专利数量或平均被引次数刻画创新,会把这种极端不对称抹平。尾部创新指数正是为捕捉质量分布右端而设计的指标,它衡量企业的创新成果中有多大比例跻身同期同技术领域质量最高的一档,反映的是突破性而非累积性的创新能力。 指标建立在专利层面的创新质量之上。单件专利的创新质量以其申请后三年内被引用的情况衡量,采用三年窗口是因为专利申请后的最初几年通常是被引用的高峰期。这里计的是"引用过该专利的不同专利件数"而非引用记录条数:一件中国发明专利在专利库中同时存在公开与授权两条文献记录,被引一侧与施引一侧都必须先把同一件专利的两条记录合并,否则被引数会随专利的授权状态而系统性虚高。被引情况在不同申请年份与不同技术领域之间存在系统性差异——申请较早的专利有更长的引用累积时间,不同技术领域的引用惯例也不相同——因此不能直接横向比较。本数据集按"申请年份 $\times$ 国际专利分类部"划分比较单元,在单元内部完成全部排序与分位计算,以消除上述系统性差异。技术领域取国际专利分类号的部一级(A 至 H 共八个),该粒度与相关文献用于固定效应校正的技术大类基本对应,同时保证每个单元内有足够的专利数以稳定分位阈值。主分类号缺失时取全部分类号中的第一段,仍无法判定者单独归为一组参与排序。 参照系为全体中国授权发明专利。之所以限定为授权发明专利,是因为相对于实用新型与外观设计,发明专利须通过实质审查,在创造性标准、审查程序与保护期限上要求更高,更能体现技术含量。在每个"申请年份 $\times$ 技术领域"单元内,将专利按创新质量由低到高排序,位于右尾 $q\%$ 的专利即被认定为该单元的尾部专利;被引次数为零的专利不计入任何右尾,以免在被引普遍稀疏的单元中因并列而被误判入尾部。 在此基础上,设 $n{it}$ 为企业 $i$ 在第 $t$ 年申请并最终获得授权的发明专利总数,$n{it}^{(q)}$ 为其中落入右尾 $q\%$ 的件数,则企业的尾部创新指数定义为 $$Tail{it}(q)=\frac{n{it}^{(q)}}{n{it}}$$ 基准口径取 $q=10$,即企业当年专利中跻身同期同领域前百分之十的比例。该指标取值介于 0 与 1 之间,数值越大表示企业的创新产出越集中于质量分布的顶端。 稳健口径改以右尾百分之二十的专利数占右尾百分之五十的专利数之比衡量: $$Tail{it}(20/50)=\frac{n{it}^{(20)}}{n{it}^{(50)}}$$ 它刻画的是"在企业已进入质量上半区的专利中,有多大比例进一步跻身前五分之一",对参照系整体水平的敏感度低于基准口径。企业当年没有任何专利进入右尾百分之五十时,该比值的分子必然同时为零,此时指标取 0。 企业与专利的归属关系以上市公司本身及其控股子公司的专利申请为准,观测年份为专利的申请年份。由多家上市公司联合申请的专利,分别计入每一家参与企业。数据集同时给出计算链上的各构件:当年授权发明专利总数、落入各右尾区间的专利件数,以及企业当年专利的平均三年期被引次数,便于使用者复核口径或构造替代度量。 补充说明 - 样本口径与覆盖:本指标为比例,企业当年没有授权发明专利时分母为零、指标无定义,此类企业年不进入数据集。数据集因而只覆盖全部上市公司年度观测的一部分,且覆盖率随企业规模与年份上升。又因专利按申请年归集而企业可能在若干年后才上市,数据中含有相当比例的上市前观测,它们在与财务或行情数据合并时会自然落空。数据集不预先剔除金融业,也不施加行业或板块限制,使用者可按行业代码、上市日期自行筛选。 - 测量噪声随专利数变化:作为比例型测度,企业当年专利数很少时指标取值高度离散(只有一件专利时取值非零即一),信度明显低于专利数较多的企业。数据集一并给出当年授权发明专利数,建议据此设定样本门槛,或在以本指标作解释变量时考虑测量误差导致的衰减。 - 不作跨年水平比较:指标是单元内的相对位次,但上市公司在全国专利右尾中的相对份额随全国专利总量扩张而变化,叠加近年数据截断,使年度均值呈单调下移。该下移在剔除小样本企业与按专利数加权后依然存在,因此回归须包含年份固定效应,不宜对指标水平作跨年解读。 - 稳健口径的适用年段:被引次数是离散的小整数,同一被引次数的专利构成并列块并整体同进同出,故右尾的实际占比只落在若干离散点上、一般不等于名义比例。右尾五成的阈值经常恰好落在"被引至少一次"的边界上,使稳健口径的分母在实践中更接近"当年有被引专利的件数"。在被引极稀疏的早期申请年,三个右尾集合会相互重合,稳健口径退化为"当年是否有被引专利"的二值量。因此稳健口径的推荐起用年段明显晚于基准口径。 - 参照系范围:原始文献的参照系覆盖范围大于本数据集所能构造的中国专利池,因此本指标的绝对水平整体高于原文报告值,其水平值不宜与原文数值直接比对;相对位次不受参照系整体平移影响。被引只统计中国专利对中国专利的引用,国际影响力突出的专利会被一定程度低估;被引不剔除申请人自引,与原始文献对该指标的口径一致。 - 窗口与成熟度:三年窗口按自然年实现,即施引专利的申请年落在被引专利申请当年起的连续三个自然年之内,与按日计算的三年窗口略有出入,该规则对参照池内所有专利一致。专利从申请到公开、从申请到授权均存在法定滞后,最近若干申请年的被引情况与授权件数都尚未补齐;数据集以专门的标识列标记这两者是否均已补齐,其判定按各自相对峰值的覆盖度动态推导而非取末年极值,未补齐的企业年一并给出,供使用者自行取舍。 - 其他局限:由多家上市公司联合申请的专利分别完整计入每一家参与企业,故当年授权发明专利数是企业口径计数,跨企业加总会重复计数;早期年份上市公司的授权发明专利数量很少,相应年份的指标波动较大。 参考文献 - 王群勇,张慧敏.产学研合作网络与企业突破性创新[J].世界经济,2026,49(6):163-195. - Kelly B, Papanikolaou D, Seru A, et al. Measuring technological innovation over the long run[J]. American Economic Review: Insights, 2021, 3(3): 303-320. - Acemoglu D, Akcigit U, Celik M A. Radical and incremental innovation: the roles of firms, managers, and innovators[J]. American Economic Journal: Macroeconomics, 2022, 14(3): 199-249. - Hall B H, Jaffe A B, Trajtenberg M. The NBER patent citation data file: lessons, insights and methodological tools[R]. NBER Working Paper, No.8498, 2001.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。