企业超级发明家比例
「企业超级发明家比例」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 83,703。 企业当年发明人队伍中超级发明家所占的比重,用于刻画企业突破性创新的高端人才基础。
| 时间跨度 | 2006-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 20 |
| 样本量 | 83,703 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- GrantedInventionCount [授权发明专利数] — 企业当年申请并最终获得授权的发明专利件数,同一专利由多家上市公司联合申请时各家均计入。当年无授权发明专利时取0
- InventorCount [发明人数] — 计算公式为:企业当年授权发明专利所涉及的发明人去重人数,用作超级发明家比例的分母。同一企业内的同名发明人视为同一人,跨企业同名视为不同人
- AvgPatentQuality [专利平均创新质量] — 参考Hall et al. (2001, NBER)的固定效应校正法,计算公式为:先将单件专利申请后三年内的被引次数除以同一申请年份同一技术领域全部专利被引次数的均值,再对企业当年授权发明专利取算术平均。技术领域取国际专利分类号主分类的小类。取值为1表示企业专利的影响力与同年同领域平均水平相当,当年无授权发明专利时取0
- SuperInventorCount [超级发明家人数] — 计算公式为:企业当年发明人中平均创新质量位于全样本前20%者的去重人数,用作超级发明家比例的分子
- SuperInventorRatio [超级发明家比例] — 参考王群勇和张慧敏(2026, 世界经济)的方法,计算公式为:企业当年超级发明家人数除以发明人总人数,其中超级发明家指名下授权发明专利的平均创新质量位于全样本前20%的发明人。取值介于0与1之间。用作研究变量,越大代表企业创新人才队伍中高质量研发者的密度越高、突破性创新的人才基础越强
- SuperInventorCountTop10 [超级发明家人数(前10%口径)] — 计算公式为:按更严阈值识别,企业当年发明人中平均创新质量位于全样本前10%者的去重人数
- SuperInventorRatioTop10 [超级发明家比例(前10%口径)] — 参考王群勇和张慧敏(2026, 世界经济)的稳健性口径,计算公式为:企业当年平均创新质量位于全样本前10%的发明人人数除以发明人总人数。用于检验结论是否依赖识别阈值的具体位置
- SuperInventorRatioExSelf [超级发明家比例(去自引口径)] — 参考王群勇和张慧敏(2026, 世界经济)剔除申请人自引的稳健性处理,计算公式为:先剔除三年期被引中的申请人自引,再重新计算被引次数、分组均值、发明人平均创新质量与识别阈值,最后按前20%口径计算超级发明家人数与发明人总人数之比。用于排除企业自我引用行为对创新质量度量的干扰
- IsSuperInventor [是否拥有超级发明家] — 企业当年是否至少拥有一位超级发明家(0=否,1=是)。当年有授权发明专利但发明人信息整体缺失时为空值
常见问题
- 「企业超级发明家比例」是什么数据集?
- 企业超级发明家比例,隶属创新与知识产权。企业当年发明人队伍中超级发明家所占的比重,用于刻画企业突破性创新的高端人才基础。
- 该数据集的时间范围是?
- 覆盖 2006-2025 年。
- 包含哪些变量/指标?
- 共 20 个变量。核心指标包括:授权发明专利数、发明人数、专利平均创新质量、超级发明家人数、超级发明家比例、超级发明家人数(前10%口径)、超级发明家比例(前10%口径)、超级发明家比例(去自引口径)、是否拥有超级发明家。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 83,703 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的突破性创新能力在很大程度上取决于其掌握的高端创新人才。与专利数量这类产出规模指标不同,"超级发明家"刻画的是企业创新人才队伍的质量结构:在同样规模的研发团队中,究竟有多大比例的成员能够持续产出高影响力的技术成果。本数据集沿着"专利质量 → 发明人质量 → 企业人才结构"的三级归集路径,度量企业当年发明人队伍中超级发明家所占的比重。 测度的起点是单件专利的创新质量。一项技术成果的影响力体现为它在多大程度上被后续研发所借鉴,因此以专利申请后三年内收到的被引次数作为质量的原始度量;之所以取三年,是因为专利申请后的最初三年通常是引用发生的高峰期,该窗口既能捕捉主要的知识外溢,又能保证不同申请年份之间的可比性。落入窗口的判定标准是引用方的申请年份与被引专利申请年份之差介于零与二之间。 原始被引次数不能直接用于跨年份、跨技术领域的比较:越早申请的专利积累引用的机会越多,不同技术领域的引用密度也存在数量级上的差异。为此采用 Hall、Jaffe 与 Trajtenberg 提出的固定效应校正法,将每件专利的被引次数除以同一申请年份、同一技术领域内全部专利被引次数的均值: $$Qp = \frac{Cp}{\overline{C}{\,y(p),\,c(p)}}$$ 其中 $Cp$ 为专利 $p$ 在申请后三年内的被引次数,$y(p)$ 与 $c(p)$ 分别为该专利的申请年份与技术领域,技术领域取国际专利分类号主分类的小类。校正后每个"年份—技术领域"单元的均值归一为一,因此 $Qp$ 的经济含义是"该专利的影响力相当于同年同领域平均水平的多少倍",取值大于一即表示高于同侪水平。若某单元内全部专利均未获得引用,该单元内专利的质量记为零。 第二级归集把专利质量归属到人。发明人 $k$ 的平均创新质量定义为其名下全部授权发明专利校正后质量的算术平均: $$\overline{Q}k = \frac{1}{|Pk|}\sum{p \in Pk} Qp$$ 其中 $Pk$ 为发明人 $k$ 参与的授权发明专利集合。之所以取均值而非加总,是为了把"持续产出高质量成果的能力"与"产出数量多"这两种不同的禀赋区分开:一位只有少数专利但件件被广泛引用的发明人,其平均质量会高于大量产出平庸专利的发明人。 在此基础上识别超级发明家。将全部发明人按平均创新质量由高到低排序,位于前百分之二十者界定为超级发明家: $$\text{IsSuper}k = \mathbf{1}\left[\overline{Q}k \geq Q^{(0.80)}\right]$$ 其中 $Q^{(0.80)}$ 为全体发明人平均创新质量的八十分位数。该阈值在整个样本期上一次性确定,因此超级发明家的身份是一种跨期稳定的人才标签,而非逐年变动的状态。 最后归集到企业层面。企业当年的超级发明家比例定义为其发明人队伍中超级发明家的人数占全部发明人人数的比重: $$\text{SuperInventorRatio}{it} = \frac{\text{SuperInventorCount}{it}}{\text{InventorCount}{it}}$$ 分子与分母均按人去重后计数,统计范围是企业当年申请并最终获得授权的发明专利所涉及的全部发明人。该比例取值介于零与一之间,数值越大表示企业创新人才队伍中高质量研发者的密度越高。与之配套,数据集同时给出构成比例的分子分母、企业当年专利的平均创新质量,以及企业是否至少拥有一位超级发明家的二元标识,便于使用者按自身研究设计重组指标。 稳健性方面提供两个替代口径。其一是收紧识别阈值,改取平均创新质量前百分之十的发明人作为超级发明家,用以检验结论是否依赖于阈值的具体位置。其二是剔除申请人自引后重算整条计算链:企业出于维护自身专利组合的动机存在自我引用行为,这类引用并不反映真实的外部技术影响力,因此在剔除自引后重新计算被引次数、单元均值、发明人平均质量与识别阈值,得到不受自引干扰的比例。 补充说明 - 样本口径:覆盖全部行业与全部板块的上市公司年度面板,不预先剔除金融业,也不施加最小专利数或最小发明人数门槛。使用者可借助专利件数与发明人数两列自行设定样本门槛,或还原为"仅有专利企业年"的子样本;做跨行业比较时建议加入行业与年份固定效应。 - 识别口径的事后性质:超级发明家的身份依据发明人在整个样本期内的全部专利一次性确定,这忠实于原始方法把超级发明家视为人才禀赋标签的设定,但也意味着早期年份的取值用到了其后年份的专利信息。以该指标作为被解释变量做严格因果识别时,需要在设计上考虑这一特征。 - 与原文报告水平的差异:本数据集按原文的文字定义实现,识别出的超级发明家密度高于原文附表所报告的水平。需要说明的是,"取平均创新质量前百分之二十的发明人"这一判据在数学上即决定了约五分之一的发明人会被标记,因此只要排序范围是上市公司发明人池本身,企业层面的均值就不会落到原文报告的量级;原文该变量的报告统计量又呈现近似二值的分布形态,与"企业内发明人占比"的连续定义并不完全相容,提示其排序范围或分母口径另有设定,而原文未给出足以判定的信息。经模拟检验,引用数据覆盖面的差异不足以解释这一差距。因此跨研究直接对照绝对水平并不适宜;企业间的相对排序、组内比较与回归结论不受影响。 - 小样本的阈值敏感性与最小规模建议:指标为比值形式,当年发明人很少时取值由个别发明人完全决定,只有一位发明人的企业年取值只能是零或一;同理,只有一件专利的发明人其平均创新质量由单一观测决定、波动更大,略容易跨过识别阈值,但超级发明家中单件专利者的占比与其在全体发明人中的占比几乎持平,低产者并未被系统性高估。以"超级发明家随机分配"为零假设检验,发明人仅一两位的企业年其波动与纯抽样噪声不可区分,而随发明人规模上升,实测波动迅速超出随机分配所能解释的幅度,企业间真实差异占据主导。因此做企业层面推断时建议对发明人数设下限(例如不少于五人)。原始方法未设置最小规模门槛,本数据集如实输出全部观测。 - 发明人识别:源数据的发明人以拼音形式记录,丢失汉字信息,全局按姓名合并会把大量同音异名者误并为一人,故以"姓名加所属企业"作为唯一标识。代价有二:跨企业流动的发明人被拆为多个身份、平均质量分段计算;发明人队伍极庞大的企业内部,常见拼音姓名仍可能把不同自然人并入同一身份,使该身份质量向均值收缩、小幅压低超大型企业的取值。经零模型检验,这一收缩并未抹平企业间的真实差异。 - 近年样本的双重截断:专利池限于已获授权的发明专利,最近若干申请年同时受两种截断。一是引用观察窗口右端尚未补齐,分组归一已吸收该年份效应,但末年单元内专利较少、阈值附近噪声偏高。二是审查授权存在法定滞后,近年已完成授权的比例显著低于成熟年份,留在池内的是审查周期较短的那部分专利,其技术构成与发明人结构与该申请年全体不同;这属于样本选择,分组归一无法吸收,实测方向是使近年取值偏高而非偏低。做趋势分析或以近年作为处理期的研究,建议样本适当向前截断;数据集如实输出至可得的最新年份并在此披露。 - 其他局限:原始方法未指明技术领域应取分类号的哪一层级,本数据集取小类这一粒度,其类别数量级与该方法体系在国际文献中通常使用的技术分类相当,主分类位数不足以归入小类的专利单列为一类参与分组、不从样本中剔除;年份下限设在授权发明专利规模与分类信息均趋于稳定之后,更早年份的主分类大面积缺失、口径不可比;专利按申请年归属企业年,由多家上市公司联合申请的专利会同时计入各参与企业;企业专利归属采用包含上市公司本体及其子公司、合营与联营企业的口径,因大量研发成果登记在子公司名下,仅取本体会把集团型公司误记为零专利;当年有专利但发明人信息整体缺失的企业年,三个比例列与二元标识记为缺失值,以免把不可计算误示为"确实没有超级发明家"。 参考文献 - 王群勇,张慧敏.产学研合作网络与企业突破性创新[J].世界经济,2026,49(6):163-195. - Acemoglu D, Akcigit U, Celik M A. Radical and incremental innovation: The roles of firms, managers, and innovators[J]. American Economic Journal: Macroeconomics, 2022, 14(3): 199-249. - Hall B H, Jaffe A B, Trajtenberg M. The NBER patent citation data file: Lessons, insights and methodological tools[R]. NBER Working Paper No. 8498, 2001. - 郑世林,姚守宇,周黎安.超级发明家与中国企业创新[J].经济研究,2024,59(3):97-115.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。