企业创新效率(人均专利产出)
「企业创新效率(人均专利产出)」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 62,475。 参考汤迪浩等(2026,财会通讯)的方法,以企业当年独立申请专利件数除以员工人数(百人)衡量企业人均创新产出效率。
| 时间跨度 | 2006-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 62,475 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- EmployeeHundred [员工人数(百人)] — 企业年报披露的在职员工总数换算为百人单位后的数值,用作人均创新产出指标的分母,计算公式为:在职员工总数÷100
- IndepPatentApp [独立申请专利数] — 参考汤迪浩等(2026,财会通讯)的方法,统计企业当年独立完成的专利申请件数,计算公式为:当年专利申请中申请人数量等于1的件数合计;专利归属范围为上市公司本身及其子公司,不含联营企业与合营企业
- TotalPatentApp [专利申请总数] — 企业当年专利申请件数合计,计算公式为:当年全部专利申请件数之和,不限申请人数量;专利归属范围为上市公司本身及其子公司,不含联营企业与合营企业
- IndepPatentAppWide [独立申请专利数(含联营合营)] — 企业当年独立完成的专利申请件数,计算公式为:当年专利申请中申请人数量等于1的件数合计;专利归属范围扩大至包含联营企业与合营企业,供使用者按需改换归属口径
- TotalPatentAppWide [专利申请总数(含联营合营)] — 企业当年专利申请件数合计,计算公式为:当年全部专利申请件数之和,不限申请人数量;专利归属范围扩大至包含联营企业与合营企业,供使用者按需改换归属口径
- InnovEff [企业创新效率] — 参考汤迪浩等(2026,财会通讯)的方法衡量企业人均创新产出效率,计算公式为:当年独立申请专利件数÷员工人数(百人)。用作研究变量,越大代表企业单位人力投入所产出的自主创新成果越多
- InnovEff2 [企业创新效率(总体申请口径)] — 参考汤迪浩等(2026,财会通讯)稳健性检验的替代度量,计算公式为:当年专利申请总数÷员工人数(百人),与主口径的差别在于分子不再要求申请人数量等于1。用作研究变量,越大代表企业人均专利申请产出越多
- InnovEff3 [企业创新效率(独立授权计数口径)] — 参考汤迪浩等(2026,财会通讯)稳健性检验的替代度量,计算公式为:当年获得授权且申请人数量等于1的专利件数合计;该变量为计数形式,原文以泊松模型估计。用作研究变量,越大代表企业当年自主获得授权的创新成果越多
常见问题
- 「企业创新效率(人均专利产出)」是什么数据集?
- 企业创新效率(人均专利产出),隶属创新与知识产权。参考汤迪浩等(2026,财会通讯)的方法,以企业当年独立申请专利件数除以员工人数(百人)衡量企业人均创新产出效率。
- 该数据集的时间范围是?
- 覆盖 2006-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:员工人数(百人)、独立申请专利数、专利申请总数、独立申请专利数(含联营合营)、专利申请总数(含联营合营)、企业创新效率、企业创新效率(总体申请口径)、企业创新效率(独立授权计数口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 62,475 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业创新效率刻画的是企业把人力资源投入转化为创新产出的能力。与以研发经费或研发人员数量作分母的投入产出比不同,本指标以企业全部在职员工作分母,衡量单位人力规模上能够产出多少项自主创新成果,因而既反映研发活动本身的产出效率,也反映企业整体组织对创新的支撑程度。这一测度的优点在于分母是所有企业都稳定披露的基础规模变量,不受研发费用资本化政策与研发口径调整的干扰,横向可比性较强。 指标建立在两个基础量之上。第一个是专利申请件数。企业当年的专利申请按申请人数量分为两类:申请人仅有一家的属于独立申请,意味着创新成果完全由企业自身完成;申请人为两家及以上的属于联合申请,创新成果由多方共享。独立申请剔除了合作创新中归属于外部主体的部分,更能体现企业自身的创新能力,因而被用作核心指标的分子。第二个是员工人数,取自企业年度报告披露的在职员工总数,并折算为百人单位,即 $EmployeeHundred = 在职员工总数 \div 100$。 核心指标的计算公式为 $$InnovEff{i,t}=\frac{IndepPatentApp{i,t}}{EmployeeHundred{i,t}}$$ 其中 $IndepPatentApp{i,t}$ 是企业 $i$ 在第 $t$ 年独立申请的专利件数,$EmployeeHundred{i,t}$ 是同期折算为百人的员工人数。取值越大,说明企业单位人力投入所产出的自主创新成果越多。当年没有专利申请记录的企业年取值为零,这是真实的创新产出状态,不作缺失处理。 在核心指标之外,另给出两个替代度量,用于检验结论是否依赖于分子的具体设定。第一个替代度量放宽对申请人数量的限制,把联合申请一并计入分子,即 $InnovEff2 = TotalPatentApp / EmployeeHundred$,其中 $TotalPatentApp$ 为当年专利申请件数合计。由于联合申请是独立申请之外的增量,该指标在数值上恒不小于核心指标,二者之差即人均联合申请产出。第二个替代度量把观察环节由申请移到授权,直接以当年获得授权且申请人仅一家的专利件数 $InnovEff3$ 衡量创新产出。授权环节经过了实质审查,能够过滤掉申请阶段质量较低的部分;该变量是非负整数形式的计数变量,适合以泊松模型或负二项模型估计,而不宜直接作为连续变量处理。 专利的企业归属采用合并报表口径,即计入上市公司本身及其子公司提出的申请,不计入联营企业与合营企业。之所以这样设定,是因为分母的员工人数本身是合并报表范围内的口径,联营与合营企业并不并表、其员工不进入分母;若把这些主体的专利计入分子,会使分子与分母的主体范围不一致,从而系统性高估创新效率。为便于使用者按其他口径重新计算,本数据集同时给出把联营与合营企业一并计入之后的独立申请件数与申请件数合计,使用者可用这两个件数除以同一分母得到扩大口径下的比率。 在企业归属的技术处理上还有一点需要说明。同一件专利可能同时匹配到多家上市公司——例如同一集团下的两家兄弟上市公司共同持有某项技术,此时该专利的归属记录会同时携带多个证券代码,并且每个代码各自对应一个关系标识(第一个代码对应第一个关系,依此类推)。计算时先把这类记录按代码与关系逐位拆开,使每一家上市公司都获得属于自己的那条归属关系,再判断该关系是否落在合并报表范围内;同一件专利在同一家公司下只计一次,但在不同公司下各计一次。这一处理与本平台其他专利类指标的归属口径保持一致;若不作拆分,这些专利在按证券代码汇总时会被整体遗漏,从而系统性低估件数。 在时间归属上,两个申请口径的指标按专利的申请年度归集,授权口径的指标按专利的授权年度归集。申请年度反映创新活动的发生时点,授权年度反映创新成果通过实质审查的时点,二者对同一项专利通常落在不同年份,因此申请口径与授权口径的指标不宜相互替换解释。 补充说明 - 样本口径:本数据集覆盖全部行业与上市板块,不预先剔除金融业、特别处理公司或特定板块,也不作缩尾处理。原文在回归中限定为制造业样本并对连续变量作上下百分之一的缩尾,使用者可依据行业代码与自身研究设定自行施加相应限制。 - 专利公开滞后:专利自申请到公开存在法定滞后期,最近一至两个申请年度的件数仍会持续增补,这些年度的指标值因而系统性偏低。使用者在作跨年度比较或以最新年度为样本终点时,建议加入年份固定效应。 - 集团归属的时间维度:上市公司与其下属主体的对应关系按当前的集团结构确定,并回溯适用于全部历史年份。发生过借壳上市或重大资产重组的公司,在事件发生之前的各个年度都会计入日后才纳入集团的主体所申请的专利,使这些年度的比率偏高。受影响的并不只是员工规模很小的壳公司年份,事件前员工规模正常的年份同样会被计入;且上下百分之一的缩尾只能削去最极端的少数取值,并不能消除这一影响。使用者若关注该问题,建议结合控制权变更或公司名称变更的年份,自行剔除事件发生之前的年度。 - 多主体匹配:一件专利同时匹配到多家上市公司时,按各家分别计入,与本平台其他专利类指标的口径一致。该匹配由名称词典完成,存在把同名或近名企业错配到无关上市公司的可能,表现为个别公司某些年度的件数异常跳升。 - 面板覆盖率随年份变化:员工人数依赖企业自愿披露,其覆盖率在样本期内由约六成升至近九成,且未披露方在企业规模、上市年限与行业构成上系统性不同于披露方。因此指标的年度均值与中位数趋势中含有样本组成变化的成分,不宜全部解读为创新效率的真实提升;作跨期比较时建议用各年均在样的平衡子样本复核。 - 零值与板块差异:专利名称词典对北交所企业的覆盖较弱,该板块零独立申请的企业年占比明显高于其他板块;B股独立代码与北交所代码不在公司概况表内,其证券简称与地区列为空,作城市层面聚类或固定效应时会损失这部分观测。这些零值不宜解读为企业真实没有专利。 - 分布形态与估计方法:该指标右偏严重且存在相当比例的零值,不建议直接以未变换的原始值作最小二乘估计。可考虑取对数形式,或按原文对授权计数口径的做法采用泊松、负二项等计数模型。 - 与原文报告值的差异:原文的回归样本受到"前五大供应商或客户中须存在可识别的上市公司"这一条件的强约束,规模远小于本数据集的全样本,其报告的离散程度相应更低。本数据集按原文的字面公式计算,未对该变量作对数化或其他压缩变换,使用者若需对齐原文的样本构成,可自行施加相应筛选。 - 专利类型范围:件数统计覆盖发明专利与实用新型,不含外观设计。外观设计的技术含量与前两类差异较大,其不纳入对以技术创新为研究对象的场景影响有限。 - 其他局限:员工人数以企业披露为准,未披露的企业年不进入样本,样本覆盖因而偏向规模较大、披露较规范的公司,使用时建议加入行业与年份固定效应;个别企业披露的员工人数极小,会使比率取值明显偏大,已按原始值保留,未作阈值截断。 参考文献 - 汤迪浩,黄欣,朱凯.策略性创新溢出与企业创新效率:来自供应链层面的经验证据[J].财会通讯,2026,(17):56-60.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。