企业流程创新
「企业流程创新」,覆盖 1985-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 69,521。 度量企业创新活动中指向改进自身生产方法而非开发新产品的份额。
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 69,521 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- ProcessPatentCount [流程创新专利数] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:企业在该年度提出申请且最终获得授权的发明专利中,第一个保护主题属于方法类的专利件数。中国专利法将发明区分为产品发明与方法发明两类,发明名称须清楚表明所要求保护技术方案的主题,故以发明名称中首个主题名称判定该专利第一项权利要求的类别。授权公告文献收录不足的早期年份不输出该值。
- NonProcessPatentCount [非流程创新专利数] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:企业在该年度提出申请且最终获得授权的发明专利中,第一个保护主题属于产品类(装置、系统、设备、材料、组合物等)的专利件数。授权公告文献收录不足的早期年份不输出该值。
- InventionPatentCount [发明专利总数] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:企业在该年度提出申请且最终获得授权的发明专利总件数,等于流程创新专利数与非流程创新专利数之和。授权公告文献收录不足的早期年份不输出该值。
- ProcessInnovationShare [流程创新占比] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:流程创新专利数除以发明专利总数,仅对当年至少拥有一件授权发明专利的企业年度定义。用作研究变量,越大代表企业的创新投入越偏向改进自身生产方法以降低生产成本,而非开发新产品。
- ProcessShareCiteWeighted [被引加权流程创新占比] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:以每件专利自授权年份起三年窗口内获得的引用次数为权重,流程创新专利的加权件数除以全部发明专利的加权件数。当企业当年全部授权发明专利在该窗口内均未获得引用时,该值无定义。
- AdjustedProcessInnovation [技术类别调整流程创新数] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:第一步,对每个技术类别与申请年度,计算该类别当年至少拥有一件专利的全部企业的流程创新专利数均值;第二步,用该均值缩放本企业在该类别当年的流程创新专利数;第三步,将缩放结果跨全部技术类别求和。每件专利按其列示的全部技术类别等比例分配。该口径用于消除不同技术领域专利产出强度差异对流程创新水平的影响。
- ProcessInnovationShareAlt [流程创新占比(申请口径)] — 参考Bena和Simintzi (2025, Review of Finance)的方法,计算公式为:不限定是否已获授权,企业当年提出申请的全部发明专利中第一个保护主题为方法类的件数占比。作为核心口径的样本稳健性检验,其年份覆盖不受授权公告文献收录起始年的限制。
常见问题
- 「企业流程创新」是什么数据集?
- 企业流程创新,隶属创新与知识产权。度量企业创新活动中指向改进自身生产方法而非开发新产品的份额。
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:流程创新专利数、非流程创新专利数、发明专利总数、流程创新占比、被引加权流程创新占比、技术类别调整流程创新数、流程创新占比(申请口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,521 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的创新投入可以指向两个方向:一是开发此前并不存在的新产品,二是改进自身生产既有产品的方法。后者被称为流程创新,其经济含义是通过发明新的生产工艺与操作步骤来降低单位生产成本。Scherer (1982) 与 Cohen 和 Klepper (1996) 长期强调,流程创新与产品创新在企业内部争夺同一笔研发预算,二者的相对比重反映了企业把技术资源配置于降本还是配置于开辟新市场的战略取向;Eswaran 和 Gallini (1996) 进一步论证了这一取向如何被要素价格与专利制度共同塑造。Bena 和 Simintzi (2025) 据此构造了一个可以直接观测该取向的专利指标,用以检验企业获得廉价劳动力后是否减少了对节约成本型生产技术的投入。 该指标的制度基础在于专利权利要求所声明的发明类别。美国专利法第 101 条把可授予专利的发明划分为方法、机器、制品与组合物四类,其中只有方法一类对应"一系列动作或步骤",即流程创新;类别在每项权利要求的前序部分中直接声明,原文以此识别流程性权利要求。中国的制度安排与之对应:专利法把发明界定为"对产品、方法或者其改进所提出的新的技术方案",方法与产品的二分恰好对应美国四分类中方法一类与其余三类的划分;专利审查指南要求发明名称清楚、简要地表明所要求保护的技术方案的主题,并要求一件申请含有多个不同类别的独立权利要求时,名称须反映各个类别,因此才有"某某方法及装置"一类的名称形式。发明名称由此承担了与权利要求前序部分相同的类别声明功能,其中首个主题名称对应第一项独立权利要求的类别。 据此,本数据集把每件发明专利判定为流程专利或非流程专利:解析发明名称,定位处于主题边界上的首个方法类主题词(方法、工艺、流程、制法、用法),若其之前不存在主题分隔符,则第一个保护主题即为方法,该专利记为流程专利;若之前存在分隔符,则需区分分隔符是在并列不同类别的主题,还是落在修饰语内部(如"提高大容量、多内存设备访问效率的方法"中的顿号并不分隔主题),以分隔符与方法词之间是否出现结构助词"的"作为判别依据。实用新型与外观设计不纳入判定,因为依专利法实用新型仅保护产品的形状与构造,不可能是方法。 在企业-年度层面,按专利申请年份归集企业本身及其子公司提出申请并最终获得授权的发明专利,分别计得流程创新专利数 $N^{proc}{i,t}$、非流程创新专利数 $N^{nonproc}{i,t}$ 及二者之和发明专利总数 $N{i,t}$。核心指标为流程创新占比: $$Share{i,t}=\frac{N^{proc}{i,t}}{N{i,t}}$$ 该比值仅对当年至少拥有一件授权发明专利的企业年度定义。它衡量企业当年全部专利化创新活动中指向改进生产方法的份额,取值越大代表创新投入越偏向降低自身生产成本。 数据集提供三个稳健口径。其一为被引加权流程创新占比,它不再把每件专利等权计入,而是以专利自授权年份起三年窗口内获得的引用次数 $wp$ 为权重,衡量以技术影响力加权后的流程创新比重: $$Share^{cw}{i,t}=\frac{\sum{p \in proc} wp}{\sum{p} wp}$$ 引用是否落入窗口,以引用方文献进入公开记录的年份判定。当企业当年全部授权发明专利在该窗口内均未获得引用时,该比值无定义;由于权重取引用次数本身,该口径可取值的样本偏向专利数量较多、被引较充分的企业。 其二为技术类别调整流程创新数,用于消除不同技术领域专利产出强度的系统性差异。它分三步构造:先对每个技术类别 $k$ 与申请年度 $t$,在该类别当年至少拥有一件专利的全部企业上计算流程创新专利数的均值 $\overline{proc}{k,t}$;再以该均值缩放本企业在该类别当年的流程创新专利数;最后跨全部技术类别求和: $$Adj{i,t}=\sum{k}\frac{proc{i,k,t}}{\overline{proc}{k,t}}$$ 每件专利按其列示的全部技术类别等比例分配,即一件专利若涉及 $|Kp|$ 个类别,则在每个类别上计为 $1/|Kp|$ 件。原文的技术类别采用联合专利分类,本数据集改用国际专利分类小类,因为联合专利分类号对中国专利的赋予并不完整;用于标准化的均值在上市公司总体内计算。 其三为申请口径的流程创新占比,即不限定专利是否已获授权,直接以企业当年提出申请的全部发明专利计算相同的比值,用于检验结论是否依赖于授权这一筛选环节。 补充说明 - 样本口径:不预先施加行业剔除或规模筛选,使用者可按研究需要自行限定。归属口径为上市公司本身及其子公司提出的申请,与原文以子公司名单做名称匹配的做法一致;由多家上市公司联合申请的专利计入每一家关联公司。 - 测度捕捉的是权利要求的撰写形式:在软件与信息技术领域,算法类发明依制度要求必须以方法或系统权利要求的形式主张,其名称因而普遍以"方法"收尾。这类专利会被计为流程创新,但它反映的是该领域的法定撰写惯例,而非生产工艺的改进。原文的实证分析集中于制造业企业,使用者若关注生产成本导向的技术进步,建议同样限定于制造业子样本,或在回归中控制行业固定效应。 - 与原文测度的层次差异:原文主变量按权利要求条数加权,本数据集按专利件数计量,即复现原文中同样以第一项权利要求判定、以专利为单位定义的口径。中国专利的权利要求书全文不存在于可获取的公开数据源,故不提供按条数加权的版本。 - 授权口径的年份起点:授权公告文献的系统性收录存在起始年份,早于该年份获得授权的专利无法被识别为已授权。为避免输出受此影响的数值,基于授权样本的各列在起始年份之前不取值;起始申请年由数据中推导的收录起点减去发明专利最短实质审查周期得到,每年重建时自动重算。申请口径的稳健列不受此约束,覆盖完整时段。 - 小样本下的取值形态:当年授权发明专利数很少的企业,其占比只能取有限几个离散值,并大量落在 0 与 1 两端。建议在使用时同时控制专利数量,或限定于专利数达到一定规模的样本。 - 技术类别调整口径的性质:该指标是经过标准化的计数而非比值,与流程创新专利数高度相关,宜作为水平量的稳健替代而非独立构念使用;其技术类别采用国际专利分类小类。 - 申请年度上限:申请年度上限取当前自然年的前一年,与本数据库其余专利类数据集保持统一口径。专利自申请至公开存在约十八个月的法定滞后,当年申请的专利绝大多数尚未进入数据源,保留会产出严重失真的当年行,故不予输出。 - 其他局限:最近若干申请年度的专利仍处于审查过程中,授权样本随年份临近而逐步不完整,被引加权口径还额外受三年引用窗口尚未走完的影响,建议在时间窗口选择上留出滞后余量。发明名称解析对少数名称形式(如分隔符后重复前一主题再接修饰语)存在误判。 参考文献 - Bena J, Simintzi E. Machines could not compete with Chinese labor: evidence from US firms' innovation[J]. Review of Finance, 2025, 29(6): 1619-1661. - Bena J, Li K. Corporate innovations and mergers and acquisitions[J]. The Journal of Finance, 2014, 69(5): 1923-1960. - Scherer F M. Inter-industry technology flows in the United States[J]. Research Policy, 1982, 11(4): 227-245. - Cohen W M, Klepper S. Firm size and the nature of innovation within industries: the case of process and product R&D[J]. The Review of Economics and Statistics, 1996, 78(2): 232-243. - Eswaran M, Gallini N. Patent policy and the direction of technological change[J]. The RAND Journal of Economics, 1996, 27(4): 722-746.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。