企业渐进式创新强度

「企业渐进式创新强度」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 76,058。 基于专利摘要文本相似度测度的企业渐进式创新强度。

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数19
样本量76,058
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年份
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • NPatentCur [当年申请专利数] — 企业当年申请的专利数量,仅统计以上市公司本身名义申请的专利。该数量是渐进式创新程度计算中当期专利集合的规模,数量过小时相似度均值由极少数专利配对决定,噪声较大
  • NPatentWin3 [近三年申请专利数] — 企业在当年及前两年共三年内申请的专利数量,仅统计以上市公司本身名义申请的专利。该数量是渐进式创新程度计算中比较窗口的专利集合规模,若该数量不超过1则当年无可比对的其他专利,渐进式创新程度不予计算
  • ICRaw [渐进式创新程度原始值] — 参考孙雅慧等(2024, 经济研究)的方法,计算公式为:当年申请的每一项专利与本企业近三年(当年及前两年)申请的其他专利之间摘要文本相似度的算术平均值,其中两份专利的相似度等于各自摘要经分词并以词频-逆文本频率加权所得特征向量的余弦值。取值范围为0至1,数值越大表示当期创新内容与企业既有技术基础的重叠度越高。本列为去规模化处理前的原始指标,也是原文稳健性检验采用的口径之一
  • IC [企业渐进式创新强度] — 参考孙雅慧等(2024, 经济研究)的方法,计算公式为:渐进式创新程度原始值除以该企业所有年份渐进式创新程度原始值的算术平均值。该去规模化处理用于消除技术领域、研发内容与摘要撰写风格造成的企业间不可比性,结果反映企业渐进式创新的相对变化幅度,为原文基准回归所采用的口径。用作研究变量,越大代表企业当年的创新越依赖既有技术范式、渐进式创新强度越高
  • NPatentCurFull [当年申请专利数(全归属口径)] — 企业当年申请的专利数量,统计口径扩展至上市公司本身及其子公司、联营企业与合营企业申请的全部专利。该全归属口径为本数据集扩展的稳健性口径,非原文所采用的检索范围
  • NPatentWin3Full [近三年申请专利数(全归属口径)] — 企业在当年及前两年共三年内申请的专利数量,统计口径扩展至上市公司本身及其子公司、联营企业与合营企业申请的全部专利。该全归属口径为本数据集扩展的稳健性口径,非原文所采用的检索范围
  • ICRawFull [渐进式创新程度原始值(全归属口径)] — 参考孙雅慧等(2024, 经济研究)的方法,计算公式为:当年申请的每一项专利与本企业近三年申请的其他专利之间摘要文本相似度的算术平均值,计算方法与渐进式创新程度原始值相同,区别在于专利归属口径扩展至上市公司本身及其子公司、联营企业与合营企业。用作稳健性检验,衡量含集团内其他法人在内的整体技术连续性。该全归属口径为本数据集在原文基础上扩展的稳健性口径,非原文所采用的检索范围
  • ICFull [企业渐进式创新强度(全归属口径)] — 参考孙雅慧等(2024, 经济研究)的方法,计算公式为:全归属口径的渐进式创新程度原始值除以该企业所有年份该指标的算术平均值。计算方法与企业渐进式创新强度相同,区别在于专利归属口径扩展至上市公司本身及其子公司、联营企业与合营企业。用作稳健性检验,越大代表企业渐进式创新强度越高。该全归属口径为本数据集在原文基础上扩展的稳健性口径,非原文所采用的检索范围

常见问题

「企业渐进式创新强度」是什么数据集?
企业渐进式创新强度,隶属创新与知识产权。基于专利摘要文本相似度测度的企业渐进式创新强度。
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:当年申请专利数、近三年申请专利数、渐进式创新程度原始值、企业渐进式创新强度、当年申请专利数(全归属口径)、近三年申请专利数(全归属口径)、渐进式创新程度原始值(全归属口径)、企业渐进式创新强度(全归属口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 76,058 条观测。
数据是如何测算/获取的?
指标定义与计算方法 创新活动具有双元性。一类是对已有技术、产品或流程的改良与应用,其成果在很大程度上继承既有的技术基础与范式,属于渐进式创新;另一类则跨越原有技术范式,探索全新的技术方案与产品市场,属于突破式创新。区分两者对评估创新政策的实际效果至关重要:如果政策资源在客观上强化了企业对既有技术路线的路径依赖,企业的创新产出规模可能扩张,却始终被锁定在原有范式之内,难以取得真正的创造性突破。 衡量这一构念的传统做法是借助专利的外部特征,例如按发明与非发明类别划分、依据专利引用关系识别,或比较专利分类号的变化。这些方法只能通过外部评价或技术类别的跳转来推测创新属性,无法反映研发活动的具体技术内容。渐进式创新的本质特征是当期创新活动与往期创新在内容上的连续性,因此更合理的识别方式是直接评估企业当前的研发内容与其既有技术基础之间的关系。以文本挖掘刻画专利之间的技术相似度,此前主要被用于描绘技术演化路径与前沿技术搜索(Arts 等,2021;Hain 等,2022),将其转化为企业层面的实证测度则是本指标所复现文献的贡献。本数据集据此采用专利摘要的文本相似度来测度:专利摘要凝练了一项创新成果的核心技术内容,当期专利与企业既有专利在摘要内容上的重叠度越高,说明该企业的创新越依赖已经掌握的技术范式,渐进式创新的强度越高。 计算分三步展开。 第一步,将专利摘要转换为文本特征向量。 先对摘要分词,并剔除语气词、连接词一类出现频率高但没有实际含义的虚词,同时丢弃不含汉字与拉丁字母的纯数字、纯符号片段(专利摘要中此类片段大量来自数值参数与化学式,不承载技术语义)。这里保留专利的全部文本内容,而不是像部分研究那样只保留名词与形容词,以避免割裂语义、丢失关键信息。由于文本中各词汇的语义重要性并不相同,直接使用词频会让通用词汇淹没技术特征词,因此采用词频-逆文本频率作为权重对词频加以调整:一个词在某份摘要中出现得越频繁、而在全部语料中出现的文档数越少,它对刻画该专利技术内容的贡献就越大。设语料共含 $N{doc}$ 份摘要、词 $m$ 出现于其中 $dfm$ 份,则该词的逆文本频率与最终权重为 $$idfm = \ln\frac{1+N{doc}}{1+dfm} + 1, \qquad w{sm} = tf{sm}\cdot idfm$$ 其中 $tf{sm}$ 是词 $m$ 在专利 $s$ 摘要中的出现次数。逆文本频率在全部专利摘要构成的统一语料上计算一次,使所有专利的向量处于同一权重体系之下。这一加权方式同时带来一个便利的性质:专利文献中程式化的套语因为几乎出现在每一份摘要中而获得接近于零的权重,无须人工维护一张专利套话表。 第二步,计算专利两两之间的内容相似度。 文本向量确定了每份摘要在向量空间中的位置,位置越接近意味着内容越相似。以向量夹角余弦度量这一距离: $$Sim(Ps,Pk)=\cos(\vec{Ps},\vec{Pk})=\frac{\summ w{sm}w{km}}{\sqrt{\summ w{sm}^{2}}\sqrt{\summ w{km}^{2}}}$$ 考虑到技术不断迭代,过于早期的技术在新颖性与兼容性上均已下降,比较的范围限定在近三年之内:对企业当年申请的每一项专利,逐一计算它与本企业近三年(含当年)申请的其他专利之间的向量距离。 第三步,汇总到企业层面。 将上述两两相似度取算术平均,得到企业当年的渐进式创新程度: $$IC{it}=\frac{1}{N}\sum{s,k}Sim(Ps,Pk),\qquad ts=t,\;\; 0\le ts-tk<3$$ 式中 $ts$ 与 $tk$ 为两项专利的申请年份,$N$ 为参与平均的专利配对数量。$s$ 取遍企业当年申请的专利,$k$ 取遍该企业近三年窗口内申请的其他专利(不与自身配对)。由此可知,若某企业当年申请的专利在近三年内没有任何其他专利可供比对,则不存在有效配对,该企业当年不产出取值——这与原文"一项专利申请的近三年均无其他专利申请的样本无法纳入回归"的处理一致。实现上利用了一个精确的代数恒等式:向量作单位化后,两两内积之和等于当年专利向量和与窗口内专利向量和的内积再减去自配对部分,因此无需真的枚举全部配对即可得到与逐对计算完全相同的结果。 上述原始指标在企业之间并不完全可比:技术领域、研发内容乃至摘要的撰写风格都会影响相似度的绝对水平。为此对各年取值作去规模化处理,即除以该企业所有年份原始指标的算术平均值: $$IC^{scaled}{it}=IC{it}\Big/\overline{IC{i}}$$ 处理后的结果反映企业渐进式创新的相对变化幅度,不再受文本语言风格、技术领域与初始渐进式创新水平的影响,这一去规模化口径即原文基准回归所采用的核心变量。数据集同时保留去规模化之前的原始指标,它也是原文稳健性检验采用的口径之一。 数据集提供两套并行结果。核心口径只统计以上市公司本身名义申请的专利,与原文按公司名称及曾用名检索专利的方式一致;稳健口径则把归属范围扩展到上市公司及其子公司、联营企业与合营企业申请的全部专利,用以考察集团层面的整体技术连续性。两套口径各自独立完成上述三步计算与去规模化,并各自附有当年与近三年的专利计数。全部专利均为在中国大陆提出的申请,从而避免同一发明在多国申请同族专利造成的重复计算。 补充说明 - 样本口径:数据集输出企业-年度面板,不预先施加回归所需的样本限制(不剔除金融业、不作缩尾、不限定年份窗口),研究者可按需自行筛选。相似度取值介于 0 与 1 之间。 - 必须控制专利数量:企业专利越多,其技术领域分布越分散,两两平均相似度会因此被机械摊薄。该关系在企业内部同样存在,并不会被个体固定效应吸收。由于创新政策的一阶效应往往正是推高专利申请量,若回归中不同时控制专利数量,这一机械成分可能被误读为政策改变了创新的渐进性,且方向与预期相反。计数列已随数据集一并提供,建议作为控制变量纳入。 - 时间趋势不宜直接解读:原始指标的水平随年份呈下降态势,而同期企业的专利数量大幅增长。以不同方法分离规模因素后,所得的机械成分占比差异很大,且分专利规模来看趋势方向并不一致。因此全样本的时间走势不应作为渐进式创新普遍升降的证据;跨期比较须加入年份固定效应。 - 去规模化的分母范围:分母取企业在数据集全部年份上的均值,其中包含企业上市之前的申请年份。上市前企业专利较少、相似度相对偏高,会抬高分母进而压低上市后年份的取值,使指标隐含一条随上市年限走低的漂移。原文是在其特定样本期内计算均值。研究者一旦限定样本窗口或只保留上市后年份,必须用原始指标自行重算去规模化值,不可直接沿用本数据集的去规模化列。该分母还使用了企业全期信息,因而不适合作为预测型自变量。 - 核心口径的缺失具有选择性:当企业本身当年未申请专利或近三年无可比对专利时,核心口径不产出取值。缺失率随企业资产规模上升,在国有企业中高于非国有企业,在非制造行业远高于制造行业,并随年份下降。研发活动完全由子公司承担的大型集团会整体落入缺失。研究创新政策时建议改用全归属口径,或至少以其作稳健性对照。 - 两套归属口径不可混用:两者的差异几乎完全由企业将专利放在母公司还是子公司这一组织安排驱动,本身申请占比越低的企业分歧越大。二者测量的是不同主体范围的技术连续性。与其他以全归属口径构建的专利数据集联用时,应统一选择全归属口径列。 - 缺失不可填充为零:原始指标存在真实的零值,含义是当年专利与近三年其他专利没有任何共同词汇。而完全没有专利的企业-年在本数据集中并无对应行。将缺失填为零会把"没有专利"与"内容完全不相似"混为一谈,两者含义恰好相反。 - 分词粒度:实现中一并丢弃了长度为一个字的词。这是超出原文表述的取舍:中文专利摘要里确有单字实义技术词(如锂、钴、酸、泵、轴、膜、钢),会随虚词一同被丢弃,使以单字材料词区分技术路线的企业(如化工、材料行业)相似度略被低估。之所以保留该设定,是因为单字词在通用分词器下大量来自虚词与切分碎片,若要把实义单字择出就需自建技术词表,而这将引入原文没有的主观成分。该过滤对所有专利一致施加,对企业内跨年比较与去规模化后的相对取值影响很小。 - 末端年份的删失:申请年份上限取当前自然年的前一年,与本数据库其余专利类数据集口径统一。受专利公开约 18 个月行政滞后影响,末年专利收录仍不完整,实测可见量仅约为前一年的六成。两类列受影响程度差别很大:相似度类列属比值,末年中位数约为前一年的 0.97(全归属口径 0.98),平滑延续既有走势、未见反常跳变,可以使用;而两个计数列直接暴露于删失,当年申请专利数的末年中位数仅为前一年的 0.64(近三年申请专利数因窗口含较完整年份而缓冲至 0.91),在末端一至两年明显低估。由于上一条建议把计数列用作控制变量,需要计数列的研究应将样本截至末年之前。 - 跨数据版本的可比性:本数据库每年重建时,专利语料扩充与样本期延长会使历史年份的取值发生变动,这是全语料词频-逆文本频率加权与企业内去规模化方法的固有性质。但两类列的变动幅度相差两个数量级:原始指标仅受词频权重微调影响,重叠年份的中位绝对变动约为 0.0001、相关系数 0.99993,可视为不变;去规模化后的指标另受分母纳入新年份的影响,重叠年份的中位绝对变动约为 0.016,相对变动的 99 分位可达 16.6%,相关系数 0.9967——企业排序高度稳健,但具体水平值会移动。因此引用去规模化列的具体数值时须注明数据版本;若需跨版本严格复现,应以原始指标按固定样本窗口自行重算去规模化值。 - 其他局限:近三年专利数很少的企业-年,取值由极少数配对决定,波动明显更大,建议设定专利数下限作稳健性检验并使用聚类稳健标准误;企业普遍存在的将同一技术同时申报发明专利与实用新型的做法会抬高相似度,该行为的普遍程度在样本期内有所变化,原文亦未加以剔除,本数据集予以保留;仅有一个观测年份的企业其去规模化取值恒为 1。 参考文献 - 孙雅慧,时省,彭飞,等.研发补贴与渐进式创新锁定:基于机器学习的专利文本分析[J].经济研究,2024,59(11):89-105. - ARTS S, HOU J, GOMEZ J C. Natural language processing to identify the creation and impact of new technologies in patent text: Code, data, and new measures[J]. Research Policy, 2021, 50(2): 104144. - HAIN D S, JUROWETZKI R, BUCHMANN T, et al. A text-embedding-based approach to measuring patent-to-patent technological similarity[J]. Technological Forecasting and Social Change, 2022, 177: 121559.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。