企业关键技术突破(RoBERTa模型测度)
「企业关键技术突破(RoBERTa模型测度)」,覆盖 2004-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 87,378。 基于RoBERTa架构中文语义嵌入模型对专利摘要的语义编码,度量企业关键技术突破水平。
| 时间跨度 | 2004-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 87,378 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- InventionCount [发明专利数] — 企业当年申请的发明专利件数,为专利关键性加权汇总的基数。含子公司及联营、合营企业申请的专利;一件专利由多个上市主体共同申请时归属其中每一家
- INNOMean [专利关键性均值] — 参考马亚明和魏俊 (2026, 经济经纬)的方法,计算公式为:企业当年全部发明专利的关键性INNO的算术平均值,其中单条专利的关键性INNO=ln(1/(该专利摘要语义向量与前三年专利池(已剔除本公司专利)的平均余弦相似度+0.1))。该指标不含专利数量影响,为强度型度量。用作研究变量,越大代表企业当年专利在语义上越偏离同期技术存量;其水平同时包含专利摘要撰写体例与技术语域的成分,跨行业比较需控制行业固定效应
- SCINNORaw [关键技术突破加权汇总值] — 参考马亚明和魏俊 (2026, 经济经纬)的方法,计算公式为:以专利关键性INNO为权重对企业当年全部发明专利加权汇总,即当年各发明专利关键性之和。为核心指标标准化前的原始值,不依赖样本极值,跨数据版本可比
- SCINNOLn [关键技术突破对数值] — 参考马亚明和魏俊 (2026, 经济经纬)的方法,计算公式为:ln(1+关键技术突破加权汇总值)。为核心指标极差标准化前的对数值,不依赖样本极值,跨数据版本可比
- SCINNO [企业关键技术突破] — 参考马亚明和魏俊 (2026, 经济经纬)的方法,计算公式为:对关键技术突破对数值ln(1+当年各发明专利关键性之和)在全样本上作极差标准化,即(本值-最小值)/(最大值-最小值),取值介于0与1之间。用作研究变量,越大代表企业关键技术突破水平越高;该指标以专利规模为主导,与发明专利数的对数高度共线,不宜与专利计数同时进入同一回归
- SCINNONC [企业关键技术突破(未剔除自引口径)] — 参考马亚明和魏俊 (2026, 经济经纬)的方法,的稳健性检验设定,计算公式为:与企业关键技术突破的计算相同,但在计算单条专利关键性时,前三年比较池不剔除本公司专利。用作稳健性检验变量
常见问题
- 「企业关键技术突破(RoBERTa模型测度)」是什么数据集?
- 企业关键技术突破(RoBERTa模型测度),隶属创新与知识产权。基于RoBERTa架构中文语义嵌入模型对专利摘要的语义编码,度量企业关键技术突破水平。
- 该数据集的时间范围是?
- 覆盖 2004-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:发明专利数、专利关键性均值、关键技术突破加权汇总值、关键技术突破对数值、企业关键技术突破、企业关键技术突破(未剔除自引口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 87,378 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 关键技术突破指企业在技术轨道上取得的原创性、非渐进式进展。与沿既有路径的改良不同,真正的关键技术突破意味着技术内容显著偏离当时业已存在的技术知识存量。既有研究衡量这一构念时,主要依赖两类做法:一是统计企业年报中的创新技术关键词,二是使用专利被引数量。前者高度依赖企业的主动披露与措辞习惯,后者虽以实际技术成果为依据,却忽略了专利之间的质量差异,难以识别真正具有原创性的技术成果,容易受到低质量专利的干扰而产生虚高。本数据集参考马亚明、魏俊(2026,经济经纬)的方法,从专利文本的语义层面度量技术原创性:把每一条专利的技术内容映射到语义向量空间,用它与同期技术知识存量的语义距离刻画其关键性,从而在专利层面区分原创突破与跟随式改良。 第一步是专利文本的语义向量化。使用 RoBERTa 架构的中文语义嵌入模型 BAAI/bge-large-zh-v1.5 对每一条专利的中文摘要编码。该模型为 24 层、隐藏维度 1024 的双向预训练语言模型,其底座为中文全词掩码 RoBERTa。取模型最后一层的分类位([CLS])向量作为整条摘要的语义表示——这是该模型官方指定的池化方式——再作 $L2$ 归一化,得到单位向量 $v$。归一化后,任意两条专利摘要语义向量的内积即等于其余弦相似度,$\rho{ij}=vi\cdot vj$,取值越大表示两项技术在语义上越接近。摘要编码的最大长度取 384 个词元,足以覆盖绝大多数专利摘要的完整表述。 第二步是计算单条专利的技术关键性。对申请于第 $t$ 年的专利 $i$,以第 $t-3$ 至 $t-1$ 年申请的全部专利构成同期技术知识存量 $It$,计算专利 $i$ 与该存量中每一条专利的语义相似度并取平均,再对该均值取倒数后取自然对数,得到专利关键性: $$\mathrm{INNO}{it}=\ln\left(\cfrac{1}{\cfrac{\sum{j\in It}\rho{ij}}{Nt}+0.1}\right)$$ 其中 $Nt$ 为存量 $It$ 的规模,分母中的 0.1 为平滑项,用于避免平均相似度趋近于零时取倒数发散。平均相似度越低,说明该专利与当时的技术知识存量越不相似、越偏离既有技术轨道,$\mathrm{INNO}$ 值越大,技术关键性越高。构成比较基准的技术知识存量涵盖发明专利与实用新型两类,以使参照系尽可能完整地代表同期的技术面貌。 这一步的计算存在一个可精确利用的恒等关系。由于全部语义向量均已作 $L2$ 归一化,专利 $i$ 与存量内各专利相似度的平均值,恒等于该向量与存量质心向量的内积: $$\frac{1}{Nt}\sum{j\in It}vi\cdot vj=vi\cdot\left(\frac{1}{Nt}\sum{j\in It}vj\right)$$ 两者数值完全相等。据此只需累加存量的向量和,即可精确得到每条专利的平均相似度,而无需真正遍历两两配对,使得以全部同期专利(而非抽样或子集)作为比较基准在计算上成为可能,且结果为精确值而非近似。 在构造比较基准时,需从存量中剔除属于同一上市主体的专利,即所谓自引部分。这样处理的意义在于:技术关键性衡量的应是该专利相对外部技术界的差异,若把企业自身的专利留在参照系中,专利数量庞大的企业会因自身技术的高度重复而被系统性地判定为低原创。借助上述恒等关系,这一剔除同样可以精确完成——从存量向量和中减去该主体在同期的向量和,从存量规模中减去其专利件数即可。本数据集同时提供不作此剔除的稳健口径,与原论文的稳健性检验相对应。 第三步是汇总到企业层面。以专利关键性为权重,对企业当年申请的发明专利作加权汇总,得到企业—年度的关键技术突破加权汇总值 $\sum{p}\mathrm{INNO}p$,其中 $p$ 遍历该企业当年的全部发明专利。汇总环节只使用发明专利,因为发明专利更能代表企业的实质性技术产出。随后对该汇总值取自然对数,并作极差标准化,得到核心指标企业关键技术突破: $$\mathrm{SCINNO}{ft}=\frac{\ln\left(1+\sum{p}\mathrm{INNO}p\right)-\min}{\max-\min}$$ 数值越大,代表企业当年在关键技术上的突破水平越高。 为便于研究使用,本数据集同时给出计算链上的中间构件与稳健口径。中间构件包括企业当年的发明专利数(加权汇总的基数)、企业当年发明专利关键性的算术平均值,以及取对数前后的加权汇总值。其中关键性均值不含专利数量的影响,是一个强度型指标,与规模型的核心指标形成互补。稳健口径为比较基准不剔除自身专利时算得的关键技术突破,对应原论文的稳健性检验设定。 最后需说明本指标族的三项方法性质,它们直接决定正确的使用方式。 其一,加权汇总使核心指标在实证上以专利规模为主导。关键性的取值分布相当集中,而企业间发明专利数量的差异跨越若干数量级,因此核心指标与发明专利数的对数高度共线;在同时包含企业与年份固定效应的回归中,二者几乎不可区分。核心指标宜理解为"以语义关键性加权的专利数量",不宜与专利计数同时进入同一回归;需要剥离数量效应考察创新强度时,应使用关键性均值。 其二,语义独特性同时包含摘要撰写体例与技术语域的成分。分类位池化的句向量存在长度效应——较短的摘要与语料质心的相似度偏低,因而被判定为更关键;不同技术领域的摘要用语差异也会系统性影响相似度水平,化学、生物医药类专利的语言与机械电子类差异尤为明显。因此关键性度量的是"专利摘要相对同期语料的语义独特性",与技术新颖性并不等同,跨行业比较必须控制行业固定效应。 其三,比较池的组成逐年变化。平均相似度的水平由比较池的质心决定,池内技术构成越同质,全体专利的关键性水平就越低。固定同一批专利、仅替换比较池年份的对照实验表明,关键性的年度水平会因池组成而系统性移动,其幅度在数据实际的年度变化中占相当比例,且移动的拐点年份与实测一致。因此关键性与核心指标的年度水平变化不应作为技术突破趋势的证据;使用时应加入年份固定效应,又因池的漂移在各技术领域并不均衡,以近年为处理期的双重差分或事件研究还应加入行业×年份固定效应或行业时间趋势项。 补充说明 - 样本口径与零值语义:面板覆盖全部 A 股上市公司的企业—年度观测,时间基准为专利申请年份。原论文的回归样本剔除了金融类企业、退市风险企业与变量缺失样本,并对连续变量作上下 1% 缩尾;本数据集不预先施加这些回归样本限制,也不缩尾,研究者可按需自行施加。当年没有发明专利的企业—年度,其专利数与加权汇总值记为零,核心指标相应取到下边界,而关键性均值因无从定义而留空。因此核心指标是半连续变量,其零值质点的占比在样本前期相当高、并随年份持续下降,早期截面中大量观测取同一值,跨年的边际效应不可直接比较;建议样本起始年不早于零值占比降至三成以下的年份,需要两部模型或受限因变量模型时,可用发明专利数是否为零精确识别下censoring 点。 - 关键性均值为条件样本变量:该列仅在企业当年至少有一件发明专利时才有取值,缺失并非随机,而是集中于专利较少的企业、非制造行业与样本早期年份。以它作被解释变量,等价于在"当年已产出发明专利"这一条件上作样本选择,而是否产出发明专利本身即构念的组成部分,估计结果不宜外推至全体企业。需要全样本口径时应使用核心指标。 - 骨架含上市前年份:面板采用统一的全 A 股企业—年度骨架,其中相当一部分观测的年份早于该公司上市年份。且专利归属依据当前的企业名录(含现有子公司与联营方)反推至历史年份,对上市前年份构成前视信息。研究首次公开发行前后的创新变化、或以上市作为处理事件的设计,须自行按上市日期过滤。 - 标准化口径与原文描述统计不一致:本数据集严格按原文文字所述的"取自然对数并标准化"落地。需要提示的是,原文表 1 报告的该变量描述统计(标准差大于均值的极右偏形态、取值介于 0 与 1 之间)在数学上无法由"先取对数、再作标准化"的流程产生——取对数会把右偏的专利计数分布压成近似对称,此后无论作极差标准化还是零均值单位方差标准化,都不可能得到那样的形态。即原文的文字表述与其自报统计量之间存在张力。本数据集以原文的文字公式为准,同时提供未经标准化的加权汇总值及其对数值,研究者若需复现原文表 1 的数值形态,可直接基于这两列自行改用其他标准化方式。使用时不宜期待本指标的绝对水平与原文表 1 对齐。 - 极差标准化依赖样本构成:该标准化的分母由全样本极值决定,样本区间或口径变动时,全部历史观测的取值会随之整体改变,因此核心指标不具备跨样本可比性。这是原文方法的固有性质。需要跨样本可比或跨年稳定尺度的研究,应直接使用未标准化的加权汇总值或其对数值。就本数据集而言,取值上端由若干家专利规模相近的企业共同构成,并非由单一企业主导,故对个别极端观测并不敏感。 - 模型实例与绝对水平:原文将所用模型记作"BAAI/bge-zh-v1.5",而该系列公开发布的是大、基础、小三种尺寸,并无无尺寸后缀的版本;本数据集选用与原文"RoBERTa 架构"及"大语言模型"表述最相符的 large 尺寸。语义向量余弦的绝对尺度会随模型实例而平移,不在不同实例之间可比,因此关键性与核心指标的绝对水平不宜与原文逐值对标,企业间的相对排序则稳健。 - 末年数值受公开滞后删失:发明专利自申请至公开约有一年半的滞后,面板末年的专利入库并不完整,且删失并非只出现在年末——末年各月的申请量相对上年同月普遍偏低,故该年的专利数、加权汇总值与核心指标均系统性偏低。末年数值不宜作水平或增长率解读,趋势分析建议截至末年之前一年。 - 专利归集口径与个案核查建议:专利按上市主体归集,含其子公司及联营、合营方申请的专利,因此计数高于仅按母公司统计的口径;一件专利若由多个上市主体共同申请,则归属其中每一家。源数据的企业名录匹配存在个别偏差,抽查中发现有非制造业公司被归集了与其主营和股权关系均不相符的大量专利。研究者若发现非制造业企业的专利计数异常靠前,建议对该企业—年度作个案核查后再纳入样本。 - 关于文献归属:原文在介绍关键性公式时称参考黄先海等(2018),但该文主题为出口、创新与企业加成率,并未提出专利语义相似度这一测度;以专利摘要句向量相似度构造创新突破性的是黄先海等(2024)。本数据集的方法来源仅归于马亚明与魏俊(2026),文献表中一并列出上述两篇,以便读者溯源核对。 - 其他局限:比较基准为本库收录的上市公司关联专利全集,与原论文的数据范围一致,但在概念上"与整个技术界的差异"应以全国专利为参照系;同一实际控制主体的 A、B 股代码在源数据中为不同证券代码,少数双代码公司的自身专利剔除不完整。 参考文献 - 马亚明,魏俊.人工智能应用与企业关键技术突破——来自大语言模型的新证据[J].经济经纬,2026,43(4):150-160. - 黄先海,金泽成,余林徽.出口、创新与企业加成率:基于要素密集度的考量[J].世界经济,2018,41(5):125-146. - 黄先海,孙猛铭,陈梦涛.企业数字化转型与颠覆性技术创新——来自专利网络与sbert模型的微观证据[J].中国工业经济,2024,(10):137-154. - Liu Z, Xiao S, Shao Y, et al.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。