企业突破式创新(BERT法)
「企业突破式创新(BERT法)」,覆盖 1987-2024 年,频率 年度,上市公司层级,含 16 个变量,样本量约 68,061。 参考秦姣姣、郭爱芳(2026,科研管理)的方法,基于专利摘要文本的BERT语义相似度构建的企业突破式创新指标:企业当年专利摘要与本企业前5年专利摘要两两余弦相似
| 时间跨度 | 1987-2024 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 68,061 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NPatentCur [当年专利数] — 企业当年(申请年为该年)拥有的、参与突破式创新相似度计算的专利数量(含发明专利与实用新型),为相似度计算的当前专利集规模
- NPatentPrior5 [前5年专利数] — 企业前5年(申请年为该年前推第1至第5年)拥有的专利数量(含发明专利与实用新型),为相似度计算的历史知识库规模
- CBI [企业突破式创新] — 参考秦姣姣、郭爱芳(2026,科研管理)的方法,计算公式为:企业当年专利摘要与本企业前5年(第t-5至t-1年)专利摘要基于BERT语义向量的两两余弦相似度均值,以1减去该均值再乘以100。仅当当年与前5年均有专利时给出。值越大代表当前创新与企业既有知识基础的相异度越高、突破式创新水平越高,用作研究变量
- CBIInv [突破式创新(发明专利口径)] — 参考秦姣姣、郭爱芳(2026,科研管理)的方法,仅以发明专利计算的突破式创新稳健性口径,计算公式为:企业当年发明专利摘要与本企业前5年发明专利摘要的两两余弦相似度均值,以1减去该均值再乘以100。当年或前5年无发明专利时为缺失
- CBIScaled [规模化突破式创新] — 参考秦姣姣、郭爱芳(2026,科研管理)稳健性检验的规模化做法,计算公式为:企业当年突破式创新CBI除以该企业所有年份CBI的算术平均值,以反映企业突破式创新的相对变化幅度。属横截面标准化(含全期均值),不宜作预测型自变量
常见问题
- 「企业突破式创新(BERT法)」是什么数据集?
- 企业突破式创新(BERT法),隶属创新与知识产权。参考秦姣姣、郭爱芳(2026,科研管理)的方法,基于专利摘要文本的BERT语义相似度构建的企业突破式创新指标:企业当年专利摘要与本企业前5年专利摘要两两余弦相似
- 该数据集的时间范围是?
- 覆盖 1987-2024 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:当年专利数、前5年专利数、企业突破式创新、突破式创新(发明专利口径)、规模化突破式创新。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 68,061 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 突破式创新是一种基于新的概念或技术范式、打破既有知识基础、突破现有技术秩序的创新活动,其显著特征在于当前创新活动与企业往期创新活动在内容上的不连续性和非相似性。专利摘要凝练了一项创新活动的核心技术内容,体现了专利背后的技术知识基础;因此,企业当前专利与其既有专利在摘要内容上的相异度,可作为衡量企业突破式创新程度的代理指标:相异度越高,说明当前创新越偏离企业既有的知识轨迹,突破式创新水平越高。本数据集参考秦姣姣、郭爱芳(2026,科研管理)的方法,基于专利摘要文本的语义相似度构建企业层面的突破式创新测度。 传统的文本相似度计算方法,如词袋模型(Bag of Words)、词频—逆文档频率(TF-IDF)等,通常需要人工设计特征与规则,且难以捕捉文本之间深层的语义关系,指标测度的准确性受限。为此,本数据集采用 BERT(Bidirectional Encoder Representations from Transformers)预训练语言模型计算专利文本之间的相似度。BERT 是一种基于 Transformer 架构的双向预训练模型,其核心在于双向训练机制,使模型能同时考虑输入文本左右两侧的上下文信息,从而获得更丰富的语义表示,显著提升了语义相似度度量的准确性。 具体计算分三步。第一步,专利摘要文本的编码与向量化。使用 BERT 模型的分词器处理每条专利的摘要文本,输入模型后取最后一层的隐藏状态,并对全部有效词位做掩码平均池化(mean pooling),得到一条覆盖全摘要的语义向量,再作 $L2$ 归一化,使其成为单位向量 $v$,刻画该摘要在语义向量空间中的位置。第二步,计算专利内容之间的相似度。以向量余弦度量两条专利摘要 $p$、$q$ 语义向量的相对位置: $$\cos(vp,vq)=\frac{vp\cdot vq}{\lVert vp\rVert\,\lVert vq\rVert}=vp\cdot vq$$ 余弦值越大,两专利语义越相似、相异度越低。第三步,计算企业层面的突破式创新水平。对企业 $i$ 在第 $t$ 年的每一条专利,计算其与该企业前 5 年(第 $t-5$ 至 $t-1$ 年)全部专利的两两余弦相似度,汇总求均值,再以 1 减去该均值得到相异度,并乘以 100,作为企业突破式创新的测度: $$\mathrm{CBI}{it}=\left(1-\frac{1}{n^{\text{cur}}{it}\,n^{\text{pri}}{it}}\sum{p\in C{it}}\sum{q\in P{it}}vp\cdot vq\right)\times 100$$ 其中 $C{it}$ 为企业 $i$ 第 $t$ 年的专利集合、规模为 $n^{\text{cur}}{it}$,$P{it}$ 为企业 $i$ 第 $t-5$ 至 $t-1$ 年的专利集合、规模为 $n^{\text{pri}}{it}$。由于语义向量已作 $L2$ 归一化,两两余弦相似度之和等于两组向量各自求和后的内积,即上式可等价地写作 $\big(\sum{p}vp\big)\cdot\big(\sum{q}vq\big)\big/(n^{\text{cur}}{it}\,n^{\text{pri}}{it})$,两者数值完全相等,据此可精确且高效地按企业—年度汇总计算。$\mathrm{CBI}$ 数值越大,代表企业当前创新与自身既有知识基础的相异度越高、突破式创新水平越高。指标仅在企业当年与前 5 年均有专利时给出。 为便于研究使用,本数据集同时给出两个中间构件与两个稳健口径。中间构件为参与计算的当前专利数 $n^{\text{cur}}{it}$(当年专利数)与历史知识库规模 $n^{\text{pri}}{it}$(前 5 年专利数),用以反映相似度计算的样本基数。稳健口径之一为仅以发明专利计算的突破式创新 $\mathrm{CBI}^{\text{Inv}}$(突破式创新常以发明专利刻画核心技术突破);稳健口径之二为规模化处理的突破式创新,考虑到专利的技术领域、研究内容与摘要撰写风格等因素可能影响突破式创新水平的横向可比性,采用企业所有年份的突破式创新平均值对各年度水平作规模化处理,以反映企业突破式创新的相对变化幅度: $$\mathrm{CBIScaled}{it}=\frac{\mathrm{CBI}{it}}{\frac{1}{Ti}\sum{s}\mathrm{CBI}{is}}$$ 其中 $Ti$ 为企业 $i$ 有突破式创新观测的年份数。 补充说明 指标归属与样本口径。一项专利若由多个上市主体(企业本身及其纳入合并范围的子公司、联营、合营方)共同拥有或申请,则按主体名称归属于每一家参与的上市公司,同一专利在同一主体内只计一次;相似度计算以专利申请年份为时间基准。原论文的回归样本为制造业上市企业,并剔除退市风险企业、剔除专利数据不足 5 年的企业、对连续变量作上下 1% 缩尾。本数据集为便于多领域研究,按同一方法产出全部 A 股上市公司(不限行业)的企业—年度面板、且不作缩尾,样本筛选与缩尾属研究者在回归阶段的选择,可按需自行施加。企业—年度层面参与计算的专利数较少(如当年与前 5 年各仅一条专利)时,突破式创新测度基于单一两两相似度,噪声较大,可借助本数据集提供的两个计数列自行设定最小专利数门槛。 关于模型实例与绝对水平的重要披露。原论文仅说明采用"BERT 模型",未公开其具体的模型实例(checkpoint);由于 BERT 句向量余弦的绝对尺度会随模型实例的各向异性而变化、不在不同模型实例之间可比,本数据集采用公开标准中文 BERT 实例(HFL 中文 RoBERTa-wwm-ext,属 BERT 架构双向预训练模型)配合掩码平均池化。在与原论文一致的子样本(制造业、2007—2022 年、专利数据不少于 5 年、连续变量上下 1% 缩尾)上,本数据集突破式创新均值约 8.25、标准差约 1.37,与原文报告的均值 10.90、标准差 1.74 在分布形态上一致(变异系数分别约为 0.166 与 0.160),但绝对水平低约 24%。该水平差距来自两个方面:其一是模型实例各向异性造成的余弦尺度平移(主因),其二是样本范围的差异(本数据集为全部 A 股上市公司、原文为制造业 2184 家企业)。经检验,改用不同的标准中文 BERT 实例时,企业间突破式创新的相对排序高度稳健(斯皮尔曼相关系数约 0.97),即绝对水平随模型平移、而企业间的相对高低几乎不变。因此在含企业与年份固定效应的面板研究中(固定效应吸收水平项),本指标的排序信号稳健可用;本数据集不为拟合某一目标水平而反向挑选模型实例,使用时应侧重相对排序而非绝对水平。此外,专利摘要向量的语义表示采用掩码平均池化而非取分类位([CLS])向量,因未经句向量微调的 BERT 以平均池化度量语义相似度显著更优。 两个稳健口径的使用提醒。仅以发明专利计算的突破式创新($\mathrm{CBI}^{\text{Inv}}$)在企业—年度层面约有一成缺失(当年或前 5 年无发明专利所致),且缺失非随机、集中于专利较少的小企业与较早年份,用其作稳健性检验时样本会偏向大企业与近年,需在方法部分予以说明。规模化处理的突破式创新以企业全部年份(含后续年份)的均值为分母,属横截面可比性的标准化处理、并非动态时序变量,不宜作为具有前瞻性的预测变量使用;仅有单一年度观测的企业其规模化值恒等于 1。 样本年份提醒。受专利公开约 18 个月行政滞后与年度数据年中到位的共同影响,最近两个申请年度的专利数据不完整、会系统性压低当年专利数并扭曲突破式创新水平,因此样本申请年份上限取当前自然年的前二年(年份下限随数据、上下限均不作硬编码);即便如此,保留的最近一个年度仍可能不完整,稳健的做法是将研究窗口进一步截至专利公开较完整的年份。较早年份(如 2005 年以前)专利稀疏、参与计算的专利数很少,测度噪声较大,亦建议按需过滤。 参考文献 - 秦姣姣,郭爱芳.人数协同对企业突破式创新的影响研究:来自专利文本分析的证据[J/OL].科研管理,1-13[2026-07-24].https://link.cnki.net/urlid/11.1567.G3.20260527.1623.007. - 孙雅慧,时贷,彭飞,等.研发补贴与渐进式创新锁定:基于机器学习的专利文本分析[J].经济研究,2024,59(11):89-105. - Cui Y, Che W, Liu T, et al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021, 29: 3504-3514. - Devlin J, Chang M W, Lee K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: Association for Computational Linguistics, 2019: 4171-4186. - Reimers N, Gurevych I. Sentence-BERT: Sentence embeddings using Siamese BERT-networks[C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2019: 3982-3992.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。