企业颠覆性技术创新(SBERT专利网络双向识别)
「企业颠覆性技术创新(SBERT专利网络双向识别)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 74,740。 基于专利引用网络与专利摘要语义嵌入测度的企业颠覆性技术创新。
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 74,740 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- InventionPatentCount [发明专利申请数] — 企业当年申请的发明专利件数,计算公式为:按企业与专利申请年度统计的发明专利按申请号去重后的件数,不含实用新型与外观设计
- ScoredPatentCount [可测算专利数] — 参考黄先海等 (2024, 中国工业经济)的方法,计算公式为:企业当年发明专利中同时算得专利创新度与三年窗口被引次数、从而进入双向识别的件数。创新度要求该专利至少有一件可获取中文摘要的在先被引发明专利,故该数小于发明专利申请数
- BreakthroughPatentCount [突破性技术创新专利数] — 参考黄先海等 (2024, 中国工业经济)的方法,计算公式为:企业当年可测算专利中,专利创新度在同一申请年份同一行业分组内百分位排名位于前20%的件数。专利创新度为该专利与其全部在先被引专利摘要句向量平均余弦相似度的倒数取自然对数,数值越大表示对既有技术路径的语义重复越低
- ImpactPatentCount [重要影响力技术创新专利数] — 参考黄先海等 (2024, 中国工业经济)的方法,计算公式为:企业当年可测算专利中,自专利公开之日起三年窗口内被后续专利引用的次数在同一申请年份同一行业分组内百分位排名位于前20%的件数。被引计数在中国专利全样本引用网络上完成,后续专利按申请号去重
- DTCount [颠覆性技术创新专利数] — 参考黄先海等 (2024, 中国工业经济)的方法,计算公式为:企业当年同时满足突破性技术创新与重要影响力技术创新两个条件的发明专利件数,即两个单维度识别结果的交集。用作研究变量,越大代表企业当年在技术轨迹突破与后续技术影响力两个方向上同时领先的专利越多
- IsDT [是否实现颠覆性技术创新] — 参考黄先海等 (2024, 中国工业经济)的方法,是否实现颠覆性技术创新(0=否,1=是),计算公式为:企业当年颠覆性技术创新专利数大于零时取1,否则取0。用作研究变量,取1代表企业当年实现了颠覆性技术创新
- DT [颠覆性技术创新] — 参考黄先海等 (2024, 中国工业经济)的方法,计算公式为:企业当年颠覆性技术创新专利数的自然对数,专利数为零时取零。用作研究变量,越大代表企业当年实现的颠覆性技术创新在数量上越多
- CitationWindowCompleteRatio [三年被引窗口完整专利占比] — 计算公式为:企业当年公开年份加三年不晚于引用数据成熟年的发明专利件数,除以当年发明专利总件数;当年无发明专利申请时取1。引用数据成熟年由引用方公开年的年度边数分布动态推导,取边数达到峰值年九成的最大年份。用于判断被引窗口的闭合程度,取值越大代表当年专利的三年被引窗口越完整
常见问题
- 「企业颠覆性技术创新(SBERT专利网络双向识别)」是什么数据集?
- 企业颠覆性技术创新(SBERT专利网络双向识别),隶属创新与知识产权。基于专利引用网络与专利摘要语义嵌入测度的企业颠覆性技术创新。
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:发明专利申请数、可测算专利数、突破性技术创新专利数、重要影响力技术创新专利数、颠覆性技术创新专利数、是否实现颠覆性技术创新、颠覆性技术创新、三年被引窗口完整专利占比。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 74,740 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 颠覆性技术创新不同于一般意义上的突破式创新或渐进式创新,它在技术演化路径上具有"双向性"特质:一方面要对既有技术轨迹形成实质性突破,不是沿已有路线的重述与微调;另一方面要对后续技术的发展方向产生足以改变路径的影响力。只在单一方向上领先的专利——比如文本上足够新颖却无人跟进,或被大量引用却只是既有技术的常规延伸——都不构成颠覆。本指标据此把每一件专利放进专利引用网络中当作一个技术节点,分别向前看它引用了哪些在先技术、向后看哪些后续技术引用了它,只有在两个方向上同时处于领先位置的专利才被识别为颠覆性技术创新。 专利网络与节点口径。 对任一中心专利 $Pn$,其前向专利集合 $Pf$ 指该专利在申请文件中引用的在先技术,后向专利集合 $Pb$ 指后续引用了该中心专利的专利。研究对象限定为上市公司的发明专利,实用新型与外观设计因技术含量与文本规范程度均不足而不纳入。由于同一件发明在公开阶段与授权阶段会产生不同的公开号,若按公开号计数会把一件发明拆成多件、把指向同一发明的引用拆成多条,因此全流程以申请号作为网络节点,一件发明的全部公开号版本归并为一个节点。 向前看:基于文本语义的创新度。 判断一件专利是否突破既有技术,关键在于它与自己所引用的在先技术之间的语义距离。本指标用面向中文语义匹配训练的 SBERT 句向量模型对专利摘要进行编码,把每份摘要表示为一个 768 维向量并做 L2 归一化,向量间的余弦相似度即刻画两件专利在技术内容上的接近程度。在此基础上,中心专利的创新度定义为它与全部前向专利平均语义相似度的倒数取自然对数: $$\mathrm{Innov}n=\ln\!\left(\frac{N{Pf}}{\sum{f\in Pf}\rho{nf}}\right),\qquad \rho{nf}=\cos\!\left(en,\,ef\right)$$ 其中 $en$ 与 $ef$ 分别是中心专利与前向专利 $f$ 的摘要句向量,$N{Pf}$ 为参与计算的前向专利件数。平均相似度越低,说明该专利对其所依赖的既有技术重复程度越低,对现有技术路径的创新价值越高,$\mathrm{Innov}n$ 取值越大。只有至少存在一件可用前向专利、且相似度之和为正时该值才有定义。 向后看:窗口期内的技术影响力。 一件专利对后续技术沿革的影响力由固定窗口期内的被引次数度量。窗口取中心专利公开之日起的三年,落在该窗口内的后续专利按申请号去重后计数,中心专利自身不计入;后续专利存在多个公开号版本时以其最早公开日判断是否落入窗口。之所以采用固定窗口而非累计被引,是因为不同年份的专利距今可被引用的时长本就不同,累计被引会系统性地偏向更早的专利;固定窗口使不同申请年份的专利处在可比的观察时长上。被引计数在中国专利的全样本引用网络上完成,而不只统计上市公司之间的相互引用。 双向识别与企业层加总。 创新度与窗口期被引次数分别刻画两个方向上的位置,但两者的绝对水平会随技术领域与年份系统性变化——某些领域引用本就密集,某些年份的文本表述风格本就相近。因此识别不使用绝对阈值,而是在同一申请年份、同一行业的分组内做相对比较:对同时算得两个指标的专利分别计算两个维度的百分位排名,排名进入前 20% 者依次记为突破性技术创新与重要影响力技术创新,两者的交集即为颠覆性技术创新专利。被引次数本质上是离散计数,大量专利取值相同,故百分位采用平均法秩使并列样本得到连续化的排名。分组内可测算专利过少或行业信息缺失时,退回到该申请年份的全样本分组,以保证排名的统计意义。行业采用中国上市公司协会分类并按年动态匹配,以反映企业历史上的行业变更。 企业层面按 $(\text{企业},\ \text{申请年份})$ 加总:当年被识别为颠覆性技术创新的专利件数记为 $\mathrm{DTCount}$,据此构造两个研究变量——是否实现颠覆性技术创新的虚拟变量 $\mathrm{IsDT}=\mathbf{1}(\mathrm{DTCount}0)$,以及颠覆性技术创新数量的自然对数 $\mathrm{DT}=\ln(\mathrm{DTCount})$(数量为零时取零)。前者刻画企业能否实现颠覆性突破这一离散事件,后者刻画突破的强度。与之配套给出当年发明专利申请数、可测算专利数,以及突破性与重要影响力两个单维度的专利件数,便于使用者区分企业究竟是在哪一个方向上受限,也便于以发明专利申请数为分母做强度上的标准化。 补充说明 - 变量选用与年份区间(使用前必读):专利被著录引用需要时间,最近若干个申请年份中能够进入双向识别的专利比重会急剧下降,被留下的是引用记录最早出现的那一部分,并非随机子集;同期"重要影响力"一维的入选门槛也会退化到"是否被引用过一次"。因此跨年度的水平比较与趋势分析应限定在被引窗口已基本闭合的年份,CitationWindowCompleteRatio 给出企业当年专利中窗口完整者的占比,可据此判断各年份的成熟度并选择样本区间。另需注意 DT 由专利件数取自然对数得到,件数为一与件数为零同样取零,若研究关心"是否实现突破"这一边际,应改用 DTCount 或 IsDT。 - 样本口径:面板覆盖上市公司全行业、全板块,不预先剔除金融保险业、ST 类企业,也不对连续变量做缩尾;这些属于回归样本的设定,建议结合自身识别策略自行施加,并加入行业与年份固定效应。面板还包含企业上市之前的年份,其专利来自日后上市的主体及其关联方,行业标签由轨迹表最近可得年份回填并同样进入当年排名池;与财务数据合并时这部分通常会脱落,实际可用样本小于总行数。 - 创新度的比较对象与比较基数:原始方法说明的公式排印中求和下标写的是后向专利集合,但同一节文字三处均明确为"与其所有前向专利"计算相似度、"对其所有前向专利的重复度较低",正文亦界定突破性基于前向专利、影响力基于后向专利,故本实现按文字口径执行。需要提示的是,中国专利的后向引用条目数普遍不多,相当比例的专利只有少数几件在先技术可供比对,此时创新度由少量比较得出,个体取值的随机波动较大;专利数较多的企业在年度加总后这一波动大体相互抵消。此外较短的摘要与任何文本的余弦相似度都偏低,在专利层面会略微抬高其创新度,聚合到企业—年度后该影响基本消失。 - 前向专利与被引网络的三个边界:其一,创新度依赖中文摘要,只有中国发明专利可进入前向专利集合,指向境外专利的引用不参与相似度计算;原始方法同样以中文专利文本为基础。其二,中国实用新型不作实质审查、不产生审查员引用记录,引用方一侧实际全部为发明专利,以实用新型为主要引用来源的领域(机械、低技术制造)被引水平偏低。其三,窗口期被引次数按原始方法的字面口径统计全部引用而不剔除自引,自引占比随企业专利规模上升,研究企业规模与创新质量的关系时应注意这一机械关联。三者均为同类数据的固有特征,且因识别采用组内相对排名,同组样本共同承受,对排序的影响小于对水平值的影响。 - 分组基准的选择:原始方法表述为"同一申请年份同一行业企业的专利",故分组取企业所属行业而非专利技术领域;行业分类在分组时按制造业取前两位、非制造业取首字母合并为大类,电子信息类所在的一类容纳了相当大比重的专利。若改以专利技术分类号分组,相当比例的个体判定会改变,而企业—年度层面的秩相关仍然较高。关心技术领域内相对位置的研究需自行按该口径重算。 - 两个维度的实测关系:文本新颖度与被引影响力在数据中呈弱负相关——与既有技术语义距离更远的专利,往往不是被引最多的那一批。因此交集比两维独立时的预期更小,这正是"双向识别"比任一单维都严格的来源;原始研究报告的识别率同样显著低于独立假设下的理论值,两者在这一点上一致。使用者据此应把该指标理解为"两个方向上同时进入前列"的严格筛选结果,而非任一单维强度的替代。 - 联合申请的归属:多家上市公司联合申请的专利,在企业层面被每一个申请方各计入一次,因此各企业专利计数之和大于专利实际件数。这与本平台专利年度面板的拆分口径一致,便于与同库其他专利指标直接合并。识别仍在专利层面做单一判定,分组所用行业取主申请方的行业。 - 模型与实现:原始方法说明公开了模型类型与训练语料而未公开具体权重,本实现采用同一类公开可得的中文语义匹配 SBERT 权重。余弦相似度的绝对水平会随权重不同而整体平移,但识别基于组内相对排名,该平移不改变排序。句向量以半精度存储,其数值误差远小于相似度本身的组内离散程度。 - 其他局限:没有可用前向专利的专利无法算得创新度,不进入双向识别;企业当年若无发明专利申请,各计数列取零。 参考文献 - 黄先海,孙涌铭,陈梦涛.企业数字化转型与颠覆性技术创新——来自专利网络与SBERT模型的微观证据[J].中国工业经济,2024,(10):137-154. - Funk R J, Owen-Smith J. A dynamic network measure of technological change[J]. Management Science, 2017, 63(3): 791-817. - Reimers N, Gurevych I. Sentence-BERT: Sentence embeddings using Siamese BERT-networks[C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). Hong Kong: Association for Computational Linguistics, 2019: 3982-3992.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。