企业人工智能创新(SBERT模型测度)
「企业人工智能创新(SBERT模型测度)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 74,870。 以SBERT架构的中文句向量模型对企业人工智能发明专利摘要作语义表征,用其与前三年历史技术语料的平均语义相似度衡量单项专利的原创程度,再以各专利创新度为权重加权
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 21 |
| 样本量 | 74,870 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- InventionPatentCount [发明专利申请量] — 企业当年申请的发明专利件数,统计范围为上市公司本体及其控股子公司;一件专利由多家上市主体共同申请时同时计入各相关公司
- AIPatentCount [人工智能发明专利申请量] — 参考叶阳平等 (2025, 中国工业经济)的方法,指企业当年申请的发明专利中属于人工智能技术领域的件数。人工智能技术领域按国际专利分类号界定,取世界知识产权组织人工智能专利索引、战略性新兴产业分类与国际专利分类参照关系表、关键数字技术专利分类体系三份文件中至少两份共同认定的分类号集合。该集合按官方文件原样采用,其中含利用特定材料的化学分析大组,故医药生物企业的抗体与检测类专利亦会计入
- AIPatentRatio [人工智能发明专利占比] — 计算公式为:企业当年人工智能发明专利件数除以当年发明专利总件数,企业当年无发明专利时为空值
- HistCorpusSize [历史技术语料规模] — 参考王艳和张宁 (2026, 工业技术经济)的方法,指衡量专利原创性时所用历史技术语料的专利件数,计算公式为:申请年份落在当年之前三年内的发明专利总件数。同一年度内所有企业取值相同
- AvgBackwardSimilarity [平均后向语义相似度] — 参考王艳和张宁 (2026, 工业技术经济)的方法,计算公式为:先求企业当年每项人工智能发明专利摘要的语义向量与前三年历史技术语料中全部发明专利语义向量的余弦相似度均值,再在企业当年各项专利间取算术平均。数值越小说明专利技术内容偏离既有技术积累越远。企业当年无人工智能发明专利时为空值
- AIInnovation [企业人工智能创新] — 参考王艳和张宁 (2026, 工业技术经济)的方法,计算公式为:先对每项人工智能发明专利计算创新度INNO=ln(1/(该专利与前三年历史技术语料的平均语义相似度+0.1)),再以各专利创新度自身为权重加权聚合到企业当年,即各专利创新度的平方和除以创新度之和;企业当年无人工智能发明专利时取0。用作研究变量,越大代表企业人工智能技术创新的原创性水平越高
- HasAIPatent [是否拥有人工智能发明专利] — 是否拥有人工智能发明专利(0=否,1=是),指企业当年是否申请过属于人工智能技术领域的发明专利
- AIInnovationMean [人工智能创新(算术平均口径)] — 企业人工智能创新的替代聚合口径,计算公式为:企业当年各项人工智能发明专利创新度的算术平均值;企业当年无人工智能发明专利时取0。用作稳健性检验变量,用于检验加权方式对结论的影响
- AIInnovationW5 [人工智能创新(五年语料窗口)] — 企业人工智能创新的替代口径,计算公式为:将历史技术语料窗口由前三年放宽至前五年后,按主口径同样方式计算;企业当年无人工智能发明专利时取0。用作稳健性检验变量,用于检验语料窗口长度对结论的影响。因技术语料的整体语义结构随时间变动极小,该口径与主口径高度共线,宜单独替换使用而非与主口径同时进入回归
- AIInnovationParent [人工智能创新(仅母公司口径)] — 企业人工智能创新的替代口径,计算公式为:仅统计上市公司本体(不含控股子公司)申请的人工智能发明专利后,按主口径同样方式计算;无相应专利时取0。用作稳健性检验变量,用于检验专利归属范围对结论的影响
常见问题
- 「企业人工智能创新(SBERT模型测度)」是什么数据集?
- 企业人工智能创新(SBERT模型测度),隶属创新与知识产权。以SBERT架构的中文句向量模型对企业人工智能发明专利摘要作语义表征,用其与前三年历史技术语料的平均语义相似度衡量单项专利的原创程度,再以各专利创新度为权重加权
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 21 个变量。核心指标包括:发明专利申请量、人工智能发明专利申请量、人工智能发明专利占比、历史技术语料规模、平均后向语义相似度、企业人工智能创新、是否拥有人工智能发明专利、人工智能创新(算术平均口径)、人工智能创新(五年语料窗口)、人工智能创新(仅母公司口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 74,870 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业人工智能创新刻画的是企业在人工智能技术领域所产出发明专利的原创性水平。其判断逻辑是:一项专利若在技术内容上与此前一段时期的技术积累高度雷同,则更接近对既有技术轨道的沿袭;反之,若其技术内容显著偏离既有积累,则更可能构成原创性的技术突破。据此,本指标先以专利文本与历史技术语料之间的语义距离度量单项专利的创新程度,再汇总至企业层面。 在语义表征环节,采用 SBERT 架构下的中文句向量模型 BAAI/bge-large-zh-v1.5,将每项发明专利的中文摘要编码为一个 1024 维向量。向量经 L2 归一化后,两项专利向量的内积即为二者的余弦相似度 $\rho$,取值越大表示两项专利在技术内容上越接近。 在单项专利层面,设专利 $j$ 的申请年份为 $t$,令 $It$ 为申请年份落在 $[t-3,\ t-1]$ 区间内的全部发明专利集合,即该专利所面对的"过去三年历史技术语料",$N{It}$ 为该集合所含专利件数。专利 $j$ 的创新度定义为其与历史技术语料平均语义相似度的倒数取自然对数: $$INNO{j}=\ln\left(\frac{1}{\dfrac{\sum{k\in I{t}}\rho{jk}}{N{I{t}}}+0.1}\right)$$ 分母中的 $0.1$ 是为防止平均相似度趋近于零时取倒数发散而设置的调整项。平均相似度越低,说明该专利与既有技术积累的差异越大,$INNOj$ 相应越高。 这里有一处可利用的代数性质:由于全部专利向量均已归一化,"与语料中每一项专利逐一求余弦相似度再取算术平均"恒等于"与该语料的质心向量做一次内积"。因此上式无需展开两两相似度矩阵即可精确求得,二者是恒等关系而非近似,这使得在百万量级的语料上做精确计算成为可能。 人工智能专利的界定依据国际专利分类号。参考已有研究结合三份官方文件界定人工智能技术分类号集合的做法,本指标取世界知识产权组织人工智能专利索引、《战略性新兴产业分类与国际专利分类参照关系表》与《关键数字技术专利分类体系》三份文件中至少两份共同认定的分类号,凡分类号命中该集合的发明专利即视为人工智能专利。之所以采用"至少两份共同认定"而非三份取并集,是因为三份文件的收录范围宽窄不一,其中单份文件即已列入若干整个分类小类,取并集会使人工智能专利在发明专利中的占比成倍膨胀;取两份以上的共识部分,所得口径与提出该界定的研究所报告的统计特征相吻合。 在企业层面,以各专利创新度自身为权重,对企业当年全部人工智能发明专利加权聚合,得到企业人工智能创新水平: $$AIINNO{it}=\frac{\sum{j}INNO{j}^{2}}{\sum{j}INNO{j}}$$ 该加权方式使创新度更高的专利在企业指标中占据更大比重。企业当年未申请人工智能发明专利的,指标取 0。 专利的企业归属采用合并报表口径,即计入上市公司本体及其控股子公司申请的专利,联营与合营企业因不纳入合并报表范围而不计入。原始专利记录中,一件专利可能由多家上市主体共同申请,此时按申请主体与各上市公司的关系逐一拆分,同时计入各相关公司。 除主口径外,另提供三个稳健性口径以便使用者检验关键设定的影响:将自加权聚合替换为算术平均聚合、将历史技术语料窗口由前三年放宽至前五年、以及将专利归属收紧至仅上市公司本体。三者的计算流程与主口径完全一致,仅在相应设定上作单一替换。 补充说明 - 样本口径:数据集为全部 A 股上市公司的企业-年度面板,未剔除金融业与 ST 企业,也未对连续变量作缩尾处理。使用者可按各自研究设计自行施加样本限制。 - 语料范围:历史技术语料由上市公司体系内的发明专利构成,其覆盖范围小于全国专利总体。语料范围越集中,专利与语料质心的平均相似度越高,因而本指标的绝对水平低于以全国专利为语料的研究所报告的水平。该差异对全部企业同向作用,企业间相对排序与年度可比性不受影响。 - 起始年份:指标要求前三年历史语料达到一定规模方能保证质心估计稳定,故起始年份由语料规模门槛动态确定,早于该年份的企业-年度不进入数据集。 - 指标性质:本指标度量的是专利文本相对既有技术的语义独特性,而非技术的经济价值或市场影响。句向量的相似度尺度依赖于所用模型,改用其他嵌入模型会改变指标的绝对水平,故不宜将其数值与采用不同模型的研究直接对照。 - 语料窗口口径的用法:全市场技术语料的整体语义结构随时间变动极小,因此放宽语料窗口对指标的影响很有限,五年窗口口径与主口径高度共线。该口径的作用是佐证窗口长度不改变结论,宜作为替换变量单独使用,不宜与主口径同时进入同一回归。 - 生物检测类专利的归入:所依据的官方文件把"利用特定材料的化学分析"这一分类大组(涵盖免疫测定、蛋白质分析、肿瘤标志物与单克隆抗体等)收录在人工智能相关分类号之中,因此医药生物企业的抗体与检测类专利会被计入人工智能专利。这类专利的文本以生物化学语言为主,与以机电信息为主的技术语料语义距离天然更远,在创新度分布的高位段所占比重明显高于其在全部人工智能专利中的比重。本数据集未对该分类号作人为剔除,以保持与官方文件界定及本库其他人工智能专利指标的一致;研究对象涉及医药生物行业时,建议控制行业固定效应,或对分布高位段作稳健性检验。 - 文本处理:摘要缺失或不足十字的专利不参与计算;句向量模型的输入长度上限设为 384 个 token,专利摘要长度的九成分位在其之内,少数超长摘要的尾部内容不进入向量表征。 - 其他局限:专利自申请至公开存在法定滞后,最末一个年度可见的专利量低于该年真实申请量,计数类字段在该年偏低;分类号口径只能识别专利的技术领域归属,无法区分同一领域内专利的技术深度。 参考文献 - 王艳,张宁.人工智能创新对出口企业韧性的影响研究——来自大语言模型的证据[J].工业技术经济,2026,45(8):100-112. - 李政,刘琦,张鲁瑶.人工智能创新如何降低供应链中断风险[J].中国流通经济,2025,39(12):58-76. - 叶阳平,马文聪,吴小节,等.人工智能与产业技术融合对制造业企业产品创新绩效的影响研究[J].中国工业经济,2025(11):150-168.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。