企业生成式人工智能(专利识别法)
「企业生成式人工智能(专利识别法)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 28 个变量,样本量约 96,738。 企业生成式人工智能技术创新的专利测度。
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 28 |
| 样本量 | 96,738 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- GAIPatentCount [生成式人工智能专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入生成式人工智能专利分类体系的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- GAIBasicCount [生成式人工智能基础层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入生成式人工智能专利分类体系基础层(芯片基础设施、生成式人工智能基础算法)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- GAIModelCount [生成式人工智能模型层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入生成式人工智能专利分类体系模型层(生成模型架构、基础生成技术)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- GAIAppCount [生成式人工智能应用层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入生成式人工智能专利分类体系应用层(多模态感知与交互、多模态内容优化技术)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- TAIPatentCount [判别式人工智能专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入判别式(传统)人工智能专利分类体系的专利件数,同一专利被该体系多个子类同时命中时仅计一次。判别式人工智能亦称传统人工智能,用作生成式人工智能的对照体系
- TAIBasicCount [判别式人工智能基础层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入判别式(传统)人工智能专利分类体系基础层(芯片基础设施、判别式人工智能基础算法)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- TAIModelCount [判别式人工智能模型层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入判别式(传统)人工智能专利分类体系模型层(知识与模式识别技术)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- TAIAppCount [判别式人工智能应用层专利申请数] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的专利中,国际专利分类号(IPC)落入判别式(传统)人工智能专利分类体系应用层(语言与语音技术、计算机视觉技术、增强现实/虚拟现实与人机交互)的专利件数,同一专利被该体系多个子类同时命中时仅计一次
- GAI [企业生成式人工智能水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:生成式人工智能专利申请数加1后取自然对数,加1取对数用于处理专利数据的右偏分布。用作研究变量,越大代表企业在生成式人工智能领域的技术创新产出越多
- GAIBasic [生成式人工智能基础层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:生成式人工智能基础层专利申请数加1后取自然对数。用作研究变量,越大代表企业在芯片基础设施与基础算法层面的技术创新产出越多
- GAIModel [生成式人工智能模型层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:生成式人工智能模型层专利申请数加1后取自然对数。用作研究变量,越大代表企业在生成模型架构与基础生成技术层面的技术创新产出越多
- GAIApp [生成式人工智能应用层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:生成式人工智能应用层专利申请数加1后取自然对数。用作研究变量,越大代表企业在多模态感知交互与内容优化等场景应用层面的技术创新产出越多
- TAI [企业判别式人工智能水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:判别式人工智能专利申请数加1后取自然对数。用作对照研究变量,越大代表企业在传统人工智能领域的技术创新产出越多
- TAIBasic [判别式人工智能基础层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:判别式人工智能基础层专利申请数加1后取自然对数。用作对照研究变量,越大代表相应层级技术创新产出越多
- TAIModel [判别式人工智能模型层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:判别式人工智能模型层专利申请数加1后取自然对数。用作对照研究变量,越大代表相应层级技术创新产出越多
- TAIApp [判别式人工智能应用层创新水平] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,计算公式为:判别式人工智能应用层专利申请数加1后取自然对数。用作对照研究变量,越大代表相应层级技术创新产出越多
- IsGAI [是否申请生成式人工智能专利] — 参考杨超等 (2026, 数量经济技术经济研究)的方法,是否在当年申请了生成式人工智能相关专利(0=否,1=是),计算公式为:生成式人工智能专利申请数大于0时取1,否则取0。原文据此划分实验组与对照组进行倾向得分匹配
常见问题
- 「企业生成式人工智能(专利识别法)」是什么数据集?
- 企业生成式人工智能(专利识别法),隶属创新与知识产权。企业生成式人工智能技术创新的专利测度。
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 28 个变量。核心指标包括:生成式人工智能专利申请数、生成式人工智能基础层专利申请数、生成式人工智能模型层专利申请数、生成式人工智能应用层专利申请数、判别式人工智能专利申请数、判别式人工智能基础层专利申请数、判别式人工智能模型层专利申请数、判别式人工智能应用层专利申请数、企业生成式人工智能水平、生成式人工智能基础层创新水平、生成式人工智能模型层创新水平、生成式人工智能应用层创新水平、企业判别式人工智能水平、判别式人工智能基础层创新水平、判别式人工智能模型层创新水平、判别式人工智能应用层创新水平、是否申请生成式人工智能专利。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,738 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 生成式人工智能是以内容生成为核心特征的新一代人工智能技术,其技术内核由生成对抗网络、扩散模型、自回归模型与变分自编码器四类生成模型构成,在文本、图像、音频与视频等多个模态上展现出内容生成与编辑能力。相较于以判别、识别、分类为主要任务的传统人工智能(亦称判别式人工智能),生成式人工智能在跨模态数据融合、深度生成能力与算力需求等方面具有显著差异。企业在该领域的技术布局难以由问卷或单一关键词直接观测,而专利文献客观记录了企业的技术研发轨迹,并以国际专利分类号(IPC)提供了标准化、可重复检验的技术领域标签,因此成为测度企业生成式人工智能技术创新的适宜载体。 本指标参考杨超等(2026)的做法,以国家知识产权局《关键数字技术专利分类体系(2023)》中的人工智能分类为基础,针对生成式人工智能这一新兴前沿技术重新构建专利分类框架。该框架结合七国集团竞争力研究研讨会资料、国际知名技术服务提供商的技术架构以及中国人工智能行业应用建设发展参考架构,将生成式人工智能专利划分为基础层、模型层、应用层三个层级,下设六个类别、二十八个子类。基础层解决算力与基础算法问题,包含芯片基础设施(智能芯片、图形处理器、神经网络处理器、类脑芯片)与生成式人工智能基础算法(深度学习、强化学习、类脑智能计算、知识图谱、量子智能计算、迁移学习)两类;模型层是技术的核心创新层,包含生成模型架构(生成对抗网络、扩散模型、自回归模型、变分自编码器)与基础生成技术(图像生成、语音合成、文本生成)两类,前者侧重模型的结构设计与组织方式,后者是连接核心技术与实际应用场景的关键桥梁;应用层关注技术的场景转化与内容优化,包含多模态感知与交互(自然语言处理、机器翻译、语义理解、智能语音、计算机视觉、增强与虚拟现实、人机交互)与多模态内容优化技术(图像编辑与优化、文本编辑与优化、语音编辑与优化、多模态内容编辑与优化)两类。每个子类由一组 IPC 分类码界定。 识别规则为:企业当年申请的专利,其所涉及的 IPC 分类号只要落入上述分类体系,即将该专利计入统计。由于人工智能技术高度融合,同一技术成果往往同时涉及多个技术维度,分类体系中存在代码交叉重叠现象,因此在统计专利总量时进行去重处理,确保每项专利仅被计入一次。具体实现上,IPC 分类号按其层级结构解析为小类、大组与小组三级后再行匹配:以星号标注的模式按相应层级整体命中(如某小类下的全部大组,或某一大组下的全部小组),标注到小组的模式则按 IPC 子树语义匹配该小组及其下位小组;分类体系对同一含义兼用星号与主组零号两种写法,故以零号小组(形如某大组"/00")书写的条目按该大组整体处理,否则相应子类将因罕有专利恰好分类至主组本身而近乎无法命中。这一结构化匹配可正确区分同一小类下编号相近但含义不同的大组(如三号大组与三十号大组分属不同技术领域,分类体系同时列出二者)。 鉴于专利数据分布呈现显著的右偏特征,对专利总量加一后进行对数转换,得到核心指标: $$\mathrm{GAI}{i,t}=\ln\left(1+N^{GAI}{i,t}\right)$$ 其中 $N^{GAI}{i,t}$ 为企业 $i$ 在第 $t$ 年申请的、经去重后落入生成式人工智能专利分类体系的专利件数,年度以专利申请年度为准。按同一公式分别限定于基础层、模型层与应用层,可得三个分层指标 $\mathrm{GAIBasic}$、$\mathrm{GAIModel}$ 与 $\mathrm{GAIApp}$,用于刻画企业技术布局的层级结构。此外另设二元指标,标识企业当年是否申请了生成式人工智能相关专利,可用于按是否应用该技术划分实验组与对照组。 为比较生成式人工智能与传统人工智能的系统性差异,本指标同时按同构方式构建了判别式人工智能专利分类体系并计算对照变量。该体系同样分为基础层(芯片基础设施、判别式人工智能基础算法)、模型层(知识与模式识别技术)与应用层(语言与语音技术、计算机视觉技术、增强现实/虚拟现实与人机交互),下设六类三十三个子类,涵盖传统机器学习、群体智能、混合智能、模式识别、生物特征识别(指纹、人脸、虹膜、声纹、DNA、行为特征)等技术方向。对照变量 $\mathrm{TAI}$ 及其三个分层指标的计算方式与生成式人工智能完全一致。 专利归属以上市公司本体作为申请人为准;一项专利由多家上市公司联合申请时,分别计入各参与公司,同一专利对同一公司只计一次。指标覆盖全部 A 股上市公司的公司—年度面板,当年没有落入分类体系的专利即取零值,该零值表示当年未申请相关专利,而非数据缺失。 补充说明 - 样本口径:本指标不预先剔除金融业、特殊处理股或高杠杆样本,亦未做缩尾处理,以便使用者按各自研究设计自行施加限制。面板中包含公司上市之前的年份,与财务数据匹配时建议先按上市日期裁剪。分类体系对金融机构的信息技术类专利同样适用,该行业在指标高值端占比较为突出,涉及全行业样本的研究建议按惯例考虑是否剔除金融业,或至少加入行业固定效应。 - 分类体系的覆盖广度:原分类体系以 IPC 小类为基本单位界定子类,基础层的"强化学习""量子智能计算"与"智能芯片"等子类各自覆盖了电数字数据处理、数据识别、基于特定计算模型的计算装置、图像数据处理、专用数据处理、半导体器件与印刷电路等整个小类。因此命中范围实际涵盖广义的信息技术与电子制造类专利,宽于"生成式人工智能"的字面含义,命中主要由通用计算与数据处理类小类驱动,而非专门对应机器学习的小类。使用者若需更聚焦的口径,可结合本指标提供的分层计数自行构造子集。 - 分层的重叠性:三个层级由各自子类的 IPC 集合界定,彼此高度交叉重叠。其中基础层的 IPC 并集已覆盖总量所依据的全部小类,故基础层在多数情形下与总量一致,模型层与应用层之间亦高度相关。三个分层指标宜单独使用,不宜并列进入同一回归。 - 对照体系的包含关系:判别式人工智能体系的 IPC 并集严格包含生成式人工智能体系的并集(前者另含"群体智能"子类,覆盖机器人、导航、控制与通信等多个小类),因此对照变量在数值上恒不小于核心变量,二者相关程度很高。该对照变量宜作为替代被解释变量分别估计,不宜与核心变量同时作为解释变量进入同一模型。 - 归属口径:原文未界定专利归属是否包含控股子公司,本指标经与原文公开统计量比对后采用仅计上市公司本体申请的口径。相当比例的企业年存在"集团有专利活动但均由子公司申请"的情形,这些企业年因而取零值;且由子公司申请的比重在样本期内呈下降趋势,指标的时间上升趋势中包含一部分归属口径变动的影响。使用双向固定效应时建议关注这一点,必要时可与采用合并口径的专利指标交叉验证。 - 其他局限:专利自申请至公开存在约十八个月的滞后,最近一至两个申请年度的专利尚未完全公开,相应年份的计数偏低,作水平或趋势解读的研究建议将样本期适当提前。分类体系依据 IPC 分类号而非专利文本,纳入的实用新型在中国专利法下仅保护产品的形状与构造、不保护方法与算法,需要更严格创新质量口径的研究可结合专利类型自行筛选。本指标测度的是专利产出侧的技术布局,与基于年报文本披露的同名概念测度反映同一构念的不同侧面,两者相关性有限,宜按研究问题择一使用。 参考文献 - 杨超,高文岭,常帅文.生成式人工智能技术如何影响企业全要素生产率——基于技术专利分类系统的创新测度[J].数量经济技术经济研究,2026,43(6):110-136.DOI:10.13653/j.cnki.jqte.20260609.008.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。