企业生成式人工智能(76词生成式AI词典)

「企业生成式人工智能(76词生成式AI词典)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,245。 基于上市公司年报全文统计生成式人工智能特征词词频,参考乔朋华等(2025)方法构建企业生成式人工智能水平(ln词频+1)。

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数19
样本量67,245
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • Freq_Concept [概念基础层词频] — 参考乔朋华等(2025,科学学与科学技术管理)的方法,计算公式为:年报全文中概念基础层生成式人工智能关键词(生成式人工智能、大语言模型、AIGC、预训练模型等)的出现次数,采用Aho-Corasick最长匹配并对英文缩写施加单词边界守卫去重
  • Freq_Technology [主要技术层词频] — 参考乔朋华等(2025,科学学与科学技术管理)的方法,计算公式为:年报全文中主要技术层关键词(自然语言处理、知识图谱、生成对抗网络、扩散模型、Transformer架构等)的出现次数
  • Freq_ModelEco [模型生态层词频] — 参考乔朋华等(2025,科学学与科学技术管理)的方法,计算公式为:年报全文中模型生态层关键词(GPT、ChatGPT、文心一言、通义千问、盘古大模型等)的出现次数
  • FreqTotal [生成式人工智能特征词总词频] — 参考乔朋华等(2025,科学学与科学技术管理)的方法,计算公式为:概念基础层、主要技术层、模型生态层三维度生成式人工智能特征词频之和,即Gen_AI指标的计算分子
  • TotalChars [年报中文字符数] — 年报正文中文字符总数,用作生成式人工智能词频占比的分母及稀疏度参考
  • GenAILevel [企业生成式人工智能水平] — 参考乔朋华等(2025,科学学与科学技术管理)的方法,计算公式为:ln(生成式人工智能特征词总词频+1)。用作研究变量,越大代表企业生成式人工智能应用水平越高
  • IsGenAI [是否应用生成式人工智能] — 是否在当年年报中出现生成式人工智能关键词(0=否,1=是),参考乔朋华等(2025,科学学与科学技术管理)稳健性检验Gen_AI01分指数的二值化思想
  • GenAIRatio [生成式人工智能词频占比] — 参考乔朋华等(2025,科学学与科学技术管理)的方法构建的稳健性替代度量,计算公式为:生成式人工智能特征词总词频除以年报中文字符数。用作研究变量,越大代表生成式人工智能在年报中的相对披露强度越高

常见问题

「企业生成式人工智能(76词生成式AI词典)」是什么数据集?
企业生成式人工智能(76词生成式AI词典),隶属数字化转型与人工智能。基于上市公司年报全文统计生成式人工智能特征词词频,参考乔朋华等(2025)方法构建企业生成式人工智能水平(ln词频+1)。
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:概念基础层词频、主要技术层词频、模型生态层词频、生成式人工智能特征词总词频、年报中文字符数、企业生成式人工智能水平、是否应用生成式人工智能、生成式人工智能词频占比。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,245 条观测。
数据是如何测算/获取的?
指标定义与计算方法 生成式人工智能作为新一代通用目的技术,凭借自适应性、并行性与多模态协同等特征,正深刻重塑企业的资源配置与动态决策方式。借鉴乔朋华等(2025)的做法,本数据集以上市公司年度报告全文为语料,通过文本分析法度量企业层面的生成式人工智能应用水平。 构建生成式人工智能特征词库时,从概念基础层、主要技术层与模型生态层三个维度组织关键词:概念基础层涵盖生成式人工智能、大语言模型、AIGC、预训练模型等基础概念;主要技术层涵盖自然语言处理、知识图谱、生成对抗网络、扩散模型、Transformer 架构等核心技术;模型生态层涵盖 GPT、ChatGPT、文心一言、通义千问、盘古大模型等代表性模型与框架。词库共含 76 个唯一关键词。 在统计实现上,采用 Aho-Corasick 多模式匹配算法对年报全文进行单次扫描,对存在子串包含关系的关键词执行最长匹配去重,并对英文缩写施加单词边界守卫,避免其作为更长英文单词的内部片段被误计。设企业 $i$ 第 $t$ 年年报中三个维度的特征词命中次数分别为 $f^{c}{i,t}$、$f^{tech}{i,t}$、$f^{model}{i,t}$,则特征词总频为 $$ FreqTotal{i,t} = f^{c}{i,t} + f^{tech}{i,t} + f^{model}{i,t} $$ 企业生成式人工智能水平在此基础上对总词频加一取自然对数: $$ GenAILevel{i,t} = \ln\left(FreqTotal{i,t} + 1\right) $$ 该指标越大,表明企业在年报中披露的生成式人工智能相关内容越丰富,应用与布局水平越高。 为便于稳健性分析,另提供两个替代度量。其一为二值化的应用哑变量 $IsGenAI{i,t}$,当企业当年年报出现任一生成式人工智能特征词时取 1,否则取 0,对应原始研究中以"是否出现关键词"构建的分指数思想。其二为以年报中文字符数 $TotalChars{i,t}$ 标准化的词频占比 $$ GenAIRatio{i,t} = \frac{FreqTotal{i,t}}{TotalChars{i,t}} $$ 用以剔除年报篇幅差异对绝对词频的影响。三个维度的词频亦作为中间变量一并保留,以支持机制分析与口径追溯。 补充说明 样本覆盖全部 A 股上市公司及年报可得的全部年度,未限定于特定行业或年份区间。由于生成式人工智能属新近兴起的技术概念,2017 年(Transformer 架构问世)之前的命中极少,相应年份的指标接近于零,属构念的固有时间特征。为剔除解析失败与残缺截断的报告,对年报正文中文字符数低于 5000 的观测予以剔除。 需特别提示三项使用局限。第一,所采用的关键词表忠实保留了原始研究词库中的全部条目(仅更正其中文心一言模型缩写在原文中误拼为 ERINE、应为 ERNIE 的笔误),其中部分英文裸缩写在中文年报语境下存在同形异义或子串误命中:例如 GAN 多指氮化镓(GaN,半导体材料)而非生成对抗网络,T5 多指荧光灯管型号,"流模型"多源于"贴现现金流模型"的子串,Catalyst 多指催化剂,Vit 多指维生素,另有若干被识别为公司名称、广告术语或设备型号缩写的情形。经全样本核验,此类误命中词约占全部特征词频的 34.8%,并使约 54.8% 的 $IsGenAI=1$ 观测属误命中假阳性——剔除该类词后,真实的应用比率约为 5.2%,而非含误命中口径下的 11.5%。因此 $IsGenAI$ 不宜直接解读为真实的生成式人工智能渗透率,连续指标在受影响公司年亦整体偏高;建议研究者结合年份(2017 年之后构念更为可信)、利用所保留的三维度词频明细进行追溯,必要时自行剔除上述词条。第二,$IsGenAI$ 基于年报全文构建(对应主口径),与以管理层讨论与分析部分构建的分指数口径略有差异。第三,地理与行业标识字段对北京证券交易所、B 股及退市股存在结构性缺失(约 1798 个观测),在以省份、城市或行业作为固定效应或控制变量的回归中会系统性剔除这些样本,但核心词频字段不受影响。 参考文献 - 乔朋华, 杜鑫, 韩先锋. 生成式人工智能如何提升制造业企业韧性?[J/OL]. 科学学与科学技术管理, 1-22[2026-06-10]. https://doi.org/10.20201/j.cnki.ssstm.20250827.001. - 陈楠, 蔡跃洲. 人工智能技术创新与区域经济协调发展——基于专利数据的技术发展状况及区域影响分析[J]. 经济与管理研究, 2023, 44(3): 16-40. - Yang J, Jin H, Tang R, et al. Harnessing the power of LLMs in practice: A survey on ChatGPT and beyond[J]. ACM Transactions on Knowledge Discovery from Data, 2024, 18(6): 160:1-160:32.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。