人工智能水平(词频法)

「人工智能水平(词频法)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 67,311。 衡量企业人工智能技术的应用与关注程度。

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数17
样本量67,311
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • Lnwords [人工智能水平-全文] — 参考姚加权等(2024, 管理世界)的方法,计算公式为:ln(年报全文中73个AI关键词的词频总和+1),用作研究变量,越大代表企业人工智能应用水平越高
  • LnwordsMDA [人工智能水平-MDA] — 参考姚加权等(2024, 管理世界)的方法,计算公式为:ln(管理层讨论与分析章节中73个AI关键词的词频总和+1),作为人工智能水平-全文的稳健性检验指标
  • FreqTotal [AI关键词总词频-全文] — 年报全文中73个人工智能关键词的匹配总次数(最长匹配去重)。单位:次
  • FreqMDA [AI关键词总词频-MDA] — 管理层讨论与分析章节中73个人工智能关键词的匹配总次数(最长匹配去重)。单位:次
  • TotalChars [年报总字符数] — 年报全文中文字符总数,可用于构建词频占比等标准化指标。单位:个
  • MDAExtracted [MDA提取标志] — 是否成功提取管理层讨论与分析章节(0=否,1=是),MDA提取标志=0时人工智能水平-MDA基于全文计算

常见问题

「人工智能水平(词频法)」是什么数据集?
人工智能水平(词频法),隶属数字化转型与人工智能。衡量企业人工智能技术的应用与关注程度。
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:人工智能水平-全文、人工智能水平-MDA、AI关键词总词频-全文、AI关键词总词频-MDA、年报总字符数、MDA提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,311 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在度量中国上市企业的人工智能应用水平,其核心方法参考了姚加权等(2024)的研究。该方法认为,企业在年度报告(以下简称“年报”)文本中提及人工智能相关关键词的频率,能够有效反映其在生产经营中对人工智能技术的关注、投入与应用程度。为全面捕捉这一信息,研究构建了一个包含73个核心人工智能术语的词典,并采用文本分析方法对年报内容进行扫描与统计。 具体而言,首先对每家上市公司每年度的年报全文进行文本处理。利用Aho-Corasick多模式匹配算法,在年报文本中高效、准确地识别并统计73个预设人工智能关键词的出现次数。为确保统计的准确性,算法执行最长匹配原则,以避免对包含关系的子串进行重复计数(例如,“深度神经网络”被识别为一个整体,而不会将其中的“神经网络”单独再计数一次)。统计得到的关键词总次数即为年报全文的AI关键词总词频(FreqTotal)。作为稳健性检验,研究还特别关注年报中“管理层讨论与分析”(MD&A)章节,该章节集中反映了管理层对公司战略、经营状况和未来展望的阐述,更能体现企业主动披露的技术应用方向。采用相同的方法,单独统计MD&A章节中的AI关键词总词频(FreqMDA)。若因文本格式问题无法成功提取MD&A章节(MDAExtracted=0),则FreqMDA的计算将基于全文进行。 在获得原始词频数据后,为缓解极端值的影响并使数据分布更接近正态,参照文献中的通用做法,对词频进行对数化处理。由此,构建出两个核心指标:基于年报全文的人工智能水平(Lnwords)和基于MD&A章节的人工智能水平(LnwordsMDA)。其计算公式分别为: $$Lnwords = \ln(FreqTotal + 1)$$ $$LnwordsMDA = \ln(FreqMDA + 1)$$ 其中,$FreqTotal$为年报全文中人工智能关键词的总词频,$FreqMDA$为管理层讨论与分析章节中人工智能关键词的总词频。指标数值越大,表明企业在年报中提及人工智能相关概念的频率越高,通常被解释为其人工智能应用水平或关注度越高。LnwordsMDA作为Lnwords的补充和稳健性指标,侧重于考察管理层在核心论述部分对人工智能的强调程度。 补充说明 - 数据覆盖中国A股上市公司发布的年度报告。 - 文本分析时,对73个AI关键词执行最长匹配去重,以避免重复计数。 - 若无法成功提取年报中的“管理层讨论与分析”章节,则LnwordsMDA指标将基于年报全文计算,此时MDAExtracted字段标识为0。 参考文献 - 姚加权, 张锟澎, 郭李鹏, 冯绪. 人工智能如何提升企业生产率?——基于劳动力技能结构调整的视角[J]. 管理世界, 2024, 40(1): 101-116.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。