企业人工智能概念炒作
「企业人工智能概念炒作」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 69,521。 参考孙月等(2025, 南方经济)的方法,用年报管理层讨论与分析章节中人工智能相关词汇的披露强度刻画上市公司的人工智能概念炒作水平。
| 时间跨度 | 1992-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 69,521 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- AIWordFreq [人工智能词频] — 参考孙月等(2025, 南方经济)的方法,计算公式为:年报管理层讨论与分析章节中55个人工智能关键词的命中次数之和,词典取自该文表1,采用多模式匹配并按最长匹配去重,以避免同一处文本被重复计数。单位:次
- MDAWordCount [管理层讨论与分析总词数] — 计算公式为:年报管理层讨论与分析章节经中文分词、剔除停用词并保留长度不小于2个字的词之后的词数。用作人工智能词频占比的分母。单位:个
- HypeMDA [词频度量的人工智能概念炒作强度] — 参考孙月等(2025, 南方经济)的方法,计算公式为:人工智能词频除以管理层讨论与分析总词数再乘以100。用作研究变量,越大代表企业对人工智能概念的文本披露强度越高,概念炒作水平越高。单位:%
- HypeResidual [残差度量的人工智能概念炒作强度] — 参考孙月等(2025, 南方经济)的方法,计算公式为:词频度量的人工智能概念炒作强度减去公司特征所能解释的部分,公司特征包括公司规模、资产负债率、资产回报率、人工智能发明专利数量的对数、盈余管理水平、市场价值、营业收入增长率与两权分离度,各项系数由公司与年份双向固定效应回归估计得到。用作研究变量,越大代表未被公司基本面解释的异常披露越多,概念炒作水平越高。
- HypeRDStaff [研发人员口径的人工智能概念炒作水平] — 参考孙月等(2025, 南方经济)稳健性检验的方法,计算公式为:词频度量的人工智能概念炒作强度除以研发人员投入强度,其中研发人员投入强度以技术人员占员工总数的比重(化为小数)衡量。该指标将企业的象征性行为与实质性投入相对比,用作研究变量,越大代表文本披露多而实际研发人员投入少,概念炒作水平越高。技术人员占比低于百分之一时分母由测量误差主导,该指标不予采计。
- IsMDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功从年报中定位到管理层讨论与分析章节(0=否,1=是)。取0时该年报的人工智能词频、总词数与各炒作强度指标均不予采计。
常见问题
- 「企业人工智能概念炒作」是什么数据集?
- 企业人工智能概念炒作,隶属数字化转型与人工智能。参考孙月等(2025, 南方经济)的方法,用年报管理层讨论与分析章节中人工智能相关词汇的披露强度刻画上市公司的人工智能概念炒作水平。
- 该数据集的时间范围是?
- 覆盖 1992-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:人工智能词频、管理层讨论与分析总词数、词频度量的人工智能概念炒作强度、残差度量的人工智能概念炒作强度、研发人员口径的人工智能概念炒作水平、是否成功提取管理层讨论与分析章节。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,521 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 人工智能概念炒作,指企业在信息披露中夸大对人工智能发展情况的文本描述,而缺乏与之匹配的经济业务实质的一种信息操纵行为。与实质性的人工智能战略转型不同,概念炒作依托的是对技术前景的宏大叙述而非真实的技术投入:由于人工智能相关信息具有高度的专业性与未来导向性,其真实性验证需要跨越技术可行性评估与长期收益预测等多重壁垒,监管机构与普通投资者都难以在短期内加以甄别,这使得该领域的信息操纵比传统的财务信息操纵拥有更强的信息不对称优势。本数据集从企业年度报告"管理层讨论与分析"章节的文本出发,构建人工智能概念炒作的量化指标。之所以聚焦这一章节,是因为当企业对热点概念作空洞描述时,该章节中涉及的相关词汇会随之增加,其披露强度因而能够反映企业对概念的渲染程度。 指标构建的第一步是识别人工智能相关词汇。所用词典为原文经词嵌入模型扩展后人工筛定的关键词表,共 55 个词条,涵盖人工智能的基础技术(如机器学习、深度学习、神经网络、计算机视觉、自然语言处理)、支撑性技术(如云计算、物联网、区块链、大数据分析、分布式计算)以及各类行业应用形态(如智能医疗、智能客服、智能投顾、自动驾驶、人脸识别)。词表中形如"分布式计算(Hadoop)"的条目,括号内为该词的同义英文缩写,匹配时拆分为中文词与英文缩写两个独立模式,并统一转换为小写后匹配,最终得到 60 个匹配串。由于词表内部存在子串包含关系(例如"神经网络"是"卷积神经网络"与"循环神经网络"的子串),逐词匹配会使同一处文本被重复计入,因此计数时采用两遍最长匹配去重:先按匹配的起始位置保留最长者,再按结束位置保留最长者。此外,少数企业的名称本身就包含词表中的词,其全称会随页眉逐页出现在年报中,使得词频等于页数而非真实的披露强度,故在计数前先从文本中掩除该企业的全称与简称。 设 $AIWordFreq{i,t}$ 为企业 $i$ 在第 $t$ 年年报的管理层讨论与分析章节中上述关键词的命中次数,$MDAWordCount{i,t}$ 为该章节经中文分词、剔除停用词并保留长度不小于两个字的词之后的总词数,则第一个核心指标——词频度量的人工智能概念炒作强度为 $$Hype\MDA{i,t}=\frac{AIWordFreq{i,t}}{MDAWordCount{i,t}}\times 100$$ 该值以百分比表示,越高说明企业对人工智能概念的文本披露强度越大,概念炒作水平越高。以章节总词数作分母而非直接使用词频,是为了剔除年报篇幅差异对词频绝对水平的影响。 单纯的词频占比存在一重识别上的困难:人工智能词汇出现较多,也可能只是企业对自身业务的客观陈述,而非炒作。为把"客观陈述"与"夸大渲染"区分开,第二个核心指标借鉴招股说明书文本信息含量研究中的异常披露思路,用披露强度对企业基本面特征作回归,取其中未被基本面解释的部分。回归设定为 $$Hype\MDA{i,t}=\beta0+\beta1 Size{i,t}+\beta2 Lev{i,t}+\beta3 ROA{i,t}+\beta4 AI\patent{i,t}+\beta5 DA{i,t}+\beta6 TobinQ{i,t}+\beta7 Growth{i,t}+\beta8 Separation{i,t}+ut+ui+\varepsilon{i,t}$$ 其中 $Size$ 为总资产的自然对数,$Lev$ 为总负债与总资产之比,$ROA$ 为净利润与总资产之比,$TobinQ$ 为企业市场价值,$Growth$ 为营业收入增长率,$Separation$ 为控制权与所有权的分离度,$DA$ 为盈余管理水平(取修正 Jones 模型操控性应计的绝对值),$ui$ 与 $ut$ 分别为公司与年份固定效应。式中特别纳入了 $AI\patent$,即企业当年申请的含人工智能技术分类号的发明专利数量加一后取对数——真正推进人工智能转型的企业会相应加大研发投入并形成专利产出,控制这一变量之后,剩余的披露强度才更接近"只说不做"的成分。回归系数由公司与年份双向固定效应的组内变换估计,第二个核心指标即披露强度减去截距与各基本面特征的解释部分: $$Hype\Residual{i,t}=Hype\MDA{i,t}-\hat\beta0-\sum{k=1}^{8}\hat\betak X{k,i,t}$$ 该残差保留了固定效应成分,可直接进入含公司固定效应的回归。其取值越大,说明企业的人工智能披露水平中未被自身基本面所解释的部分越多,概念炒作水平越高。估计该式时剔除金融业企业,要求解释变量与被解释变量齐备,要求企业在估计样本内至少有两个年度观测(否则组内变换无法为系数估计提供信息),并对参与回归的连续变量作上下百分之一的缩尾处理。 第三个指标从"言"与"行"相对比的角度提供稳健性度量。企业若要真正实现与人工智能相关的技术整合与升级,应当具备相应的研发人员基础;因此把管理层讨论与分析章节中人工智能词汇的披露强度视为象征性行为,把研发人员投入强度视为实质性行为,两者相对比即可衡量炒作水平的高低,这一思路借鉴自环保领域通过对比象征性行为与实质性行为来识别"漂绿"的做法。需要说明的是,原文对该稳健性度量只表述为"进行对比、该值越大炒作水平越高",并未给出具体的函数形式;本数据集采用同一作者团队在绿色概念炒作研究中使用的"文本披露占比除以实质投入占比"的比值形式: $$Hype\RDStaff{i,t}=\frac{Hype\MDA{i,t}}{TechRatio{i,t}}$$ 其中 $TechRatio$ 为技术人员占员工总数的比重(以小数计)。该比值越大,表明企业文本上说得越多而研发人员上做得越少,概念炒作水平越高。当技术人员占比低于百分之一时(多见于劳动密集型行业),分母接近于零而由测量误差主导,该指标不予采计。此处分母以技术人员占比代理原文所述的研发人员占比,二者在年报员工构成的披露实务中口径接近但不完全等同。原文还以研发资金投入强度(研发支出占总资产的比重)构造了一个平行的稳健性口径,但该分母在相当比例的企业年中不大于零——早年研发费用尚未强制单列——比值对这部分样本无从定义,故本数据集不纳入该口径。 补充说明 - 样本口径:本数据集交付全部年份、全行业的原始值,不预先剔除特别处理公司、不作缩尾,回归样本的限定留给使用者自行施加;上述缩尾与行业剔除仅在估计残差指标的那一步内部使用。 - 词典构成随年份漂移:词表中包含物联网、云计算、区块链、大数据等并非人工智能专属的技术词汇。在样本前期,这几个词贡献了绝大部分命中,"人工智能"一词本身占比很低;越靠近样本末期,"人工智能"的占比越高。因此在早期年份,本指标应读作广义的"人工智能及相关数字技术"披露强度,只有在后期才逐渐接近狭义口径。跨年度解读须留意这一构成变化。 - 分母存在两处年际断点:章节边界的识别受年报披露模板变迁影响,同一企业的章节词数在样本中期与后期各出现过一次明显跳变,其余相邻年份的变动幅度都在一成以内。年份固定效应可以吸收其水平影响,但跨越这两处断点的双重差分或事件研究设计建议补充稳健性检验,例如改用企业内固定分母,或直接使用词频的对数。 - 残差指标的可比性:回归残差的绝对量级取决于估计样本的构成,与其他文献报告的残差数值不具可比性,适合用于同一次交付内部的截面与面板排序。该列的缺失主要来自两权分离度与盈余管理两个解释变量的覆盖范围,缺失观测的规模偏小、杠杆偏高,以其作解释变量时建议同时报告缺失样本与保留样本的特征差异。 - 零值的含义:相当比例的企业年在该章节内无任何关键词命中。该零值混合了确实未作披露与以其他措辞描述同类业务两种情形,与真实的零人工智能投入并不等价;其中一小部分是章节边界所致,这些企业在年报其他章节仍有零星命中。 - 稳健指标的分布:研发人员口径的指标约半数取值恰为零(源于分子为零),且右尾较长,其上尾由技术人员占比处于百分之一至百分之三区间的企业驱动,进入回归前建议自行缩尾或取对数。 - 其他局限:本数据集以年报文本为骨架,仅覆盖披露年报的沪深A股上市公司年,与以财务数据为骨架的面板连接时,未匹配部分绝大多数是新三板挂牌年份与公司上市之前的追溯年份;逐字匹配无法区分语境,短词存在少量语境性误命中;由日志转换失败或仅抓取到摘要的年报不予采计。 参考文献 - 孙月,王新,郝晓蓓.上市公司人工智能概念炒作与大股东股份减持[J].南方经济,2025,(11):143-162. - 王新,郝晓蓓,孙月.绿色概念炒作与企业绩效:来自产品市场的新发现[J].经济管理,2024,46(7):190-208. - Hanley K W, Hoberg G. The information content of IPO prospectuses[J]. The Review of Financial Studies, 2010, 23(7): 2821-2864. - Mikolov T, Sutskever I, Chen K, et al. Distributed representations of words and phrases and their compositionality[C]//Advances in Neural Information Processing Systems, 2013, 26: 3111-3119. - 吴非,胡慧芷,林慧妍,等.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144+10.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。