企业AI漂洗(披露与投入标准化差)

「企业AI漂洗(披露与投入标准化差)」,覆盖 2007-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 59,140。 基于企业年报AI信息披露强度(年报AI词频, 姚加权等2024词典)与真实AI投入(智能化无形/固定资产加总, 张远李焕杰2022关键词法)在行业内标准化后的差

时间跨度2007-2025 年
数据频率年度
层级上市公司
变量数18
样本量59,140
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • AIDisclosure [AI信息披露强度] — 中间字段。参考姚加权等(2024,管理世界)的人工智能词典(73个AI关键词),计算公式为:企业年报全文中AI关键词的总词频(原始计数)。作为AI漂洗测度中'说'(信息披露强度)的中间构件,数值越大表明企业年报中提及人工智能概念越多。
  • AIInvest [真实AI投入] — 中间字段。参考张远、李焕杰(2022,中国人力资源开发)的智能化投资关键词筛选法,计算公式为:年报附注中按智能化关键词筛选出的无形资产账面价值与固定资产净值之和(单位:元)。作为AI漂洗测度中'做'(真实投入)的中间构件,数值越大表明企业智能化相关资产投入越多。
  • StdAIDisclosure [标准化AI披露强度] — 中间字段。计算公式为:AI信息披露强度在所属行业内的标准化值,即(AIDisclosure-行业均值)/行业标准差。
  • StdAIInvest [标准化真实AI投入] — 中间字段。计算公式为:真实AI投入在所属行业内的标准化值,即(AIInvest-行业均值)/行业标准差。
  • AIWashing [企业AI漂洗] — 核心研究变量。参考袁春生、郭振雄(2026,华东经济管理)的方法,计算公式为:标准化AI披露强度减去标准化真实AI投入,并经上下1%缩尾。用作研究变量(被解释变量),数值越大代表企业'说得多、做得少'的AI概念炒作(漂洗)程度越严重。注:因真实AI投入为绝对金额,该指标与公司规模负相关,用作研究变量时须控制公司规模(Size)。
  • IsAIWashing [AI漂洗虚拟变量] — 稳健性检验变量。参考袁春生、郭振雄(2026)的稳健性测度AIwashing1,是否存在AI漂洗(0=否,1=是),计算公式为:AIWashing大于0取1,否则取0。数值为1代表企业存在AI漂洗。
  • AIWashingMDA [AI漂洗(MD&A口径)] — 稳健性检验变量。参考袁春生、郭振雄(2026)的稳健性测度AIwashing2,计算公式为:以年报'管理层讨论与分析(MD&A)'部分的AI词频测度披露强度并在行业内标准化后,减去标准化真实AI投入,经上下1%缩尾。数值越大代表AI漂洗程度越严重。

常见问题

「企业AI漂洗(披露与投入标准化差)」是什么数据集?
企业AI漂洗(披露与投入标准化差),隶属数字化转型与人工智能。基于企业年报AI信息披露强度(年报AI词频, 姚加权等2024词典)与真实AI投入(智能化无形/固定资产加总, 张远李焕杰2022关键词法)在行业内标准化后的差
该数据集的时间范围是?
覆盖 2007-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:AI信息披露强度、真实AI投入、标准化AI披露强度、标准化真实AI投入、企业AI漂洗、AI漂洗虚拟变量、AI漂洗(MD&A口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 59,140 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在测度企业的"AI漂洗"(AI washing)程度, 即企业在人工智能议题上"说得多、做得少"的概念炒作行为。其核心思想借鉴企业环境策略性信息披露(漂绿)研究的逻辑: 当企业对外宣称的某项技术投入意愿显著超过其实际资源承诺时, 即存在策略性的信息粉饰。据此, 本数据集以企业"AI信息披露强度"(说)与"真实AI投入"(做)在行业内标准化后的差值衡量AI漂洗, 该方法参考了袁春生和郭振雄(2026)的研究。 测度的第一个基础变量是AI信息披露强度。借鉴姚加权等(2024)构建的人工智能关键词词典(含73个核心AI术语), 对企业年度报告全文进行文本扫描, 统计AI关键词的出现总频次, 记为$AIDisclosure$。该频次越高, 表明企业在年报中对人工智能概念的提及与强调越多, 即"说"得越多。 测度的第二个基础变量是真实AI投入。借鉴张远和李焕杰(2022)的智能化投资识别方法, 从企业年度报告附注的无形资产明细与固定资产明细中, 通过关键词匹配筛选出与智能化相关的资产项目, 将智能化无形资产的账面价值与智能化固定资产的净值加总, 记为$AIInvest$(单位: 元)。该金额越大, 表明企业在智能化相关资产上的实际资源承诺越多, 即"做"得越多。 在获得两个基础变量后, 分别在企业所属行业内对其进行标准化处理, 以消除行业间的量纲与水平差异。对任一变量$x$, 其行业内标准化值为 $$z(x) = \frac{x - \mu{ind}}{\sigma{ind}}$$ 其中$\mu{ind}$与$\sigma{ind}$分别为该变量在企业所属行业内的均值与标准差。由此得到标准化AI披露强度$StdAIDisclosure = z(AIDisclosure)$与标准化真实AI投入$StdAIInvest = z(AIInvest)$。 企业AI漂洗的核心指标定义为标准化披露强度与标准化真实投入之差, 并对该连续变量进行上下$1\%$缩尾处理: $$AIWashing = z(AIDisclosure) - z(AIInvest)$$ $AIWashing$数值越大, 表明企业在AI议题上的对外披露相对其真实投入越超前, 即"说得多、做得少"的AI漂洗程度越严重。 为缓解测度误差, 本数据集提供两个稳健性度量。其一为AI漂洗虚拟变量$IsAIWashing$, 当$AIWashing 0$时取$1$, 否则取$0$, 用于刻画企业是否存在AI漂洗。其二为基于管理层讨论与分析部分的口径$AIWashingMDA$, 即改用年报"管理层讨论与分析"章节中的AI词频度量披露强度, 在行业内标准化后再与标准化真实AI投入相减并缩尾, 用于检验披露强度度量口径变化下结论的稳健性。 补充说明 - 样本覆盖全行业上市公司, 起始年份依年报附注资产明细的最早可得年度动态确定; 缺乏附注资产明细的早期年度因无法度量真实AI投入而不纳入, 以避免污染行业标准化。AI披露强度与真实AI投入的关键词词典分别沿用上述两项研究, 由于相关原始词表存在未完全公开之处, 本数据集为可得数据条件下对该方法的合理实现。 - 真实AI投入采用资产投资的绝对金额加总并在行业内标准化, 该口径与公司规模正相关, 而披露强度(词频)与规模关联很弱, 因此$AIWashing$与公司规模存在负相关。将其用作研究变量时, 应在回归中控制公司规模, 以避免规模共线对系数的干扰。 - 受年报附注资产项目名称颗粒度限制, 真实AI投入所匹配的资产以通用软件与电子设备为主, 窄口径AI专用项占比较低, 故"做"侧更接近"智能化/数字化资本"代理而非纯AI专用投入, 使用时宜知悉该口径的宽窄含义。 参考文献 - 袁春生, 郭振雄. 绩效期望落差与企业AI漂洗——基于管理者归因视角[J]. 华东经济管理, 2026, 40(4): 21-30. - 姚加权, 张锟澎, 郭李鹏, 冯绪. 人工智能如何提升企业生产效率?——基于劳动力技能结构调整的视角[J]. 管理世界, 2024, 40(2): 101-116. - 张远, 李焕杰. 企业智能化转型对内部劳动力结构转换的影响研究[J]. 中国人力资源开发, 2022, 39(1): 98-118.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。