企业数字化信息粉饰(ERNIE模型)

「企业数字化信息粉饰(ERNIE模型)」,覆盖 2011-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 54,870。 衡量企业在年报中包装数字化转型进展的程度。

时间跨度2011-2025 年
数据频率年度
层级上市公司
变量数20
样本量54,870
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年报所属报告年度。年报通常在次年披露,复现原文回归设定需自行滞后一期
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • MDAExtracted [是否成功提取管理层讨论与分析] — 是否成功定位到年报中管理层讨论与分析章节(0=否,1=是)。取0时该观测的语句统计基于年报全文,占比口径与其余观测不完全可比
  • MDATotalSentences [管理层讨论与分析总语句数] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:年报管理层讨论与分析部分按句号或分号切分后的有效语句数量。用作数字化信息粉饰占比指标的分母
  • DigitalSentences [数字化相关语句数] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:管理层讨论与分析中命中数字化转型词库的语句数量,等于实质性披露、粉饰性披露、宏观行业判断与错误识别四类语句数量之和
  • SubstantiveSentences [实质性数字化信息语句数] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:经语义分类判定为实质性数字化信息披露的语句数量。此类语句具体描述公司实际采取的数字化措施、技术应用、产品升级、专利申请,或符合数字化相关的认定标准、获得相应荣誉称号,具有明确的行动和技术细节
  • EmbellishSentences [粉饰性数字化信息语句数] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:经语义分类判定为粉饰性数字化信息披露的语句数量。此类语句侧重数字化转型的形象塑造,描述公司未来的数字化目标或愿景,缺乏具体的实施细节,是数字化信息粉饰指标的分子
  • MacroSentences [宏观行业判断语句数] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:经语义分类判定为对宏观经济和行业发展判断的语句数量。此类语句侧重国家层面的数字化战略或数字经济的未来发展,强调整体经济趋势或政策背景,而非企业自身的具体行动
  • DIE [数字化信息粉饰] — 参考李嘉政等(2026, 财贸经济)的方法,计算公式为:ln(1+粉饰性数字化信息语句数)。该文借鉴Laufer(2003, JBE)对漂绿的界定,将数字化信息粉饰定义为企业为塑造高水平数字化转型形象、对数字化投入与产出进行虚假宣传,从而使外部利益相关者高估其数字化水平的行为。用作研究变量,越大代表企业通过年报文本包装数字化转型进展的程度越高
  • DIE2 [数字化信息粉饰占比] — 参考李嘉政等(2026, 财贸经济)的方法,稳健性检验口径,计算公式为:粉饰性数字化信息语句数/管理层讨论与分析总语句数。该口径反映粉饰性披露在整体文本中所占的权重,可避免文本篇幅长短差异引起的测量偏误
  • DIE3 [数字化信息粉饰(含宏观判断)] — 参考李嘉政等(2026, 财贸经济)的方法,稳健性检验口径,计算公式为:ln(1+粉饰性数字化信息语句数+宏观行业判断语句数)。将企业对宏观经济和行业数字化趋势的判断一并视为粉饰行为,因为过多披露此类语句会让合作商与投资者误认为企业将追随数字经济方向进行转型

常见问题

「企业数字化信息粉饰(ERNIE模型)」是什么数据集?
企业数字化信息粉饰(ERNIE模型),隶属数字化转型与人工智能。衡量企业在年报中包装数字化转型进展的程度。
该数据集的时间范围是?
覆盖 2011-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:是否成功提取管理层讨论与分析、管理层讨论与分析总语句数、数字化相关语句数、实质性数字化信息语句数、粉饰性数字化信息语句数、宏观行业判断语句数、数字化信息粉饰、数字化信息粉饰占比、数字化信息粉饰(含宏观判断)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 54,870 条观测。
数据是如何测算/获取的?
指标定义与计算方法 在数字经济时代,数字化转型能为企业带来融资便利、政策扶持与市场关注。投资者、供应商与客户往往把数字化转型水平作为判断企业创新能力与成长潜力的重要依据,并据此提供资金支持、合作机会与市场资源。然而,数字化转型需要大量前期投入、实施周期较长且伴随较高的不确定性,中小企业与传统行业企业在短期内难以实现高水平转型。当企业实际转型进程相对滞后时,部分管理层会在对外信息披露中有意放大数字化战略、愿景与概念性术语等文本表达,而相对弱化数字化投入、项目进度与绩效产出等可核验的实质性信息。借鉴 Laufer (2003) 对"漂绿"的界定,企业数字化信息粉饰指企业为了塑造高水平数字化转型形象,在年报等公开信息披露中对数字化投入与产出进行虚假宣传,从而使外部利益相关者高估企业数字化水平的行为。与财务信息具有严格的审计流程不同,文本信息作为财务数据的补充具有抽象性和灵活性,缺乏严格的监督,使管理层可以低成本地利用文本披露来引导外部预期。 与既有研究普遍采用的残差法不同,本数据集参考李嘉政等 (2026) 的方法,从文本语义层面直接识别粉饰性表述。其判别逻辑是:实质性披露往往能明确呈现转型对象、实施进度与最终成效,而粉饰性披露更多依赖模糊的愿景与口号来堆砌数字化信息,这类语句语调通常颇为积极,但缺乏数据支撑,使利益相关者难以以低成本核实信息的真实性。 测度分四步完成。第一步界定文本范围。考虑到年报中的"管理层讨论与分析"部分会详细阐述公司战略、运营情况及未来规划,是分析企业信息披露行为的核心文本,本数据集选取该部分作为分析文本,并以句号或分号将其切分为语句。第二步筛选数字化相关语句。借鉴吴非等 (2021) 与赵宸宇等 (2021) 的做法,采用词典法构建数字化转型词库,词库语词的选取原则是尽量全面以避免遗漏相关语句;将切分后的语句与词库进行搜索和匹配,初步筛选出披露数字化相关信息的语句。词库在此仅承担召回功能,语句的最终归属由后续的语义分类环节决定。 第三步是语义分类,也是本方法的关键。将全部数字化相关语句按统一标准划分为四类:第一类为实质性数字化信息披露,这些语句具体描述了公司实际采取的数字化措施、技术应用、产品升级、专利申请或符合数字化相关的认定标准、获得相应荣誉称号等,具有明确的行动和技术细节;第二类为粉饰性数字化信息披露,这些语句更多的是做数字化转型的形象塑造,描述公司未来的数字化目标或愿景,缺乏具体的实施细节,旨在展示公司对数字化转型的重视;第三类为对宏观经济和行业发展的判断,这些语句侧重于国家层面的数字化战略或数字经济的未来发展,强调的是整体的经济趋势或政策背景,而不是企业的具体行动;第四类为错误识别的语句,即关键词仅出现在公司名称中、公司高管的背景介绍中或财务报表的披露中。分类由大语言模型完成:先随机抽取其中一成语句,连同语句所命中的相应关键词一并交由大语言模型按上述标准识别与标记;再以这批已标记语句按 8:1:1 的比例划分训练集、测试集与验证集,微调 ERNIE 预训练语言模型 (Sun 等, 2021),用微调后的模型对其余语句进行分类;最后将模型预测结果与大语言模型的标注结果合并,作为指标构建的依据。相比逐词计数,这一流程能够在完整语境内追踪段落间的语义关联,识别同一术语在不同语境中的真实含义。 第四步汇总到企业—年度层面。设 $N^{embellish}{it}$ 为企业 $i$ 在第 $t$ 年年报中被判定为粉饰性数字化信息披露的语句数量,核心指标以该数量加 1 取自然对数衡量数字化信息粉饰程度: $$DIE{it} = \ln\left(1 + N^{embellish}{it}\right)$$ 指标越大,代表企业通过年报文本包装数字化转型进展的程度越高;完全没有粉饰性语句的企业年取 0。 本数据集同时提供两个稳健性口径。其一为数字化信息粉饰占比,即粉饰性语句数量与"管理层讨论与分析"总语句数量之比 $DIE2{it} = N^{embellish}{it} / N^{mda}{it}$,该口径能够更好地捕捉数字化信息粉饰在整体文本中所占的权重,避免文本篇幅长短差异引起的测量偏误。其二在原有粉饰性语句数量的基础上,将企业对宏观和行业层面数字化趋势或国家层面数字化战略、数字经济未来发展的判断语句一并纳入后取对数,即 $DIE3{it} = \ln(1 + N^{embellish}{it} + N^{macro}{it})$;其依据是企业过多地在年报中披露对宏观经济和行业发展判断的相关语句,会让合作商、投资者误认为企业要追随数字经济发展方向进行数字化转型,从而对该企业作出错误的判断,因此这类表述也可视为数字化信息粉饰行为。 除上述三个指标外,数据集保留了分类链条上的构件变量,包括"管理层讨论与分析"总语句数、数字化相关语句数,以及实质性、粉饰性、宏观行业判断三类语句的数量,便于研究者自行构造其他口径或开展机制分析。 补充说明 - 年份含义:本数据集的年份为年报所属的报告年度。由于年报通常在次年才会披露,若要复现原文的回归设定(即用第 $t$ 年发布的年报度量解释变量、与第 $t$ 年的被解释变量匹配),需将本指标自行滞后一期。 - 样本口径:本数据集覆盖全部可获取年报的公司年,未预先剔除金融业与 ST 类公司,也未做缩尾处理,研究者可按自身设定筛选并对连续变量作缩尾。 - 跨期可比性:年报"管理层讨论与分析"的篇幅与披露格式随监管要求演变而变化,指标的绝对水平在长样本期内含有这一共同趋势成分,与文本篇幅存在正相关。做跨年比较时建议控制年份固定效应,或改用占比口径以剔除篇幅差异。 - 零值与分布形态:核心指标是计数变量的对数变换,样本期早期相当比例的企业尚未在年报中出现粉饰性数字化表述,该阶段零值占比较高。若研究窗口包含样本期前段,选择估计方法时需考虑这一左侧堆积特征。 - 与"言行差值"类指标的区别:本指标从文本内部识别哪些语句属于空洞的形象塑造,不依赖企业实际数字化投入的代理变量;而以名义披露强度减去实际投入水平构造的迎合类指标衡量的是言行不一致程度。两者构念与数据要求不同,不可相互替代,同时使用时需注意共线性。 - 文本定位标志:数据集提供是否成功定位到"管理层讨论与分析"章节的标志变量。少数年报因编排格式特殊未能定位到该章节,其语句统计基于年报全文,占比口径在这部分观测上与其余观测不完全可比,研究者可据该标志作稳健性检验。 参考文献 - 李嘉政,苏梽芳,王婷伟,汪昊维.数字化信息粉饰下的企业供应链配置多元化[J].财贸经济,2026,47(5):124-143. - 吴非,胡慧芷,林慧妍,任晓怡.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144+10. - 赵宸宇,王文春,李雪松.数字化转型如何影响企业全要素生产率[J].财贸经济,2021,42(7):114-129. - Laufer W S. Social accountability and corporate greenwashing[J]. Journal of Business Ethics, 2003, 43(3): 253-261. - Sun Y, Wang S, Feng S, et al. ERNIE 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation[J]. arXiv preprint arXiv:2107.02137, 2021.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。