漂绿行为(ERNIE语句三分类法)
「漂绿行为(ERNIE语句三分类法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 69,329。 衡量上市公司在年报环境信息披露中以符号化表态替代实质行动的程度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 69,329 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- TotalSentCount [年报语句总数] — 年报全文经繁简归一与空白清理后按句号切分,剔除长度不足5字或不含中文的无语义碎片后,实际参与语句分类的语句总数
- SubstantiveSentCount [实质性环境披露语句数] — 参考Sun & Yin (2026, Journal of Business Ethics)的方法,年报语句中被判定为实质性环境披露的语句条数。实质性环境披露指内容具体、可验证、通常含量化信息的环境披露,如环保投资与支出金额、污染物排放量与减排幅度、具体的环保设施与技术改造、已取得的环境认证与排污许可
- SymbolicSentCount [象征性环境披露语句数] — 参考Sun & Yin (2026, Journal of Business Ethics)的方法,年报语句中被判定为象征性环境披露的语句条数。象征性环境披露指表述定性、笼统、不可验证的环境披露,如环保理念与价值主张、长期愿景与口号式表态、对国家环保政策与形势的一般性援引
- EnvSentCount [环境披露语句总数] — 计算公式为:实质性环境披露语句数+象征性环境披露语句数,即年报中全部环境相关语句的条数
- GW [漂绿程度] — 参考Sun & Yin (2026, Journal of Business Ethics)的方法,计算公式为:象征性环境披露语句数/(象征性环境披露语句数+实质性环境披露语句数)×100。年报中不含任何环境相关语句时取空值。用作研究变量,越大代表企业环境信息披露中笼统而不可验证的表态占比越高,即漂绿程度越高
常见问题
- 「漂绿行为(ERNIE语句三分类法)」是什么数据集?
- 漂绿行为(ERNIE语句三分类法),隶属ESG与绿色发展。衡量上市公司在年报环境信息披露中以符号化表态替代实质行动的程度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:年报语句总数、实质性环境披露语句数、象征性环境披露语句数、环境披露语句总数、漂绿程度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,329 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业围绕环境议题的对外沟通可以分为两类。一类是实质性环境披露,它包含可以核查的具体信息,通常伴随金额、数量或明确的项目、设施与资质,反映企业确已采取改善自身环境表现的行动,如环保投资与支出、污染物排放与减排、具体的环保工程与技术改造、已取得的环境认证与排污许可。另一类是象征性环境披露,它以定性、笼统且无从核查的表述为主,如环保理念与价值主张、长期愿景与承诺,以及对国家环保目标与宏观环境形势的一般性援引。当企业以大量象征性表态代替实质行动来塑造对外的环保形象时,即构成漂绿。本数据集沿用 Sun 与 Yin (2026) 的做法,以象征性环境披露在企业全部环境披露中所占的比重度量漂绿程度。 指标构造以上市公司年度报告全文为语料。先对年报全文做繁简归一并清除空白与换行字符,使跨行断开的语句恢复完整,再按中文句号切分为语句,剔除长度不足 5 字或不含中文字符的无语义碎片,得到该企业当年参与判别的语句集合。 语句的三分类由一个经过微调的 ERNIE 中文预训练语言模型完成。原文选用 ERNIE 而非 BERT,理由在于 ERNIE 采用短语级掩码进行预训练、预训练语料覆盖百科词条、新闻与网络对话等更为多样的来源,在中文语义表示上更具优势,并在其自建标注集上取得了更高的分类准确率。模型训练遵循原文公布的流程:先构造语句标注集,将每条语句标注为实质性环境披露、象征性环境披露、非环境披露三类之一(原文标注一万条,本实现取两万条以压低标注噪声);再按 8:1:1 的比例划分训练集、验证集与测试集;以监督学习微调 ERNIE;最后用微调后的模型对年报中的全部语句逐句分类。判别环节不使用任何关键词预筛,这正是原文采用预训练语言模型而非词典法的出发点——词典法依赖预先设定的关键词,难以捕捉隐含与含蓄的表达。 分类模型的效果在标注集的留出部分上检验:总体准确率与原文报告的水平相当,其中非环境披露一类的判别最为可靠,两类环境披露之间的区分相对更难,这与三类语句的语义距离一致。需要说明的是,本实现留出部分的标签同样由大语言模型给出,因此该检验衡量的是分类器是否忠实学到了标注指引,与原文以人工标签为金标准的评估口径不同,两者的数值不宜直接比较优劣。 记企业 $i$ 在第 $t$ 年年报中被判为象征性环境披露的语句数为 $N^{symbolic}{i,t}$,被判为实质性环境披露的语句数为 $N^{substantive}{i,t}$,二者之和即该企业当年环境相关语句的总数。漂绿程度定义为 $$GW{i,t}=\frac{N^{symbolic}{i,t}}{N^{symbolic}{i,t}+N^{substantive}{i,t}}\times 100$$ 其取值介于 0 与 100 之间。数值越大,说明企业环境信息披露中笼统而无从核查的表态占比越高,即漂绿程度越高。年报中未出现任何环境相关语句的企业年,上式分母为零,指标取空值。 除核心指标外,数据集一并给出构成计算链的中间量:参与分类的年报语句总数、实质性环境披露语句数、象征性环境披露语句数,以及后两者之和的环境披露语句总数。它们既是上式的分子与分母,也可单独用于刻画企业环境信息披露的绝对规模与文本体量。 指标的解读需要同时借助分子与分母。该比值刻画的是环境披露的内部结构:取值升高既可能源于象征性表态增多,也可能源于实质性披露减少,两条路径在数值上无法区分。因此分析中通常需要把环境披露语句总数作为协变量一并纳入,才能把"以空话替代实事"与"整体披露稀少"区分开。对于环境披露本身就很少的企业年,比值由少数几条语句决定,能够承载的信息有限,宜结合环境披露语句总数设定可用样本的下限。 补充说明 - 样本口径与缺失:覆盖全部可读取到年度报告的企业年,未预先施加行业、上市板块与年份限制。年报中未出现任何环境相关语句的企业年指标取空值,这部分缺失并非随机:规模越小、所处行业污染属性越弱的企业缺失越多,最小规模组的缺失率数倍于最大规模组。以本指标为被解释变量的回归实际条件于"企业有环境披露"的子样本,建议做样本选择校正或至少完整披露,并加入行业与年份固定效应。 - 标注环节:原文由人工阅读并标注语句,本实现改由大语言模型依同一套判别标准完成标注,再据以训练分类模型,代价是标注带有标注模型自身的判别倾向。原文未公布标注语句的抽样方式与微调超参数:本实现按"命中环境线索词的语句与全体随机语句分层混合、并在行业与年份层内按比例抽取"构造标注集,使三类均有足够样本量;超参数按常规设置选取并以验证集择优。分层用的环境线索词表只作用于抽样,不参与指标计算。 - 判别细则:原文给出三类的概念定义,但未公布逐条判别规则。本实现把判别拆成先后两步:先判议题,即语句是否讲企业与自然环境的关系,不属于自然环境议题的无论笼统还是具体一律归入非环境披露;确认属环境议题后,才区分实质性与象征性。据此,经营语境中的"环境"(市场环境、宏观环境等)、企业对外销售环保与新能源产品的经营描述、公益慈善与员工权益等社会责任类议题、以及目录与表格残渣均不计入;"社会责任""可持续发展""ESG"等词本身也不足以构成环境议题。 - 环保产业的口径提示:承上,以环保监测、环保装备、环境治理服务为主业的公司,年报中大量篇幅在描述对外销售的环保产品与项目,按口径归入业务经营信息而不计入环境披露,其自身环境表现则往往只剩理念性表述,于是这类公司会被测出很高的取值。对环保产业样本使用本指标时应意识到这一特征。 - 分母信息量与极值:年报中被判定为环境相关的语句数中位数不高,低披露企业年的比值只能落在少数几个刻度上,取 0 与取 100 的观测合计约占三成,其中约四分之三来自环境语句不超过三条的企业年。这类取值不是错误,而是信息量不足,宜按环境披露语句总数设定下限后使用,并对两端取值单独报告敏感性。相较原文报告的分布,本数据集取值更为分散,也源于此。 - 与原文取值水平的差异:本数据集在原文样本区间上的均值约为原文报告值的六成,方向相反。开发过程中曾把"环境议题"的判定大幅收紧,环境语句数因此减少四成以上,而指标均值几乎未动,这说明该差距既不是环境议题判定过宽、也不是过窄造成的。剩余可能指向分句所覆盖的语句总体本身不同,例如原文或未对年报中的量化表格块分句,或将取得排污许可、环评批复、达标排放这类合规性陈述归入象征性一类。原文未公开分句与预处理细则,此项作为未解释的口径差异如实列出。 - 披露载体变动:监管对年报中环境信息披露的要求在样本期内发生过调整,部分公司的实质性环境信息转由独立的可持续发展报告披露,不再计入年报正文。这使得制度调整之后年报口径下的环境披露语句数下降,且实质性语句的降幅大于象征性语句,指标取值相应上升。做跨期比较时建议控制年份固定效应,或在制度调整前后分段处理。 - 其他局限:语句按中文句号切分,超长语句仅前 256 字参与判别;语料中混有少量繁体年报,已统一转为简体后再行判别;原文还报告了一个以标准化环境披露得分减去标准化环境绩效评级构造的替代口径,该口径依赖第三方环境绩效评级,不在本数据集范围内。 参考文献 - Sun X, Yin J. The power of retail investors: the effect of online interactions over environmental issues on corporate greenwashing[J/OL]. Journal of Business Ethics, 2026. https://doi.org/10.1007/s10551-026-06258-z. - Walker K, Wan F. The harm of symbolic actions and green-washing: corporate actions and communications on environmental performance and their financial implications[J]. Journal of Business Ethics, 2012, 109(2): 227-242. - Bingler J A, Kraus M, Leippold M, et al. How cheap talk in climate disclosures relates to climate initiatives, corporate emissions, and reputation risk[J]. Journal of Banking & Finance, 2024, 164: 107191.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。