气候风险感知(Mengzi模型)

「气候风险感知(Mengzi模型)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 69,679。 参考严珂和盛巧燕(2026, 对外经贸)的方法,基于上市公司年报管理层讨论与分析章节文本构建的企业-年份层面高管气候风险感知指数。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数21
样本量69,679
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年度报告所属会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功提取年度报告的管理层讨论与分析章节(0=否,1=是)。取值为0时,该企业年的其余数据字段均置为缺失,因为章节定位失败时文本范围会退化为整份年报,与本数据集的章节口径不可比
  • NSentTotal [管理层讨论与分析语句总数] — 计算公式为:管理层讨论与分析章节文本删除空格与换行符后,按句号、感叹号、问号、分号切分所得的语句数量(仅计入长度不小于5个字符且含中文字符的语句)
  • NClimateSent [气候风险关键词命中语句数] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:管理层讨论与分析语句中,至少命中一个气候风险关键词的语句数量。关键词表取自杜剑等(2023, 金融评论),共96个词,分物理风险64词与转型风险32词。该步骤对应原文的文本识别环节,用于初步圈定涉及气候风险的语句范围
  • NPhysicalSentSupp [物理风险关键词命中语句数] — 计算公式为:命中物理风险关键词(极端天气事件类34词与长期气候变化类30词)的语句数量。一条语句可同时命中两类风险的关键词,故本字段与转型风险关键词命中语句数之和不小于气候风险关键词命中语句数。为原文未使用的补充字段,用于提高计算过程的透明度
  • NTransitionSentSupp [转型风险关键词命中语句数] — 计算公式为:命中转型风险关键词(低碳转型过程中的政策、技术、市场与声誉类32词)的语句数量。为原文未使用的补充字段,用于提高计算过程的透明度
  • NExposureSent [气候风险暴露语句数] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:经微调后的金融领域BERT模型判定为气候风险暴露(即负面情感)的语句数量。气候风险暴露指企业所披露的、由气候变化的物理影响或低碳转型带来的不利影响与压力
  • NResponseSent [风险防范措施语句数] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:经微调后的金融领域BERT模型判定为风险防范措施(即正面情感)的语句数量。风险防范措施指企业为应对或预防气候风险已采取的行动、已具备的能力与已取得的成效
  • MaxNegProb [负面情感概率最大值] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:全部气候风险暴露语句的负面情感概率的最大值,用以刻画企业面临的最严重气候风险点。当企业当年没有气候风险暴露语句、但有风险防范措施语句时,本字段取0。概率经温度缩放校准后取值
  • MeanPosProb [正面情感概率平均值] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:全部风险防范措施语句的正面情感概率的算术平均值,用以刻画企业整体的气候风险应对能力。当企业当年没有风险防范措施语句、但有气候风险暴露语句时,本字段取0。概率经温度缩放校准后取值
  • MCAI [高管气候风险感知] — 参考严珂和盛巧燕(2026, 对外经贸)的方法,计算公式为:负面情感概率最大值-正面情感概率平均值,即企业每年管理层讨论与分析部分涉及气候变化风险的文本中,负面文本的负面情感概率最大值与正面文本的正面情感概率平均值之间的差值。当企业当年既无气候风险暴露语句也无风险防范措施语句时,本字段为缺失。用作研究变量,越大代表管理层感知到的气候风险水平越高,即所披露的风险暴露程度相对于其防范能力越突出

常见问题

「气候风险感知(Mengzi模型)」是什么数据集?
气候风险感知(Mengzi模型),隶属信息环境。参考严珂和盛巧燕(2026, 对外经贸)的方法,基于上市公司年报管理层讨论与分析章节文本构建的企业-年份层面高管气候风险感知指数。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 21 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、管理层讨论与分析语句总数、气候风险关键词命中语句数、物理风险关键词命中语句数、转型风险关键词命中语句数、气候风险暴露语句数、风险防范措施语句数、负面情感概率最大值、正面情感概率平均值、高管气候风险感知。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,679 条观测。
数据是如何测算/获取的?
指标定义与计算方法 气候风险已成为企业运营环境中最具系统性与复杂性的外部冲击之一。管理层作为企业决策的核心,其对气候风险的认知与理解程度,直接影响企业的资源配置、风险管理与融资策略。由于风险感知本身具有主观性,既有研究多先构建气候风险相关词典,再通过搜索、匹配与词频统计来构造感知指数;而大语言模型在文本语义理解、隐含情绪评估与情境特征提取上较传统词频统计具有显著优势。本数据集据此以上市公司年度报告"管理层讨论与分析"章节的文本为基础,构建企业—年份层面的高管气候风险感知指数。 指标构建分为四个步骤。 第一步,文本识别。 从管理层讨论与分析章节的文本中识别与气候风险相关的陈述:先将章节文本删除空格与换行符,按句号、感叹号、问号与分号切分为语句,再以气候风险关键词列表提取提及这些关键词的语句,作为后续训练与预测的基础。所选关键词覆盖两类主要气候风险:物理风险指与气候变化直接相关的极端天气事件与长期气候变化,例如海平面上升、极端高温与干旱;转型风险则源于全球向低碳经济转型过程中可能遇到的政策变化、技术创新、市场变化与声誉风险。所用关键词表共 96 个词,其中物理风险 64 词(极端天气事件类 34 词、长期气候变化类 30 词),转型风险 32 词。 第二步,标注训练集。 从经关键词过滤后选出的语句中抽取 10% 作为标注样本,判断每条陈述是否反映了管理层对气候风险的决策或采取的预防措施。标注体系区分三类:陈述企业所承受的、由气候变化物理影响或低碳转型带来的不利影响与压力者,记为"气候风险暴露";陈述企业为应对或预防气候风险已采取的行动、已具备的能力与已取得成效者,记为"风险防范措施";其余记为非气候风险陈述。设置第三类的原因是,关键词表中"环境""效率""改造""转型""能源"等词在年报中用法宽泛,大量命中语句与气候风险无关,将其单独归类可使前两类只保留真正涉及气候风险的陈述。原文采用生成式大语言模型与人工标注相结合的方式完成这一环节;本数据集改由大语言模型按固定提示词统一标注,提示词逐条落实原文对两类气候风险的界定与上述三类的判定标准,并以人工逐条判定的黄金样本集校验其判定质量、据此多轮修订后定稿。相应的提示词与黄金样本集随计算代码一并留存。 第三步,模型预训练与预测识别。 将标注数据转化为适用于情感分类模型的训练集:标注为"气候风险暴露"的文本赋值 $-1$,表示负面情感;标注为"风险防范措施"的文本赋值 $+1$,表示正面情感。以中文金融领域预训练的 BERT 模型为基座进行微调,数据按 $0.7:0.3$ 划分为训练集与验证集,据验证集上两个情感类别的宏平均 F1 选取最优检查点;不采用整体准确率作为选取准则,是因为经关键词初筛的语句中绝大多数属于第三类,全部判为第三类即可获得很高的整体准确率,却无法识别出任何气候风险陈述。模型训练完成后对全部语句预测,得到每条语句的类别及其所属类别的概率。 由于微调后的神经网络分类器普遍存在概率过度自信的问题,而本指标取自这些概率的最大值与平均值,未经校准的概率会使指标退化为在少数取值附近堆积、几乎没有连续变异的分布。因此在合成指标前对概率施加温度缩放校准: $$p{i}^{\text{cal}} = \frac{\exp(z{i}/T)}{\sum{j}\exp(z{j}/T)}$$ 其中 $z$ 为模型输出的对数几率,温度 $T$ 在验证集上以最小化负对数似然求得,由数据决定而非人为设定。该变换不改变各类别的相对大小顺序,因而语句的分类结果与各类语句计数完全不受影响,仅使概率不再过度自信。 第四步,构建高管气候风险感知指标。 高管气候风险感知的最终刻画程度取决于两方面的差值:一是企业所披露面临的气候变化风险与转型风险的程度,二是企业采取的措施及其预防这些风险的能力,后者有助于降低整体气候变化风险水平,从而在一定程度上减轻潜在的负面影响。据此,将高管气候风险感知定义为企业每年管理层讨论与分析部分涉及气候变化风险的文本中,负面文本的负面情感概率最大值与正面文本的正面情感概率平均值之间的差值: $$MCAI{it} = \max{s \in N{it}} P(\text{neg} \mid s) - \frac{1}{|P{it}|}\sum{s \in P{it}} P(\text{pos} \mid s)$$ 其中 $N{it}$ 为企业 $i$ 在第 $t$ 年被判定为气候风险暴露的语句集合,$P{it}$ 为被判定为风险防范措施的语句集合。被减数取最大值,用以捕捉企业面临的最严重气候风险点;减数取平均值,用以衡量企业整体的风险应对水平。该指数越大,代表管理层感知到的气候风险水平越高,即所披露的风险暴露程度相对于其防范能力越突出。 数据集同时输出计算链上的中间量:管理层讨论与分析的语句总数、气候风险关键词命中语句数、气候风险暴露与风险防范措施两类语句各自的数量,以及构成差值的两个概率项。此外还补充输出物理风险与转型风险各自的关键词命中语句数,该二者为原文未使用的补充字段,仅用于提高计算过程的透明度;由于一条语句可同时命中两类关键词,二者之和不小于气候风险关键词命中语句总数。 补充说明 - 样本口径:本数据集覆盖语料库全部可得年份的全部上市公司年度报告,构建阶段不剔除金融业、房地产业与特别处理公司,也不做缩尾处理。原文在回归分析前另行删除金融类与房地产行业企业、样本期内被特别处理的样本以及主要变量缺失的样本,并对连续变量作 1% 缩尾;此类回归样本限制由使用者按研究需要自行施加。 - 缺失约定与指标分布:当企业当年既无气候风险暴露语句也无风险防范措施语句时,指标为缺失;仅缺一侧文本时,缺失的那一侧记 0。由此,指标取值呈现三个聚集区域:只披露防范措施的企业年取值接近下界,只披露风险暴露的接近上界,两类文本兼具的则分布在零附近并具有连续变异。使用者若需要连续变异更充分的子样本,可依据本数据集提供的两类语句计数字段筛选出两类文本兼具的观测。 - 缺失的非随机性:指标缺失在行业与年份上并非随机分布,气候敏感行业与近年的缺失比例明显低于气候不敏感行业与早年,这反映的是企业是否实际在年报中讨论气候议题这一真实差异。使用者在回归中建议同时加入行业与年份固定效应。 - 两类风险的词频差异:转型风险关键词在年报中的命中频率远高于物理风险关键词,前者多为企业日常经营中常用的表述,后者主要在受灾年份出现;相应地,被判定为风险防范措施的语句数量也明显多于风险暴露语句。这是中文年报披露习惯的客观反映。 - 关键词表来源:原文说明了两类气候风险的界定与选词方向,但未公布完整词表。本数据集采用同一研究脉络中已正式发表并完整公布词表的来源,其风险分类与原文的两类风险逐一对应,且该词表本身即为中国上市公司年报文本所构建。 - 其他局限:管理层讨论与分析章节定位失败的企业年,其全部数值字段置为缺失,因为此时文本范围会退化为整份年报,与本数据集的章节口径不可比;早期年份的年报披露规范尚未统一,章节定位成功率低于后续年份。原文对语句切分方式、超长语句处理与概率是否校准均未作说明,本数据集的相应处理在配套的计算代码中有完整记录。 参考文献 - 严珂,盛巧燕.气候风险感知对上市公司债务期限结构的影响研究——基于大语言模型的经验证据[J].对外经贸,2026,(1):125-129. - 杜剑,徐筱彧,杨杨.气候风险影响权益资本成本吗?——来自中国上市公司年报文本分析的经验证据[J].金融评论,2023,15(3):19-46+125. - 陆瑶,施函青,周欣怡.中国企业数字技术风险暴露对企业价值的影响:来自大语言模型的文本分析证据[J].经济研究,2025,60(2):73-89. - Zhang Z, Zhang H, Chen K, et al. Mengzi: Towards lightweight yet ingenious pre-trained models for Chinese[J]. arXiv preprint arXiv:2110.06696, 2021. - Guo C, Pleiss G, Sun Y, et al. On calibration of modern neural networks[C]//Proceedings of the 34th International Conference on Machine Learning. PMLR, 2017: 1321-1330.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。