企业数字技术风险治理能力(Mengzi-BERT法)

「企业数字技术风险治理能力(Mengzi-BERT法)」,覆盖 2008-2025 年,频率 年度,上市公司层级,含 24 个变量,样本量约 59,885。 参考张思涵等(2026,当代财经)的方法,以年报管理层讨论与分析为语料,用数字技术风险关键词典抓取关联语句,经大语言模型标注训练集与金融领域BERT情感二分类后

时间跨度2008-2025 年
数据频率年度
层级上市公司
变量数24
样本量59,885
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年报会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • DigiRiskSentCount [数字技术风险关联语句数] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:年报管理层讨论与分析中数字技术风险关联语句的总条数。判定规则为:按句号等中文标点将文本切分为语句并分词,若某语句的词项集合包含关键词典中某一关键词的全部词项,则判定该语句与数字技术风险相关;关键词典含数据风险、网络风险、信息基础设施风险和具体数字技术风险四个一级分类共152个关键词。同一企业年度内完全相同的语句只计一次,以免逐页重复的页眉页脚被反复计入。
  • DigiRiskPrevCount [风险防范类语句数] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:关联语句中经金融领域BERT情感分类模型判定为风险防范类(即反映企业对数字技术风险采取了防护、保障与应对措施)的语句条数。同一企业年度内完全相同的语句只计一次,以免逐页重复的页眉页脚被反复计入。
  • DigiRiskExpCount [风险暴露类语句数] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:关联语句中经金融领域BERT情感分类模型判定为风险暴露类(即反映企业面临数字技术风险的威胁、隐患与损失)的语句条数。同一企业年度内完全相同的语句只计一次,以免逐页重复的页眉页脚被反复计入。
  • RiskPreventMean [平均风险防护水平] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:全部风险防范类语句的正面情感概率的算术平均值,无风险防范类语句时取0。因语句类别由概率是否超过0.5判定,该字段的取值为0或大于0.5且不超过1。该指标表征企业的平均风险防护水平,是治理能力指标的加项。
  • RiskExposureMax [最大风险暴露水平] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:全部风险暴露类语句的负面情感概率的最大值,无风险暴露类语句时取0。因语句类别由概率是否超过0.5判定,该字段的取值为0或大于0.5且不超过1。选用最大值而非均值,是为捕捉企业风险治理中的木桶效应,即企业面临最严重风险事件时的暴露程度,是治理能力指标的减项。
  • RiskExposureMean [平均风险暴露水平] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:全部风险暴露类语句的负面情感概率的算术平均值,无风险暴露类语句时取0。因语句类别由概率是否超过0.5判定,该字段的取值为0或大于0.5且不超过1。用于构建降低极端值影响的稳健性口径。
  • MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年报的管理层讨论与分析章节(0=否,1=是)。取0表示章节定位失败并回退至年报全文,该情形下关联语句可能来自年报其他章节。
  • IsBothClass [是否同时含风险防范与风险暴露语句] — 是否同时含有风险防范类与风险暴露类语句(0=否,1=是),计算公式为:风险防范类语句数与风险暴露类语句数均大于零时取1,否则取0。仅该取1的子样本的治理能力指标落在连续取值区间(标准差0.071),其余观测因只含单一类别语句而聚集于-1、0、+1三处,故该标志用于筛选可作连续变量使用的子样本。
  • DigiGov [企业数字技术风险治理能力] — 参考张思涵等 (2026, 当代财经)的方法,计算公式为:平均风险防护水平减最大风险暴露水平,即全部风险防范类语句正面情感概率的均值减去全部风险暴露类语句负面情感概率的最大值。用作研究变量,越大代表企业面临严重数字技术风险事件时的整体应对能力越强,即数字技术风险治理能力越高。
  • DigiGov2 [企业数字技术风险治理能力(平均暴露口径)] — 参考张思涵等 (2026, 当代财经)稳健性检验的方法,计算公式为:平均风险防护水平减平均风险暴露水平,即以风险暴露类语句负面情感概率的均值替代最大值,以降低个别语句负面情感概率异常偏高对测度结果的影响。用作稳健性检验变量,越大代表数字技术风险治理能力越高。
  • DigiGov3 [风险防范语句占比] — 参考张思涵等 (2026, 当代财经)稳健性检验的方法,计算公式为:风险防范类语句数量除以数字技术风险关联语句总数,从文本数量占比的视角刻画企业的风险防范倾向。无关联语句时该比例无定义,记为缺失值。用作稳健性检验变量,越大代表数字技术风险治理能力越高。
  • SentCountNoDisaster [剔除灾害类词后的关联语句数] — 计算公式为:数字技术风险关联语句总数减去仅由灾害性事件类关键词(灾害性事件、停电、断电、断网、失火、自然灾害、火灾、洪水、洪涝、暴雨、暴雪、台风、雷电、地震、泥石流、高温、干旱、寒潮)命中的语句数。灾害类关键词虽属参考文献的关键词典,但在年报中大量出现于与数字技术无关的生产经营语境,该字段用于噪声稳健性检验。该字段为参考文献口径之外的辅助字段。同一企业年度内完全相同的语句只计一次,以免逐页重复的页眉页脚被反复计入。
  • DigiGovNoDisaster [剔除灾害类词后的数字技术风险治理能力] — 计算公式为:在剔除仅由灾害性事件类关键词(灾害性事件、停电、断电、断网、失火、自然灾害、火灾、洪水、洪涝、暴雨、暴雪、台风、雷电、地震、泥石流、高温、干旱、寒潮)命中的语句后,以平均风险防护水平减最大风险暴露水平重新计算治理能力,公式与主口径完全相同,仅语句样本不同。该字段为参考文献口径之外的辅助字段(参考文献的稳健性检验不含此口径),用于噪声稳健性检验:主口径中农林牧渔业、采矿业等行业的语句有过半乃至八成以上仅由灾害类词命中,剔除后这些行业的治理能力由负转正,故行业间比较应以该字段为准。越大代表治理能力越高。

常见问题

「企业数字技术风险治理能力(Mengzi-BERT法)」是什么数据集?
企业数字技术风险治理能力(Mengzi-BERT法),隶属数字化转型与人工智能。参考张思涵等(2026,当代财经)的方法,以年报管理层讨论与分析为语料,用数字技术风险关键词典抓取关联语句,经大语言模型标注训练集与金融领域BERT情感二分类后
该数据集的时间范围是?
覆盖 2008-2025 年。
包含哪些变量/指标?
共 24 个变量。核心指标包括:数字技术风险关联语句数、风险防范类语句数、风险暴露类语句数、平均风险防护水平、最大风险暴露水平、平均风险暴露水平、是否成功提取管理层讨论与分析章节、是否同时含风险防范与风险暴露语句、企业数字技术风险治理能力、企业数字技术风险治理能力(平均暴露口径)、风险防范语句占比、剔除灾害类词后的关联语句数、剔除灾害类词后的数字技术风险治理能力。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 59,885 条观测。
数据是如何测算/获取的?
指标定义与计算方法 随着数字技术持续嵌入企业的生产、经营与管理环节,与数字技术应用伴生的新型威胁与不确定性(即"数字技术风险")日益凸显,其主要表现为数据安全风险与网络安全风险,如数据泄露、系统瘫痪及隐私侵犯等。此类风险一旦失控,不仅冲击企业的财务绩效、品牌声誉与客户信任,还可能在关联行业与物理区域间扩散蔓延。企业数字技术风险治理能力(DigiGov)参考张思涵、陈志斌、王孔文、张长江(2026,当代财经)的方法构建,其定义遵循 Schneider 与 Scherer(2015)关于"公司治理成效体现在健全的风险控制能力"的观点:考虑到数字技术风险暴露的后果通常是系统性、灾难性的,该指标将风险治理界定为企业面临严重风险事件时的整体应对能力,以捕捉治理过程中存在的"木桶效应"。指标为正表明企业的风险防护水平总体上高于其最严重的风险暴露程度,为负则表明企业存在"重发展、轻风险"的倾向。 指标以企业年度报告中的"管理层讨论与分析"(Management Discussion and Analysis,简称 MD&A)为语料,构建过程分为五步。 第一步,构建企业数字技术风险关键词典。 关键词典采用"文件参考 + 学术借鉴"的方式形成:以《中华人民共和国网络安全法》《中华人民共和国数据安全法》《关键信息基础设施安全保护条例》《信息安全技术 网络安全事件分类分级指南》(GB/T 20986-2023)、《信息安全技术 数据安全风险评估方法》(GB/T 45577-2025)等政策文件关于数字技术风险的定义与分类为依据,并借鉴田玲等(2024)与陆瑶等(2025)的词典,将数字技术风险划分为数据风险、网络风险、信息基础设施风险、具体数字技术风险四个一级分类。各一级分类之下设二级分类(种子词),如数据风险下含数据泄露、数据篡改、违规传输、数据滥用,网络风险下含网络攻击、有害程序,信息基础设施风险下含设施设备故障、灾害性事件。原文以词向量模型(Word2Vec)对种子词作了拓展并剔除低相似度与无关词语,并在文中完整公布了最终词表。本数据集直接按原文公布的词表原样转录(形如"数据安全/风险"的写法展开为两个独立关键词;设有二级分类的一级分类,其二级分类名本身亦纳入词表,而"具体数字技术风险"一类在原文中未设二级分类,故无对应词条),合计 152 个关键词,未自行训练词向量、未增删任何词条。 第二步,抓取 MD&A 中的关联文本论述。 先按句号等中文标点将 MD&A 文本切分为语句,再对每个语句进行分词,得到语句的词项集合;同时将每个关键词分词为其词项集合。当某一语句同时包含某一关键词对应的全部核心词项时,即判定该语句与数字技术风险相关: $$s \in \mathcal{S}{i,t} \iff \exists\, k \in K,\ T(k) \subseteq T(s)$$ 其中 $T(\cdot)$ 表示分词后的词项集合,$K$ 为关键词典,$\mathcal{S}{i,t}$ 为企业 $i$ 在第 $t$ 年的关联语句集合。由此从原始语料中提取出涉及数字技术风险暴露与防范的全部关联文本。需要注意的是,该规则是词项集合的包含关系而非连续子串匹配,故关键词的各词项可以分散出现在同一语句的不同位置。切分后长度过短、无法判断语义的碎片(标题、表格残片等)不计入;同一企业年度内完全相同的语句只计一次,以免逐页重复的页眉页脚被反复计入(公司法定名称含词典词时,每一页的页眉都会命中一次)。 第三步,调用大语言模型标注训练集。 从抓取到的关联文本(按去重后的唯一语句计)中随机抽取 15%,交由大语言模型标注。提示词设定为"该论述是否反映企业对数字技术风险采取了防范措施"以及"该论述是否反映企业面临数字技术风险的暴露情况",并要求模型给出风险暴露 / 风险防范 / 不确定三类答案。原文对判为"不确定"的论述由研究团队作人工复核,本数据集在无人工复核环节的条件下将其舍弃,仅以类别明确的语句构成二分类训练集;这一处理不影响第四步对全部关联文本的预测覆盖。 第四步,训练情感分类模型并进行全样本预测。 将标注结果为"风险暴露"的文本赋值为负向标签、"风险防范"的文本赋值为正向标签;以预训练中文金融领域 BERT 为基础模型,按 0.6∶0.4 的比例划分训练集与验证集进行再训练与调优;完成训练后将模型应用于全样本关联文本的自动情感分类预测,得到每条语句的正面情感概率 $p^{+}{s}$ 与负面情感概率 $p^{-}{s}$,并以概率较大者判定该语句的类别。 第五步,设计测度指标。 将预测结果汇总到企业—年份层面。以判定为风险防范的语句集合 $\mathcal{P}{i,t}$ 的正面情感概率平均值表征平均风险防护水平,以判定为风险暴露的语句集合 $\mathcal{E}{i,t}$ 的负面情感概率最大值测度最大风险暴露水平: $$\text{PreventMean}{i,t} = \frac{1}{|\mathcal{P}{i,t}|}\sum{s \in \mathcal{P}{i,t}} p^{+}{s}, \qquad \text{ExposureMax}{i,t} = \max{s \in \mathcal{E}{i,t}} p^{-}{s}$$ 两者之差即为企业数字技术风险治理能力: $$\text{DigiGov}{i,t} = \text{PreventMean}{i,t} - \text{ExposureMax}{i,t}$$ 此处对防范取均值而对暴露取最大值,正是"木桶效应"的体现:企业的风险治理成效取决于其防护措施的平均水准与最薄弱环节(最严重暴露)之间的落差。原文未说明单一类别缺失时的处理,本数据集的做法是:当企业当年不存在风险防范类(或风险暴露类)语句时,相应构件取零,差值仍有定义(其含义与解读注意事项见补充说明)。 指标另提供两个替代口径。其一,考虑到最大值算子对极端值较为敏感——当个别语句的负面情感概率异常偏高时,企业的整体治理成效会被显著低估——将"最大暴露水平"调整为"平均暴露水平",得到 $$\text{DigiGov2}{i,t} = \text{PreventMean}{i,t} - \frac{1}{|\mathcal{E}{i,t}|}\sum{s \in \mathcal{E}{i,t}} p^{-}{s}$$ 其二,从文本数量占比的视角出发,计算风险防范类语句数量占全部关联语句总数的比例,以更直观地体现企业的风险防范倾向: $$\text{DigiGov3}{i,t} = \frac{|\mathcal{P}{i,t}|}{|\mathcal{S}{i,t}|}$$ 在上述原文口径之外,数据集另附两组辅助字段。一是筛选标志,标记同时含有风险防范与风险暴露两类语句的观测($|\mathcal{P}{i,t}|0$ 且 $|\mathcal{E}{i,t}|0$);只有这部分观测的治理能力落在连续取值区间。二是剔除噪声后的稳健口径,即在剔除"仅由灾害性事件类关键词命中"的语句后,以完全相同的第五步公式重算治理能力与语句数——公式不变,仅语句样本不同。 补充说明 样本与口径。 本数据集覆盖具有年报文本的上市公司年度观测,输出为未经样本筛选、未经缩尾的原始值。原文在实证中剔除了金融保险行业、ST 与退市警示、异常交易样本,并对连续变量在 1% 与 99% 水平缩尾;使用者可结合行业与状态标志自行施加相同处理。数据集中含少量 B 股与原三板代码(以 2、4、9 开头的部分代码),建议以 Symbol.str.match(r'^(0|3|6|8|92)') 过滤,该式保留沪深主板、创业板、科创板与北交所(含 920 段);在按本数据集打包分发的版本中,是否为 ST、是否为金融业两个标志已随主数据一并提供。 取值结构与回归设定(最重要的使用提示)。 该指标并非平滑的连续变量,而高度集中于 $-1$、$0$、$+1$ 三处。原因有两层:一是相当比例的公司年度在 MD&A 中未命中任何风险关键词,其两个构件同时取零、指标取零;二是命中语句的公司年度中,多数只有少数几条语句,因而往往只含防范或只含暴露一类,指标便接近 $+1$ 或 $-1$。加之分类模型输出的情感概率高度自信,指标取值在零与 $\pm 0.5$ 之间存在明显的稀疏地带。其实际后果是:以该指标作连续被解释变量时,五等分位分组会塌缩、门槛与分位数回归的设定容易失效;真正落在连续区间的是"同时含两类语句"的子样,其标准差显著更小、分布也与原文报告的形态一致。因此建议:需要连续变量时,用筛选标志取出同时含两类语句的子样;需要全样本时,改用风险防范语句占比这一连续比例口径,或将指标按符号处理为分类变量。 尤须注意零值同时对应三种不同状态:年报从未提及数字技术风险、防范与暴露概率同时饱和的重度披露企业、以及真正的攻防均衡。信息安全类企业往往因大量披露风险防护与风险因素而落在零附近,与"年报一次都没提数字风险"的企业得分接近,而仅写入一句样板防范表述的企业反而取值接近 $+1$。故不宜将该指标的高低直接解读为治理能力排序,回归中应同时纳入关联语句数作为控制变量。 披露篇幅的机械影响。 由于最大暴露水平是极大值统计量,语句越多则该统计量越接近 1,而平均防护水平上升较慢,故指标随语句数系统性下移:语句数只有个别几条时,取值多集中在接近 $+1$ 的一端(此时往往只有防范类语句);语句数达到数十条时,几乎必然同时出现暴露类语句,取值趋近于零。关联语句数本身又与 MD&A 篇幅单调相关。这意味着任何影响年报披露篇幅的因素——监管与可持续披露要求,乃至研究者关心的处理变量本身——都会通过篇幅机械地影响本指标。回归中应控制关联语句数(建议取对数);在公司固定效应模型中,被利用的公司内变异主要来自"当年是否出现某一类语句"的离散跳跃,此时更宜采用风险防范语句占比口径。 关键词典的固有噪声与行业比较。 本数据集忠实保留了原文词典中"信息基础设施风险—灾害性事件"二级分类的全部关键词(该二级分类名本身,以及停电、断电、断网、失火、自然灾害、火灾、洪水、洪涝、暴雨、暴雪、台风、雷电、地震、泥石流、高温、干旱、寒潮,共 18 个词条;剔除灾害类词的稳健口径即以这一集合为判定依据)。这些词在企业年报中大量出现于与数字技术无关的生产经营语境,近三成关联语句仅由该类词命中,其中"高温"一词的贡献最大(如描述高温合金产品、耐高温性能、高温试验设备)。同理,词项集合包含规则允许关键词的词项分散出现,也会产生松匹配(如"数据融合—风险评估"命中"数据风险");公司法定名称本身含词典词的少数企业(如名称含"高温"的耐火材料与高温合金企业),其语句数亦会机械性偏高。 这一噪声在行业横截面上影响最大:农林牧渔业、采矿业、电力热力等行业的关联语句有过半乃至八成以上仅由灾害类词命中(如"受洪、旱等自然灾害及病虫害影响较大""不发生全厂停电"),主口径下这些行业的治理能力均值为负、明显低于制造业与信息技术类行业;而信息传输与软件业的灾害类语句占比极低。剔除灾害类词后,前述行业的均值转正,与信息技术类行业的差距大幅收窄。因此行业间比较、行业异质性分析应以剔除灾害类词的稳健口径为准,主口径不宜直接用于行业排序。 与原文描述统计的可对标性。 原文报告的指标标准差较小、中位数为负,这在数学上要求几乎每个公司年度都同时含有两类语句。
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。