数字技术风险暴露(Mengzi模型)

「数字技术风险暴露(Mengzi模型)」,覆盖 2003-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 64,602。 衡量企业面临的数字技术相关风险暴露程度。

时间跨度2003-2025 年
数据频率年度
层级上市公司
变量数18
样本量64,602
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票名称] — 上市公司简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • DigiRiskSentCount [数字技术风险关键词句数] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,年报管理层讨论与分析(MD&A)中经Aho-Corasick自动机匹配到的数字技术风险关键词句子总数。用作文本信息量代理或样本筛选(数值越小测量越不稳定)。
  • DigiRiskExpCount [风险暴露句数] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,经微调的中文金融BERT模型(mengzi-bert-base-fin)将每条数字技术风险关键词句判别为风险暴露(-1)或风险防范(+1),本字段为被判别为风险暴露的句子数。
  • DigiRiskPrevCount [风险防范句数] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,经微调的中文金融BERT模型将每条数字技术风险关键词句判别为风险暴露(-1)或风险防范(+1),本字段为被判别为风险防范的句子数。
  • MDAExtracted [MD&A提取标志] — 是否成功从年报全文提取到管理层讨论与分析(MD&A)章节(0=否,1=是)。为0时各数字技术风险暴露指标基于年报全文计算(回退口径)。
  • DigiRiskExposure [数字技术风险暴露] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,计算公式为:DigiRiskExposure=max(P_neg)-mean(P_pos),其中P_neg为风险暴露句的负向(风险)预测概率、P_pos为风险防范句的正向(防范)预测概率,结果在0处截断(小于0取0)。用作研究变量,数值越大代表企业数字技术风险暴露越高。
  • DataRiskExposure [数据风险暴露] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,计算公式同数字技术风险暴露(DigiRiskExposure),但仅基于数据风险(data_risk)类关键词句计算。用作研究变量,数值越大代表企业数据相关风险暴露越高。
  • CyberRiskExposure [网络风险暴露] — 参考卢垚、石晗清、周新怡(2025,经济研究)的方法,计算公式同数字技术风险暴露(DigiRiskExposure),但仅基于网络安全风险(cyber_risk)类关键词句计算。用作研究变量,数值越大代表企业网络安全相关风险暴露越高。

常见问题

「数字技术风险暴露(Mengzi模型)」是什么数据集?
数字技术风险暴露(Mengzi模型),隶属信息环境。衡量企业面临的数字技术相关风险暴露程度。
该数据集的时间范围是?
覆盖 2003-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:数字技术风险关键词句数、风险暴露句数、风险防范句数、MD&A提取标志、数字技术风险暴露、数据风险暴露、网络风险暴露。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 64,602 条观测。
数据是如何测算/获取的?
指标定义与计算方法 数字技术风险暴露指标衡量企业年度报告管理层讨论与分析(MD&A)部分中,数字技术安全相关风险的净暴露程度。该指标参考陆瑶、施函青、周欣怡(2025,经济研究)提出的方法,通过文本分析量化企业面临的数字技术风险水平。 构建过程分为三个阶段。第一阶段为关键词提取:基于《工业和信息化领域数据安全风险信息报送与共享工作指引(2021)》和《国家网络安全事件应急预案(2017)》中的分类体系,构建涵盖数据风险和网络风险两大类的关键词词典,利用Aho-Corasick多模式匹配算法从MD&A文本中提取含关键词的句子。关键词体系包含数据泄露、数据篡改、数据滥用、违规传输、有害程序、网络攻击、设备设施故障等子类。 第二阶段为句子级情感分类:对提取的关键词句子使用预训练中文金融BERT模型进行二分类,判断每句描述的是"风险暴露"(企业面临的威胁和隐患)还是"风险防范"(企业采取的保护和应对措施)。模型输出softmax概率,$P{neg}$表示风险暴露的概率,$P{pos}$表示风险防范的概率。 第三阶段为指标计算。核心指标的定义为: $$\text{DigiRiskExposure} = \max\bigl(P{neg,i}\bigr) - \frac{1}{m}\sum{j=1}^{m} P{pos,j}$$ 其中$P{neg,i}$为第$i$条风险暴露句子的负面情感概率最大值,$P{pos,j}$为第$j$条风险防范句子的正面情感概率均值。若差值为负则设为零。该公式通过最大风险敞口(max算子)与平均防范水平(mean算子)的差异,捕捉企业在数字技术领域的净风险暴露。 进一步,根据句子所匹配关键词的类别差异,可分解为数据安全风险暴露$\text{DataRiskExposure}$(仅基于数据风险类关键词句子)和网络安全风险暴露$\text{CyberRiskExposure}$(仅基于网络风险类关键词句子),计算公式相同。 补充说明 - 样本覆盖2003--2024年A股上市公司年报,关键词词典基于论文公布的核心词表 - MD&A章节通过多模式正则匹配提取,覆盖2001--2024年间的多种年报格式 - 无关键词匹配的公司-年度观测值设为零 - BERT分类模型基于随机抽样标注数据微调,验证准确率约86% 参考文献 - 陆瑶, 施函青, 周欣怡. 中国企业数字技术风险暴露对企业价值的影响--来自大语言模型的文本分析证据[J]. 经济研究, 2025, 60(2): 73-91. - Huang A H, Wang H, Yang Y. FinBERT: A large language model for extracting information from financial text[J]. Contemporary Accounting Research, 2023, 40(2): 806-841.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。