企业网络安全风险治理(ERNIE模型)
「企业网络安全风险治理(ERNIE模型)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 69,680。 衡量上市公司是否已开展网络安全风险治理。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 21 |
| 样本量 | 69,680 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报所属报告年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- IsMDAExtracted [是否成功提取管理层讨论与分析章节] — 是否从该年度年报中成功定位到管理层讨论与分析章节(0=否,1=是),未定位到时该章节文本不参与语句判定
- IsGovernanceExtracted [是否成功提取公司治理章节] — 是否从该年度年报中成功定位到公司治理章节(0=否,1=是),未定位到时该章节文本不参与语句判定
- IsICExtracted [是否成功提取内部控制小节] — 是否从该年度年报中成功定位到内部控制小节(0=否,1=是),该小节在近年年报中多为公司治理章节的子目,与公司治理章节重叠部分不重复计入
- NSentence [目标章节语句总数] — 参考杨鹏等(2026,金融研究)的方法,计算公式为:管理层讨论与分析、公司治理与内部控制三部分文本合并后按句号切分所得的语句总数。单位:句
- NCyberSentence [命中网络安全词典的语句数] — 参考杨鹏等(2026,金融研究)的方法,计算公式为:目标章节语句中至少含有68个网络安全相关词汇之一的语句数量,是提交模型判定的候选语句范围。单位:句
- NCyberGovSentence [网络安全风险治理语句数] — 参考杨鹏等(2026,金融研究)的方法,计算公式为:候选语句中经微调ERNIE大语言模型逐句判定、确认真实反映本企业网络安全风险治理行为的语句数量。单位:句
- CyberGovWordFreq [治理语句网络安全词频] — 参考杨鹏等(2026,金融研究)的方法,计算公式为:上述网络安全风险治理语句中68个网络安全相关词汇出现的总次数(按最左最长且互不重叠的规则计数),对应原文构造工具变量时所用的企业层面词频。单位:次
- IsCyberGovDisclosed [当年是否披露网络安全风险治理信息] — 参考杨鹏等(2026,金融研究)的方法,是否在当年年报中出现与网络安全风险治理措施相关的信息(0=否,1=是);三部分章节均未定位到时取缺失值
- FirstCyberGovYear [首次开展网络安全风险治理的年份] — 参考杨鹏等(2026,金融研究)的方法,计算公式为:该公司历年中首次在年报出现网络安全风险治理信息的报告年度;始终未出现的公司取缺失值,可用作交错双重差分的处理时点
- IsCyberSecurityGovernance [网络安全风险治理] — 参考杨鹏等(2026,金融研究)的方法,是否开展网络安全风险治理(0=否,1=是);网络安全风险治理决策具有连续性、一经执行很难被取消,故自企业首次在年报出现相关信息的年度起该指标一直取1,之前取0;三部分章节均未定位到且此前未触发的企业年取缺失值。用作研究变量,取1代表企业已建立网络安全风险治理能力
常见问题
- 「企业网络安全风险治理(ERNIE模型)」是什么数据集?
- 企业网络安全风险治理(ERNIE模型),隶属公司治理。衡量上市公司是否已开展网络安全风险治理。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 21 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、是否成功提取公司治理章节、是否成功提取内部控制小节、目标章节语句总数、命中网络安全词典的语句数、网络安全风险治理语句数、治理语句网络安全词频、当年是否披露网络安全风险治理信息、首次开展网络安全风险治理的年份、网络安全风险治理。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,680 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在数字经济条件下,数据与信息系统既是企业组织生产、开展创新的基础性资源,也使企业暴露在通过网络实施的攻击、窃取与篡改之下。网络安全风险治理指企业主动识别、评估并应对通过网络对本企业数据资产、商业机密信息与关键基础设施构成的潜在威胁,具体表现为建立信息安全与数据安全管理制度、设置专门的信息安全管理机构与岗位、取得信息安全管理体系认证、部署访问控制与加密传输等技术防护手段、开展数据分级分类与备份容灾,以及针对已识别的网络安全风险给出可执行的应对方案。与被动承受网络安全风险不同,治理行为反映的是企业对该类风险的主动管理能力,因而是研究企业创新、融资约束、信息不对称与供应链风险传导时的一个关键企业特征。 既有文献多以词典法度量企业的网络安全议题,即统计年报中网络安全相关词汇的出现频次。这一做法的局限在于,词频无法判断否定句式,也容易忽略句子的行为主语:一段完全在陈述全球网络安全形势严峻、数据泄露与网络攻击事件频发的文字,会因为密集出现网络安全词汇而被计为高值,但它既未反映企业自身对风险的感知,也未包含任何治理行动。本数据集因此采用杨鹏等(2026)提出的大语言模型识别方案,先用词典缩小待判定的文本范围,再由经过微调的语言模型对语句作语义判定,从而把"提到网络安全"与"开展了网络安全风险治理"区分开。 语料范围。上市企业通常在年报的"管理层讨论与分析""公司治理"与"内部控制情况"三个环节专门讨论针对网络安全风险的治理措施,故以这三部分内容作为初始语料。实现上先分别定位三处章节区间,取区间并集以避免近年年报中"内部控制"作为"公司治理"子目所造成的重复计入,随后删除文本中的全部空白字符使跨行断开的句子恢复完整,再按句号切分为语句。参与判定的语句需含中文字符且长度不少于 5 个字符,长度超过 500 个字符的语句只保留前段以适配模型的输入窗口。语料中混有以繁体撰写的文本,在章节定位之前先以繁体探针检出并整篇转换为简体,使简体词表在这部分文本上同样有效。 词典粗筛。原文依据国家有关部门发布的网络安全法律法规文件、国内外权威研究报告与既有文献(含王辉等,2024),筛选出 68 个与网络安全相关的词汇并完整披露,本数据集逐字沿用该词表,不作增删。以 Aho-Corasick 多模式匹配对全部语句扫描,命中任一词汇的语句进入候选集合,记语句数为 $NCyberSentence$;未命中的语句既不参与标注也不参与预测。词表内存在三组包含关系(如"信息安全"是"信息安全管理体系认证"的前缀,"备份"是"灾难备份"的后缀),词频统计按最左最长且互不重叠的规则计数,同一处文本片段只计一次。 标注与模型训练。在行业—年份层面对候选语句作分层随机抽样构成待标记句库,逐条判断该语句是否既与网络安全相关、又表明本企业已经或正在开展网络安全风险治理,并打上 0—1 标签。判定口径为:行为主语必须是本企业;只陈述外部形势、政策法规与行业趋势的语句取 0;只陈述企业面临网络安全风险而未给出应对措施的语句取 0;描述对外销售的网络安全产品、服务、项目与专利本身属于经营信息,除非说明该技术或制度用于保障自身信息系统与数据安全,否则取 0;否定表述与尚未实施的未来计划取 0。已标记语料按 70% 与 30% 的比例划分训练集与验证集,用于微调 ERNIE 中文预训练语言模型(学习率 5e-5,批大小 32,训练 5 轮,最大输入长度 512 个词元);选用 ERNIE 而非其他中文预训练模型,沿袭金星晔等(2024)在年报语句分类任务上的做法,其对中文语义的理解能力更适合处理年报文本。原文要求分类模型在验证集上达到 90% 及以上的准确率后方可用于全量预测,本数据集沿用该准入门槛,并在满足门槛的若干轮次中按 F1 值择优选取最终模型;若无任一轮次达到门槛则终止,不产出结果。 全量判定与指标构造。已标记语句沿用其标签,其余候选语句由微调后的模型逐句预测,判断其是否真正反映企业的网络安全风险治理行为。记企业 $i$ 第 $t$ 年年报的候选语句集合为 $S{i,t}$,模型判定函数为 $M(\cdot)\in\{0,1\}$,则治理语句数与当年披露状态为 $$NCyberGovSentence{i,t}=\sum{s\in S{i,t}}M(s),\qquad Disclosed{i,t}=\mathbb{1}\left[NCyberGovSentence{i,t}0\right]$$ 其中 $\mathbb{1}[\cdot]$ 为示性函数。同时在治理语句内累计网络安全词汇的出现次数,得到 $CyberGovWordFreq{i,t}$,它对应原文构造工具变量时所用的"年报中真实反映网络安全风险治理信息的词频"这一企业层面基元,研究者可据此自行构造跨企业的留一汇总项。 企业的网络安全风险治理决策通常具有连续性,一经执行很难被取消。因此核心指标不取当年披露状态本身,而取其在企业内沿时间的累计最大值:企业首次在年报出现与网络安全风险治理措施相关的信息之后,该指标自当年起一直取 1,之前取 0, $$CyberSecurity{i,t}=\max{\tau\le t}Disclosed{i,\tau}$$ 触发年份单独输出为 $FirstCyberGovYeari=\min\{t: Disclosed{i,t}=1\}$,可直接用作交错双重差分设计的处理时点。三部分章节均未定位到的企业年缺乏判定依据,其当年披露状态取缺失值;此类企业年若此前已触发吸收态则核心指标仍取 1,若尚未触发则一并取缺失值,不按 0 记。 补充说明 - 样本口径:覆盖语料中全部可得的年报报告年度,不预先施加剔除金融业、剔除特别处理股票、要求连续存在若干年等回归样本限制,研究者按自身设定筛选即可;原文的实证样本区间为 2007—2021 年。 - 标注环节的替代:原文由研究者人工阅读待标记语句打标签,本数据集改由本地部署的大语言模型按同一判定口径逐条标注。这是与原文唯一实质不同的环节,标注噪声会经训练集传导至分类模型,影响方向不定。 - 抽样比例:原文以 5% 的比例抽取待标记语句,本数据集覆盖的年份与公司更多,在保持行业—年份分层方式不变的前提下提高了抽样比例以扩大训练集。 - 词频口径:原文未说明其词频统计是否处理词表内的包含关系,本数据集采用非重叠最长匹配。该处理只影响 $CyberGovWordFreq$ 的量纲,不改变语句是否入选与是否判定为治理行为。 - 口径的时间可比性:年报中与网络安全有关的表述在样本期内经历过结构性变迁,早期主要出现在内部控制自我评价的信息系统控制条目中,近年则更多出现在数据安全与隐私保护的专门段落。两类文本按同一语义标准判定,但语句来源不同,跨越较长年份的比较建议加入年份固定效应,或把样本起点设在内部控制披露格式稳定之后。 - 吸收态的性质:核心指标一经触发不再回落,单次误判会永久生效,且触发往往由少量语句决定。需要更保守设定时,可改用当年披露状态这一非吸收态变量作为主解释变量,或要求连续两年披露后再认定处理。 - 与文本体量的相关性:识别以语句为单位,年报越长、候选语句越多的企业越容易被识别为已开展治理。建议在回归中控制企业规模,必要时把目标章节语句总数作为文本体量的代理变量一并控制,该列已随数据集输出。 - 章节定位的覆盖差异:早期年报尚未形成统一章节规范,定位成功率低于近年;少数以境外上市排版撰写的年报不设编号章节,标准定位失败时改用独立标题行的回退规则,仍有小部分无法定位,其当年判定取缺失值,这部分以大型央企与跨境上市金融机构为主。做全样本研究时建议先查看定位标志列。 - 其他局限:被截断的超长语句若治理表述出现在句尾则可能漏识;企业首次开展治理的当年若恰逢章节定位失败,吸收态的触发年会顺延至下一个可判定年度;词表逐字沿用原文,"数据分类分级""等级保护"等未被原文收录的表述不进入候选。 参考文献 - 杨鹏, 孙伟增, 田轩, 等. 网络安全风险治理与企业创新——基于大语言模型的识别与发现[J]. 金融研究, 2026, (1): 76-94. - 金星晔, 左从江, 方明月, 等. 企业数字化转型的测度难题: 基于大语言模型的新方法与新发现[J]. 经济研究, 2024, 59(3): 34-53. - 王辉, 何冬昕, 陈旭, 等. 网络安全治理与股价崩盘风险——基于上市公司年报文本分析的证据[J]. 金融评论, 2024, 16(1): 86-105.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。