重大财务风险信息隐匿(Mengzi位置加权)
「重大财务风险信息隐匿(Mengzi位置加权)」,覆盖 2007-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 61,311。 参考张杰和胡浩然(2026, 投资研究)的方法,基于上市公司年报管理层讨论与分析章节文本构建的企业-年份层面重大财务风险信息隐匿指数。
| 时间跨度 | 2007-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 61,311 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功提取年度报告的管理层讨论与分析章节(0=否,1=是)。取值为0时该企业年的其余数据字段均置为缺失,因为章节定位失败时文本范围会退化为整份年报,语句位置编码与本数据集的章节口径不可比
- NSentences [管理层讨论与分析语句总数] — 参考张杰和胡浩然(2026, 投资研究)的方法,管理层讨论与分析章节全文分句后的语句总数,即隐匿程度计算公式中的分母。计算公式为:以句号、感叹号、问号、分号及换行符为分句符切分章节全文,剔除页眉页脚、纯页码行与披露模板勾选项后,保留汉字数不少于5个的片段并计数
- NMajorRiskSentences [重大财务风险语句数] — 参考张杰和胡浩然(2026, 投资研究)的方法,管理层讨论与分析章节中反映重大财务风险的语句数量(该类语句在训练语料中极为稀少,判别噪声较大,宜作描述性字段而非直接用作被解释变量),经中文金融领域BERT模型逐句判定,风险程度取值为重大财务风险0.6、中等财务风险0.3、无财务风险0。重大财务风险指债务违约、资金链断裂或流动性枯竭、巨额亏损或资不抵债、持续经营能力存在重大不确定性、资产负债率过高、大额资产减值、主要资产被冻结查封、担保代偿等危及企业财务安全的情形
- NMediumRiskSentences [中等财务风险语句数] — 参考张杰和胡浩然(2026, 投资研究)的方法,管理层讨论与分析章节中反映中等财务风险的语句数量,经中文金融领域BERT模型逐句判定,风险程度取值为重大财务风险0.6、中等财务风险0.3、无财务风险0。中等财务风险指应收账款回收与坏账风险、存货跌价风险、毛利率下滑与盈利能力承压、汇率利率波动的不利影响、成本上升挤压利润、融资成本上升等程度较轻且尚未危及财务安全的常规风险提示
- Fic [重大财务风险信息隐匿程度] — 参考张杰和胡浩然(2026, 投资研究)的方法,计算公式为:将管理层讨论与分析章节全文分句并按先后顺序赋予位置编码(首句为1,次句为2,以此类推),对每个语句以其位置编码除以语句总数所得的相对位置为权重,乘以该语句的财务风险程度(重大财务风险取0.6,中等财务风险取0.3,无财务风险取0),再对全部语句求和。投资者按先后顺序阅读年报且注意力随阅读推进而损耗,企业将重大财务风险信息置于文本越靠后的位置,其被投资者察觉的可能性越低。用作研究变量,越大代表企业重大财务风险信息隐匿程度越高
- Fic1 [重大财务风险信息隐匿程度(权重1/0.5/0)] — 参考张杰和胡浩然(2026, 投资研究)的方法,调整财务风险程度权重设定后重新测算的隐匿程度稳健性口径,计算公式与核心口径相同,仅将风险程度取值改为重大财务风险1、中等财务风险0.5、无财务风险0。需注意该权重方案恰为核心口径权重的5/3倍,因而本字段严格等于核心口径的5/3倍(实测相关系数为1.0000),在任何线性模型中系数按比例缩放而显著性完全不变,不构成独立于核心口径的稳健性检验;需要真正的权重稳健性检验请使用权重0.8/0.2/0的口径。越大代表隐匿程度越高
- Fic2 [重大财务风险信息隐匿程度(权重0.8/0.2/0)] — 参考张杰和胡浩然(2026, 投资研究)的方法,调整财务风险程度权重设定后重新测算的隐匿程度稳健性口径,计算公式与核心口径相同,仅将风险程度取值改为重大财务风险0.8、中等财务风险0.2、无财务风险0。用作稳健性检验变量,越大代表隐匿程度越高
- Fic3 [重大财务风险信息隐匿程度(权重0.5/0.4/0.1)] — 参考张杰和胡浩然(2026, 投资研究)的方法,调整财务风险程度权重设定后重新测算的隐匿程度稳健性口径,计算公式与核心口径相同,仅将风险程度取值改为重大财务风险0.5、中等财务风险0.4、无财务风险0.1。需注意该方案给无财务风险语句也赋予0.1的权重,而管理层讨论与分析中约99%的语句无财务风险,故本字段主要由语句总数决定:实测与语句总数的相关系数为0.999,以全部语句皆无风险的机械基准计算已可解释其取值的96.7%,与核心口径的相关仅0.42。该字段在量纲与含义上均不同于前述口径,不建议作为隐匿程度的替代度量。越大代表隐匿程度越高
常见问题
- 「重大财务风险信息隐匿(Mengzi位置加权)」是什么数据集?
- 重大财务风险信息隐匿(Mengzi位置加权),隶属信息环境。参考张杰和胡浩然(2026, 投资研究)的方法,基于上市公司年报管理层讨论与分析章节文本构建的企业-年份层面重大财务风险信息隐匿指数。
- 该数据集的时间范围是?
- 覆盖 2007-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、管理层讨论与分析语句总数、重大财务风险语句数、中等财务风险语句数、重大财务风险信息隐匿程度、重大财务风险信息隐匿程度(权重1/0.5/0)、重大财务风险信息隐匿程度(权重0.8/0.2/0)、重大财务风险信息隐匿程度(权重0.5/0.4/0.1)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 61,311 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 上市公司年度报告是企业对外展示债务违约风险、巨额亏损风险以及流动性风险等重大财务信息的重要载体,投资者通过阅读年报文本评估企业是否具有投资价值。投资者一般按照章节前后顺序阅读年报,而注意力具有有限性:阅读靠前章节时注意力较为集中,随着阅读的持续,注意力逐渐损耗,阅读靠后章节时便难以集中。于是投资者对年报中靠前位置所反映的财务风险信息,其了解程度要高于靠后位置的内容。企业若刻意在年报文本的靠后位置才撰写涉及重大财务风险的信息,被投资者获知的可能性就会降低;反之若置于靠前位置,被获知的可能性就会上升。据此,本数据集将企业隐匿重大财务风险信息定义为:企业利用投资者阅读注意力有限的特征,通过把重大财务风险信息放在年报文本靠后部分的方式,实现对风险信息的隐匿,其目的是避免财务风险信息被投资者察觉,进而引导投资者高估企业的财务健康程度,从而在资本市场获得更多资金支持。 由于现有财务指标无法直观体现隐匿情况,很难通过常规财务数据精准判断企业是否隐匿重大财务风险信息;而以往用于表征财务信息隐匿的信息透明度与盈余管理等指标,前者存在评估结果缺乏一致性的问题,后者则存在难以全面识别和衡量企业盈余管理行为的问题。本数据集转而从年报文本本身出发,借助大语言模型逐句测度财务风险程度,再结合语句位置构造隐匿指数。 本数据集依张杰和胡浩然(2026)提出的测度方法构建。测度以年报的管理层讨论与分析章节为文本范围。首先将该章节全文分割为句子,按句子的先后顺序排列并赋予位置编码:第一个句子编码为 1,第二个句子编码为 2,以此类推。记企业 $i$ 在第 $t$ 年管理层讨论与分析的句子总数为 $Text{it}$,句子 $m$ 的位置编码为 $Position{imt}$,则位置指标 $Position{imt}/Text{it}$ 反映句子位置的靠前程度:句子位置越靠前,该指标取值越小;反之则越大。分句以句号、感叹号、问号、分号以及换行符为分句符;分句之前先移除页眉页脚、纯页码行与披露模板勾选项等非正文版面元素,这些元素不含分句符,若不清除会被整块粘入相邻语句而污染语义;分句之后保留汉字数不少于五个的片段,以滤除页码、序号与纯数字表行等无语义碎片。 其次逐句判定财务风险程度 $Risk{imt}$,取值分为 0.6、0.3 和 0,分别对应重大财务风险、中等财务风险以及无财务风险。重大财务风险指债务违约或逾期未偿、资金链紧张断裂与流动性枯竭、巨额亏损或资不抵债、持续经营能力存在重大不确定性、资产负债率过高与偿债压力巨大、大额资产减值、主要资产被冻结查封、担保被要求代偿等危及企业财务安全的情形;中等财务风险指应收账款回收与坏账风险、存货跌价风险、毛利率下滑与盈利能力承压、汇率与利率波动的不利影响、成本上升挤压利润、融资成本上升与融资渠道受限等程度较轻、尚未危及财务安全的常规风险提示;其余语句为无财务风险。判定由一个在中文金融语料上预训练、并经标注语料微调的 BERT 模型完成。 单个句子的财务风险信息隐匿程度即为 $\left(Position{imt}/Text{it}\right)\times Risk{imt}$。若 $Risk{imt}$ 取值为 0.6 且 $Position{imt}$ 等于 $Text{it}$,该句的隐匿程度为 0.6,表明企业将重大财务风险信息置于文本末尾,存在较为严重的隐匿行为;反之若 $Risk{imt}$ 取值为 0.6 而 $Position{imt}$ 取值为 1,该句的隐匿程度接近于零,意味着企业将重大财务风险信息置于文本起始位置,不存在隐匿行为。对该企业该年管理层讨论与分析全部句子的隐匿程度加总,即得文本层面的重大财务风险信息隐匿程度: $$Fic{it}=\sum{m=1}^{Text{it}}\left(\frac{Position{imt}}{Text{it}}\right)\times Risk{imt}$$ 该指标取值越大,说明企业重大财务风险信息隐匿程度越高。 用于逐句判定的模型按以下步骤获得。其一,以在中文金融领域语料上完成预训练的 BERT 为底座,使模型适应中文经济金融语料环境。其二,构建财务风险词典,该词典包括财务词典与风险词典两个子词典,若年报文本中同时出现两个子词典中的词语,则将该文本识别为包含财务风险信息;与"财务"相关的中心词为流动资产、存货、资产负债率、毛利率、净利率、总资产周转率、现金、资金、产权、利息、长期债务、应收账款、销售以及成本费用,与"风险"相关的中心词为模糊、大概、近似、估摸、推测、猜测、随机、不可预测、不确定性、变化、不定、波动以及浮动。其三,构建待标记句库:分别从不包含关键词、包含两个到十个关键词以及包含十个以上关键词的年报文本中各随机抽取一百份,共三百份年报,将其分割为句子并标注位置编码,再逐句回答两个问题,一是该句是否反映出财务风险信息,二是给不同财务风险程度打分,即重大风险 0.6 分、中等风险 0.3 分以及无风险 0 分;针对难以做出判断的句子,将其剔除出样本库。其四,用带标签数据对模型参数集进行微调,数据按照 8∶2 的比例划分为训练集与测试集。由于无财务风险的语句在年报中占绝大多数,训练时按类别的平方根逆频率加权(完全逆频率加权会使模型把风险语句判得过多,从而系统性抬高指数),并以两个风险类别的宏平均 F1 而非整体准确率选取模型,以避免模型将全部语句判为无风险。该指数的构建思路承自 Kim 等(2024)以文本刻画企业基本面的方法。 除上述核心口径外,本数据集一并提供调整财务风险程度权重设定后重新测度的三个稳健性口径,计算公式与核心口径完全相同,仅替换 $Risk{imt}$ 的三档取值:第一个方案取重大财务风险 1、中等财务风险 0.5、无财务风险 0;第二个方案取 0.8、0.2、0;第三个方案取 0.5、0.4、0.1。此外还提供构成隐匿指数的中间量,包括管理层讨论与分析的语句总数以及其中重大财务风险语句数与中等财务风险语句数,便于使用者自行核验与重构指数。 补充说明 - 样本口径:本数据集为全部 A 股上市公司的企业—年度面板,不预先剔除 ST、\ST、PT 类企业与金融类企业,也不预先剔除财务数据缺失或总资产非正的样本,亦不作缩尾处理;这些属于回归样本的筛选决策,由使用者按研究设计自行施加。原文回归时剔除上述样本并对连续变量作上下 1% 缩尾。 - 章节定位失败的处理:年报章节标题格式历年变动,少数年报无法定位到管理层讨论与分析章节。此类企业—年的全部指标置为缺失,并由"是否成功提取管理层讨论与分析章节"一列标识;不使用回退的年报全文强行计算,因为全文包含三大报表与附注,其句子构成与位置编码同章节口径不可比。 - 模型实例不可跨实例严格比对:原文用于领域预训练的财经新闻语料库属其私有数据集,其专家标注团队亦不可复制。本实现改以中文金融领域预训练底座承担领域适配,并以大语言模型按原文对专家的问题设定与打分尺度逐句标注,抽样设计与训练测试划分均照原文执行。不同的领域预训练语料与标注者会产生不同的模型实例,因而指标的绝对水平与原文不必逐点相等;跨期比较建议加入年份固定效应吸收水平项。 - 分句口径:原文仅说明借助自然语言技术将文本分割为句子,未公布分句符。本实现的分句口径以原文自身报告的句子规模为准绳校准——原文三百份年报共得二十一万余条句子,仅以中文句末标点切分无法达到该量级,须一并以换行符切分,年报正文中大量条目与表行正是以换行而非句号结束。 - 第一个稳健性方案与核心口径严格成比例:权重 $\{1,\,0.5,\,0\}$ 恰为核心口径 $\{0.6,\,0.3,\,0\}$ 的 $5/3$ 倍,故该口径恒等于核心口径乘以 $5/3$。这是权重设定决定的数学恒等式,意味着它在任何线性模型中只会使系数按比例缩放,而 $t$ 值与显著性不变,因此不构成独立于核心口径的稳健性检验。需要真正的权重稳健性检验,宜使用权重为 $\{0.8,\,0.2,\,0\}$ 的方案,该方案与核心口径的比值随企业风险构成而变动。 - 第三个稳健性方案主要反映篇幅:该方案给无财务风险语句也赋予 0.1 的权重,而管理层讨论与分析中绝大多数语句无财务风险,故其取值主要由语句总数决定,与核心口径的相关程度明显低于其余口径。它与核心口径既不在同一量纲,含义也不同,不宜作为隐匿程度的替代度量。 - 指标由"数量"与"位置"两个成分共同决定:核心公式是对全部语句求和而非求平均,故取值同时取决于财务风险语句的多少与其位置的靠后程度,并非纯粹的位置指标。财务状况较差的企业往往披露更多财务风险语句,即使其位置并不更靠后,指标也会更高。需要剥离数量成分、只考察位置成分的研究者,可用本数据集提供的语句数中间字段自行构造风险语句的加权平均相对位置。 - 章节口径的阶段性变化:年报格式准则历经多次修订,管理层讨论与分析章节的名称、边界与风险披露要求随之变动,2012 年前后与 2015 年前后均可观察到章节范围与风险语句密度的阶段性变化。年份固定效应可吸收其水平影响,但跨这些时点的双重差分或事件研究设计宜另做稳健性拆分。 - 样本主体范围:本数据集以年报语料为准绳覆盖全部披露主体,除 A 股外还包含 B 股与新三板、北交所企业;少数主体因不在公司基本信息表中而缺少股票简称与地理字段。做纯 A 股研究请按股票代码首位自行筛选。 - 重大财务风险语句数一列的判别质量:反映重大财务风险的语句在年报中极为稀少,标注语料中该类样本数量很小,因而模型对该类的判别精度明显低于其余两类,预测为"重大"的语句中有相当比例属于误判。该列宜作描述性字段,不宜直接用作被解释变量或分组变量;权重为 $\{0.8,\,0.2,\,0\}$ 的稳健口径因给重大档更高权重,比核心口径更受其影响。核心指标的量级由中等财务风险语句主导,受该类判别质量的影响有限。 - 其他局限:财务风险词典经原文专家团队扩充后的完整词表未公开,本实现以原文明确列出的中心词执行分层抽样;该词典在原文中仅用于筛选待标注年报,不进入指数计算。管理层讨论与分析的篇幅随年份显著增长,语句总数随之上升,使用时宜关注跨期可比性。原文的注意力衰减机制描述的是投资者按章节顺序通读整份年报,而本指标依原文脚注限定在管理层讨论与分析章节内部,故位置指标刻画的是章节内位置;又因该章节的风险因素与未来展望通常按格式惯例排在靠后小节,位置取值在一定程度上反映年报模板结构。 参考文献 - 张杰,胡浩然.信贷不可得性与企业重大财务风险信息隐匿——基于大语言模型BERT[J].投资研究,2026,45(4):28-47. - Kim A, Muhn M, Nikolaev V V, et al. Learning Fundamentals from Text[R]. Chicago: Chicago Booth Accounting Research Center Research Paper, Fama-Miller Working Paper, 2024.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。