供应链风险(文本分析法B)
「供应链风险(文本分析法B)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 25 个变量,样本量约 69,566。 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,基于年报"管理层讨论与分析"文本测度的企业-年份层级供应链风险及其结构分解。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 25 |
| 样本量 | 69,566 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报对应的会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NWords [管理层讨论与分析总词数] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:年报管理层讨论与分析部分经分词并剔除停用词后的词语总数,是供应链风险及其分环节指标的共同分母
- NSents [管理层讨论与分析总句数] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:年报管理层讨论与分析部分剔除数字、英文字母和除句号外的所有标点符号后,以中文句号为分隔符切分得到的句子总数
- SCSents [供应链相关句数] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中至少出现一个供应链关键词的句子数量,即示性函数取值为1的句子数;供应链关键词为50个
- SCRiskSents [供应链风险句数] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中同时出现供应链关键词与风险词汇的句子数量
- RiskWordsSC [供应链相关句风险词数] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:对所有供应链相关句求和该句内风险词汇出现的次数,同一句内多次出现按次数累计;风险词汇取自聂辉华等 (2020, 世界经济)的不确定性词典
- RiskWordsTotal [管理层讨论与分析风险词总数] — 计算公式为:年报管理层讨论与分析全部句子中风险词汇出现的总次数,风险词汇取自聂辉华等 (2020, 世界经济)的不确定性词典;用于观察供应链风险在企业整体风险表述中的占比
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年报中管理层讨论与分析章节(0=否,1=是);取0时以年报全文作为替代文本,该企业年的各项指标口径与其他年份不完全可比
- SCRisk [供应链风险] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中所有供应链相关句子内风险词汇出现次数之和,除以该部分分词去停用词后的词语总数。用作研究变量,越大代表企业披露的供应链风险越高
- ProcureRisk [采购风险] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中含采购类供应链关键词的句子内风险词汇出现次数之和,除以该部分分词去停用词后的词语总数;采购类由各关键词与"采购"的余弦相似度最大且不低于0.1判定。用作研究变量,越大代表企业供应链风险中来自采购端的暴露越高
- ProduceRisk [生产风险] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中含生产类供应链关键词的句子内风险词汇出现次数之和,除以该部分分词去停用词后的词语总数;生产类由各关键词与"生产"的余弦相似度最大且不低于0.1判定。用作研究变量,越大代表企业供应链风险中来自生产端的暴露越高
- SaleRisk [销售风险] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:管理层讨论与分析中含销售类供应链关键词的句子内风险词汇出现次数之和,除以该部分分词去停用词后的词语总数;销售类由各关键词与"销售"的余弦相似度最大且不低于0.1判定。用作研究变量,越大代表企业供应链风险中来自销售端的暴露越高
- ProcureRiskRatio [采购风险比例] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:采购风险除以采购风险、生产风险与销售风险三者之和;三者之和为0时取缺失值。用作研究变量,越大代表企业供应链风险的来源越集中于采购端
- ProduceRiskRatio [生产风险比例] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:生产风险除以采购风险、生产风险与销售风险三者之和;三者之和为0时取缺失值。用作研究变量,越大代表企业供应链风险的来源越集中于生产端
- SaleRiskRatio [销售风险比例] — 参考张宇等 (2026, 财贸研究)的关键词共现识别策略,计算公式为:销售风险除以采购风险、生产风险与销售风险三者之和;三者之和为0时取缺失值。用作研究变量,越大代表企业供应链风险的来源越集中于销售端
常见问题
- 「供应链风险(文本分析法B)」是什么数据集?
- 供应链风险(文本分析法B),隶属供应链。参考张宇等 (2026, 财贸研究)的关键词共现识别策略,基于年报"管理层讨论与分析"文本测度的企业-年份层级供应链风险及其结构分解。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 25 个变量。核心指标包括:管理层讨论与分析总词数、管理层讨论与分析总句数、供应链相关句数、供应链风险句数、供应链相关句风险词数、管理层讨论与分析风险词总数、是否成功提取管理层讨论与分析章节、供应链风险、采购风险、生产风险、销售风险、采购风险比例、生产风险比例、销售风险比例。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,566 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 供应链风险不同于财务风险、环保风险等常规经营风险,其突出特征是"网络化"与"传导性":企业通过物流、信息流与资金流与上下游形成依存关系,任一节点受到冲击都可能沿网络向上下游扩散,使局部扰动演化为波及整条产业链的系统性风险。正因如此,供应商集中度、客户集中度、存货比例等单一财务代理变量难以刻画这一复合构念——它们取决于实际采购与销售交易的存量结果,企业调整供应商或客户结构需要时间,对突发冲击的反映存在滞后。相比之下,年报"管理层讨论与分析"(以下简称 MD&A)包含管理层对当期经营环境变化的即时讨论与对未来风险的预判,能够在冲击发生的当期便予以反映,且覆盖地缘政治、自然灾害、原材料供给、社会责任等多元化风险来源。监管规则要求上市公司在 MD&A 中"充分、准确、具体"地披露产品价格风险、原材料价格风险、供应风险与单一客户依赖风险,违规将面临处罚;同时企业缺乏夸大风险的动机,因为过度渲染风险既打击投资者信心又会提高融资成本。这两点共同为基于 MD&A 文本测度供应链风险提供了制度基础。 本数据集遵循张宇等 (2026, 财贸研究)的"关键词共现识别"策略。其核心判断是:只有同时处于供应链语境之下、且包含风险描述的文本,才能准确反映企业的供应链风险暴露;单纯出现"供应链"字样而无风险表述,或出现风险表述而与供应链无关,都不应计入。 计算分四步。第一步是文本预处理:定位年报 MD&A 章节后,剔除其中所有数字、英文字母以及除句号外的全部标点符号,再以中文句号为分隔符将文本切割为句子,以句子作为分析的基本单位。此处还需一步字形归一:少数企业年的语料为繁体文本,而风险词典中几乎所有词条的繁体写法都与简体不同,若不归一则这些企业年的风险词汇计数会全部落空、指标被赋予零值这一分布最小值,而供应链关键词中恰有一部分简繁同形仍能命中,使得依靠内部逻辑一致性的检查无法察觉。因此在剔除标点之前,先以词典词的繁体写法作为探针,一旦命中即将全文转换为简体后再进入后续流程。第二步是分词:对每个句子分词并剔除停用词,为避免多字专有表述被切碎,全部词典词均预先加入分词器的用户词典。第三步是识别供应链相关句:若某句子中出现供应链关键词,则该句被定义为"供应链相关句",示性函数 $I(s)$ 取 1,否则取 0。第四步是加总:统计所有供应链相关句中风险词汇出现的频次,除以 MD&A 去除停用词后的词语总数,得到企业当年的供应链风险 $$SCRisk{it}=\frac{\sum{s=1}^{S{it}} ns I(s)}{N{it}}$$ 其中 $ns$ 为句子 $s$ 中风险词汇的数量,$N{it}$ 为 MD&A 去除停用词后的词语总数,$S{it}$ 为句子总数。分子采用"风险词汇数量"而非"风险句子数量":同一句中多次出现风险词汇,往往意味着该风险事件的复杂程度更高或管理层的忧虑感更强,这种语言表达强度上的差异在一定程度上反映了企业风险暴露的真实强度,该处理方式亦与风险文本测度的既有权威文献保持一致。 两套词典的来源不同。供应链关键词共 50 个,直接采用张宇等 (2026)公布的完整词表:该文先用 TF-IDF 从供应链管理教科书中提取"大致与供应链相关"的词汇以缩小候选句集合,再以"供应链"为种子词划分出必然相关的句子集合,用微调后的大语言模型文本分类器判定其余句子是否与供应链相关,最后按贝叶斯边际似然对候选词排序,取判别能力最强的前 50 个。相较人工选词与传统词频统计方法,这一流程降低了主观性并提升了可复制性;本数据集直接采用其最终词表,因此与原文词典完全一致。风险词汇则采用该文明确选用的聂辉华等 (2020, 世界经济)不确定性词典,由"风险""不确定"及其各类同义表述构成,符合中文年报的叙述方式与用词习惯。 在总量指标之外,本数据集进一步按供应链环节做结构分解。对每一个供应链关键词,分别计算它与"采购""生产""销售"三个锚点词的余弦相似度,取相似度最大者作为该关键词的所属环节;若与三个锚点的相似度均低于 0.1,则归入"其他"类而不参与分解。据此把示性函数替换为环节专属的示性函数,即可得到采购风险、生产风险与销售风险 $$ProcureRisk{it}=\frac{\sum{s=1}^{S{it}} ns I{procure}(s)}{N{it}},\quad ProduceRisk{it}=\frac{\sum{s=1}^{S{it}} ns I{produce}(s)}{N{it}},\quad SaleRisk{it}=\frac{\sum{s=1}^{S{it}} ns I{sale}(s)}{N{it}}$$ 三个示性函数彼此独立判断:一个句子若同时含有采购类与销售类关键词,则同时计入采购风险与销售风险;只含"其他"类关键词的句子计入总量指标 $SCRisk$ 但不计入任何一个环节。因此三个环节指标之和既不等于 $SCRisk$,也不是它的上界,使用时不应把三者当作对总量的正交分解。在此基础上,各环节风险占三者之和的比重($ProcureRisk/(ProcureRisk+ProduceRisk+SaleRisk)$ 及其余两式)刻画企业风险来源的相对集中程度,三者之和为零时该组比例取缺失值。 数据集同时给出计算链上的构件量,便于使用者按自身需要重构指标或改换分母:MD&A 总词数与总句数、供应链相关句数、既含供应链关键词又含风险词汇的句子数、供应链相关句中的风险词汇数,以及 MD&A 全文的风险词汇总数。后者与前者之比可用于观察供应链风险在企业整体风险表述中所占的份额。 补充说明 - 样本口径:本数据集对全部可获得年报的企业年、全部行业输出,不预先施加原文"制造业上市公司、2012—2022 年"的回归样本限制,使用者可按年份与行业代码自行截取;各项指标均未做缩尾处理。文本可用性方面,原文未描述门槛,本数据集对年报全文过短、预处理后汉字过少或分词后无有效词的企业年不予产出(分母无法定义),这类观测集中在早期年份;非六位纯数字代码的证券不进入样本,同一企业年存在多份年报文件时保留其中一份以保证主键唯一。原文的关键词提取语料为制造业年报,将指标用于非制造业时其语义贴合度可能下降。 - 指标性质:该指标衡量的是管理层感知并愿意披露的供应链风险,而非企业客观面临的全部供应链风险。管理层受认知能力与信息渠道限制,可能未识别具有黑天鹅性质的尾部风险;出于维护市场预期等考虑,也可能对已感知风险选择性披露。原文通过关税冲击的事件研究、宏观冲击时点比对与股票收益波动率的相关性检验表明,该指标能够系统性反映企业实际面临的供应链风险状况,并相对传统财务代理变量具有增量信息含量。 - 关键词覆盖面与区分力:原文公布的 50 词表中包含"管理""成本""业务""服务""能力""持续"等高度通用的表述,因此被判定为"供应链相关"的句子在 MD&A 中占相当高的比例,绝大部分风险词汇都落在这些句子内。这意味着供应链风险与企业整体的风险披露密度存在大量重叠,指标捕捉的供应链特异性成分小于其名称的字面含义。词表逐字取自原文,未作增删;本数据集同时输出 MD&A 全文风险词汇总数,使用者可据此构造整体风险披露密度并在回归中一并控制,以分离供应链特异的变动。同理,本指标与基于同一风险词典构造的不确定性感知类指标之间存在较强相关,二者同时进入回归时需关注共线性。 - 分词与停用词偏离:原文使用百度解语分词与百度停用词表,本数据集使用 jieba 分词与项目通用停用词表(并将全部词典词从停用词中排除,否则部分词典词会被误剔)。停用词表规模不同会改变分母口径,因此供应链风险的绝对水平不宜与原文直接比较;由于分母对同一企业年的所有指标是共同的,横截面与时序排序以及三个环节比例不受影响。用户词典采用强制词频以保证词典词优先成词,方向上与原文一致,代价是个别词典词会被从更长的复合词中优先切出,使风险词计数与指标水平略有抬升。 - 结构分解的性质:原文只说明按余弦相似度分类关键词,未指明词向量来源。本数据集使用在同一 MD&A 语料上训练的 Word2Vec 词向量算出相似度并落盘留痕,为保证年度重建的可复现性,结果按词向量模型的内容签名冻结复用,模型确实更新时自动重算;个别关键词的归类可能与原文不同,其中有两个关键词不在词向量词表内,一个按组成词向量均值回退,另一个归入"其他"类,二者在总量指标中仍正常生效。更需注意的是,归入生产环节的关键词以通用管理类表述为主,若只保留语义明确指向生产的词,三个环节比例的相对排序会发生反转,因此三比例反映的环节结构对关键词归类相当敏感,宜作为描述性证据而非精确的环节归因;总量指标本身对此稳健得多。此外,三个环节的示性函数独立判断,同一风险词平均会被计入一个以上环节,故三比例的分母是被重复计数放大后的总量。 - 分母的口径敏感性:指标是比率,分母为 MD&A 的词语总数,而 MD&A 的篇幅在样本期内因披露格式准则修订而出现过跳变。因此指标的若干年度拐点在方向上同时受分子(风险表述增减)与分母(篇幅变化)驱动,个别年份主要由分母变化造成。做时间序列解读时建议同时观察本数据集给出的词语总数与风险词汇数,或改用以风险句数为分子的替代口径交叉印证。 - 章节完整性:MD&A 的风险披露内容通常位于章节末段,受年报排版影响,相当比例的观测在风险披露小节之前即被章节定位截断,这类观测的指标系统性偏低,且同一企业在不同年份可能在"含风险披露段"与"不含"之间切换。这部分变异来自排版而非企业风险状况的真实变化。使用者可借助本数据集给出的词语总数与句数部分识别,并建议加入企业与年份固定效应;对时间维度识别要求较高的设计,宜结合稳健性检验。 - 其他局限:少数企业年未能定位到 MD&A 章节,此时以年报全文作为替代文本并以标志列标出,其分母显著大于正常观测,口径不可比,建议剔除或加控制;早期年份的年报章节体例与句读习惯差异较大,章节定位成功率明显偏低、指标取零值的比例明显偏高,且供应链相关句占比在样本期内呈单调上升,样本期两端不宜直接比较,建议样本起点与原文一致;三个环节风险同时为零时三比例取缺失,这类观测集中于文本较短的小规模公司与早期年份,做结构分解的面板会非随机地损失这部分样本。原文限定制造业,若扩展至全行业,金融业企业的指标水平显著高于制造业并会占据取值最高的位置,使用全样本时应剔除金融业。 参考文献 - 张宇,余典范,王超.基于大语言模型方法的供应链风险测度与结构分解[J].财贸研究,2026(3):27-39. - 聂辉华,阮睿,沈吉.企业不确定性感知、投资决策和金融资产配置[J].世界经济,2020,43(6):77-98.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。