供应链风险(内部&外部风险)
「供应链风险(内部&外部风险)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 25 个变量,样本量约 69,105。 参考梁贺等 (2025, 经济学动态)的方法,基于年报“管理层讨论与分析”文本测度的企业-年份层级供应链风险及其来源分解。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 25 |
| 样本量 | 69,105 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NWords [管理层讨论与分析总词数] — 年报“管理层讨论与分析”部分经分词后,剔除纯标点、纯数字、单字词与停用词所剩的词语总数(总词次)。用作供应链风险稳健性口径的分母
- NVocab [管理层讨论与分析词汇数] — 年报“管理层讨论与分析”部分的词汇种数,计算公式为:对总词数所含词语去重后的不同词语个数。用作供应链风险核心指标的分母
- FreqTotal [供应链风险关键词总词频] — 参考梁贺等 (2025, 经济学动态)的方法,统计供应链风险词库中六类关键词在年报“管理层讨论与分析”部分出现的总次数,计算公式为:六类关键词词频之和
- FreqCost [成本和大宗商品价格风险词频] — 成本和大宗商品价格风险类关键词在年报“管理层讨论与分析”部分出现的次数。该类词表共40词,但按本数据集的分词口径实际产生命中的是生产成本、成本增加、关税、经济波动、通胀、能源价格、通货膨胀、石油价格、天然资源等词;原材料价格、汇率波动、采购成本、供应链中断等多字表述会被分词切开而不产生命中,故该类在总词频中占比较小
- FreqClimate [气候风险和流行病风险词频] — 气候风险和流行病风险类关键词在年报“管理层讨论与分析”部分出现的次数。该类实际产生命中的词包括健康、疫情、不确定性、防控、新冠、可持续性、碳排放、自然灾害、环境影响、地震、公共卫生、气候变化、温室气体、检疫、干旱、洪水、灾难、流行病等,其中疫情与防控类表述在公共卫生冲击年份大幅上升;需注意“健康”一词在医疗、体检与大健康类企业中大量来自主营业务描述而非风险披露
- FreqMarket [市场不确定性和地区风险词频] — 市场不确定性和地区风险类关键词在年报“管理层讨论与分析”部分出现的次数。该类词表共19词,但按本数据集的分词口径实际产生命中的仅垄断、战争、波动性、恐怖主义等词;市场风险、地缘政治风险、政策不确定性等多字表述会被分词切开而不产生命中,故该类取值普遍很小
- FreqLiquidity [流动性风险词频] — 流动性风险类关键词在年报“管理层讨论与分析”部分出现的次数。该类词表共23词,但按本数据集的分词口径实际产生命中的是流动资金、信用、现金流、资金短缺等词;流动性风险、偿债能力、融资能力等多字表述会被分词切开而不产生命中。需注意“信用”亦会出现在统一社会信用代码等固定表述中,“现金流”亦会出现在现金流量表科目行中
- FreqAnalyst [分析师和财务问题词频] — 分析师和财务问题类关键词在年报“管理层讨论与分析”部分出现的次数。该类词表共21词,但按本数据集的分词口径实际产生命中的是财务报告、财务指标、财务状况等词;分析师预期、盈利预测、财务困境等多字表述会被分词切开而不产生命中。需注意这三个词大量来自报表附注与章节目录等常规披露文本,不必然对应财务问题
- FreqAcquisition [收购风险词频] — 收购风险类关键词在年报“管理层讨论与分析”部分出现的次数。该类词表共17词,但按本数据集的分词口径实际产生命中的是重组、竞争对手、收购价格、反垄断等词;合并风险、收购风险、整合困难等多字表述会被分词切开而不产生命中。需注意“重组”占该类的大部分,且常来自非经常性损益表中的债务重组、企业重组费用等固定项目
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年报中的“管理层讨论与分析”章节(0=否,1=是),取0时以年报全文替代该章节文本,其分母显著大于正常观测,口径不可比
- SCR [供应链风险] — 参考梁贺等 (2025, 经济学动态)的方法,计算公式为:六类供应链风险关键词总词频/管理层讨论与分析词汇数×100。用作研究变量,越大代表企业面临并披露的供应链总体风险越高
- SCRI [供应链内部风险] — 参考梁贺等 (2025, 经济学动态)的方法,计算公式为:流动性风险与分析师和财务问题两类关键词词频之和/管理层讨论与分析词汇数×100。该两类风险与公司内部的决策、管理和运营能力相关,企业对其有一定的控制权。用作研究变量,越大代表企业面临并披露的供应链内部风险越高
- SCRO [供应链外部风险] — 参考梁贺等 (2025, 经济学动态)的方法,计算公式为:成本和大宗商品价格风险、气候风险和流行病风险、市场不确定性和地区风险、收购风险四类关键词词频之和/管理层讨论与分析词汇数×100。该四类风险多源自公司外部的不可控因素,企业只能通过预防和适应来应对。与供应链内部风险之和恒等于供应链风险。用作研究变量,越大代表企业面临并披露的供应链外部风险越高
- SCRTok [供应链风险(总词次口径)] — 供应链风险的替代分母口径,计算公式为:六类供应链风险关键词总词频/管理层讨论与分析总词数×100。与核心指标的差别仅在于分母改用未去重的总词次,用于检验指标对分母口径的稳健性
常见问题
- 「供应链风险(内部&外部风险)」是什么数据集?
- 供应链风险(内部&外部风险),隶属供应链。参考梁贺等 (2025, 经济学动态)的方法,基于年报“管理层讨论与分析”文本测度的企业-年份层级供应链风险及其来源分解。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 25 个变量。核心指标包括:管理层讨论与分析总词数、管理层讨论与分析词汇数、供应链风险关键词总词频、成本和大宗商品价格风险词频、气候风险和流行病风险词频、市场不确定性和地区风险词频、流动性风险词频、分析师和财务问题词频、收购风险词频、是否成功提取管理层讨论与分析章节、供应链风险、供应链内部风险、供应链外部风险、供应链风险(总词次口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,105 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 供应链安全与稳定既关乎企业自身经营,也是国家经济安全的重要组成部分。与常规经营风险相比,供应链风险的特征在于它并不局限于企业边界之内:企业通过采购、生产与销售环节同上下游形成依存关系,供应链上任一节点中断都可能沿网络蔓延,使局部扰动扩散为波及整个行业乃至整条产业链的冲击。近年来全球疫情、地缘冲突、贸易保护主义抬头以及关键技术与领域的压力,使企业在诸多领域面临"卡脖子""断供"等风险,如何识别并量化微观企业层面的供应链风险因此成为亟待解决的问题。 然而微观企业供应链风险的界定尚未统一,数据量化也存在难度。供应商集中度、客户集中度等财务代理变量反映的是实际交易的存量结果,企业调整上下游结构需要时间,对突发冲击的反映存在滞后;基于生产波动与需求波动偏离程度的测度则依赖于对正常波动的设定。相比之下,年报"管理层讨论与分析"部分包含管理层对当期经营环境变化的讨论与对未来风险的预判,能够在冲击发生的当期即予反映,且覆盖成本、气候、市场、流动性、财务与并购等多元风险来源。本数据集遵循梁贺等 (2025, 经济学动态)的做法,基于该部分文本采用数据挖掘与文本分析方法测度企业供应链风险。 风险词库的构建分两步。首先参考 Ersahin 等 (2024)的研究,从成本和大宗商品价格风险、气候风险和流行病风险、市场不确定性和地区风险、流动性风险、分析师和财务问题以及收购风险六个方面构建供应链风险词库。考虑到中英文词性差异以及应用场景不同,直接将原词库进行中文翻译可能导致文本分析偏误,因此借鉴蓝发钦等 (2025)的做法,参照中文翻译版的《供应链管理》一书,结合中文语境对原英文词库中的关键词进行精确翻译,并通过浏览相关政府公开信息文件,剔除明显与我国企业供应链风险现状描述不符的关键词。最终词库共六类关键词,本数据集逐字采用原文公布的该词表,未作任何增删;其中个别关键词在原表中重复出现,去重后按唯一词计入,跨类重复的关键词只按其首现类别归属一次,以免同一次命中被计入两个分项。 六个方面各自对应供应链上一类可识别的扰动来源:成本和大宗商品价格风险刻画投入品价格、汇率与运输费用的波动;气候风险和流行病风险刻画自然灾害与公共卫生事件造成的供给中断;市场不确定性和地区风险刻画贸易政策、地缘政治与区域性冲突带来的外部环境变化;流动性风险刻画企业自身资金链紧张对履约与采购能力的制约;分析师和财务问题刻画财务信息质量与外部评价所反映的经营压力;收购风险刻画兼并重组过程中的整合失败与隐性负债。前三类源于企业无法控制的外部环境,后两类取决于企业自身的经营与财务状况,收购风险则来自企业自身的战略决策,这一区分正是后文按风险来源分解的依据。 计算分三步。第一步是文本处理:定位年报"管理层讨论与分析"章节,剔除标点符号等无意义文本,调用 jieba 模块进行分词,并进一步剔除纯数字词、单字词与停用词,得到该部分的词语序列。此处还需一步字形归一:少数企业年的语料为繁体公告,而风险词库中绝大多数词条的繁体写法与简体不同,若不归一则这些企业年的关键词计数会几乎全部落空、指标被赋予分布的最小值,而分母仍然正常,依靠内部逻辑一致性的检查无法察觉。因此在分词之前先以词库词的繁体写法作为探针,一旦命中即将全文转换为简体后再进入后续流程。第二步是词频统计:逐词与词库比对,累计六类关键词各自的出现次数及其总和。第三步是归一化:将供应链风险关键词总词频除以该部分的词汇数,得到企业当年的供应链风险 $$SCR{it}=\frac{\sum{k=1}^{K} f{k,it}}{V{it}}\times 100$$ 其中 $f{k,it}$ 为第 $k$ 个供应链风险关键词在企业 $i$ 第 $t$ 年年报"管理层讨论与分析"部分出现的次数,$K$ 为词库中关键词的个数,$V{it}$ 为该部分的词汇数。 在总量指标之外,按风险来源做进一步划分。内部风险通常与公司内部的决策、管理和运营能力相关,企业对其有一定的控制权;外部风险则大多源自公司外部的不可控因素,如市场波动、气候变化或技术威胁,企业只能通过预防和适应来应对。据此将流动性风险、分析师和财务问题两类归为供应链内部风险 $SCRI$,将成本和大宗商品价格风险、气候风险和流行病风险、市场不确定性和地区风险以及收购风险四类归为供应链外部风险 $SCRO$,两者分别以各自所含类别的关键词词频之和为分子、以同一词汇数为分母,因此恒有 $SCR=SCRI+SCRO$,与原文所报告的三个指标之间的数量关系一致。 这一划分在使用上有直接含义:内部风险更多反映企业自身的资金链状况与财务信息质量,可由管理层通过经营决策加以调整,因而在考察公司治理、融资约束等主题时更为贴切;外部风险则更接近企业所处环境受到冲击的强度,在以外生事件为识别策略的研究设计中更具外生性。研究者可根据识别策略选择使用总量指标或其中某一个分量,也可将两者同时纳入以比较不同风险来源的作用差异。 从时间维度看,两类风险呈现出不同的变动模式:外部风险随外部冲击的强度而起伏,在全球疫情冲击最为集中的年份升至峰值而后回落;内部风险则相对平稳并呈缓慢下降之势。这与"外部风险源于企业不可控因素、内部风险取决于企业自身经营管理能力"的界定相符,本数据集所呈现的这一形态与原文所报告的一致。但需同时指出,外部风险的这一起伏在很大程度上由疫病相关词汇的使用频率所驱动,若将气候与流行病一类整体剔除,其余部分在样本期内相当平坦;因此该形态可作为测度方式的一项支持性证据,却不宜单独据此判断企业实际面临的供应链压力在各年之间的强弱。 数据集同时给出计算链上的全部构件量:六类关键词各自的词频、关键词总词频、"管理层讨论与分析"部分的总词次与词汇数,以及章节定位是否成功的标志。使用者可据此自行重构任一口径的指标,按研究需要只取其中某几类风险,或依据分项构成判断某一年度、某一行业的取值主要由哪一类风险所驱动,从而判断结论是否依赖于某个特定类别。数据集对全部可获得年报的企业年输出上述字段,覆盖的年份区间长于原文的研究窗口,便于使用者按自身研究设计截取所需区间。 补充说明 - 样本口径:本数据集对全部可获得年报的企业年、全部行业输出,不预先施加原文"上市公司、剔除样本期内退市和资不抵债的样本、剔除数据严重缺失的样本、剔除金融业相关样本"的回归样本限制,使用者可按年份与行业代码自行截取;各项指标均未做缩尾处理。原文未描述文本可用性门槛,本数据集对年报全文过短、分词后无有效词的企业年不予产出(分母无法定义),未被本平台年报文本预处理收录的少数文件(读取失败或文本过短)同样不进入样本;非六位纯数字代码的证券不进入样本,同一企业年存在多份年报文件时保留其中一份以保证主键唯一。 - 分母口径:原文将供应链风险表述为关键词总词频占"总分词数"的百分比。若按字面取未去重的总词次为分母,指标水平将远低于原文报告的描述统计;改以词汇数(去重后的词语种数)为分母,则指标的离散程度与取值上界同原文高度接近,故判定原文分母实为词汇种数,核心指标据此实现。中文文本分析文献中"总分词数"常被用于指代词汇种数。两种分母对同一企业年是成比例的,企业间排序不受影响;数据集另行给出总词次口径的替代指标,并同时输出两个分母本身,供使用者按需重构。需要明确的是:即便采用该分母,本数据集指标的平均水平仍系统性低于原文报告的均值,且在依次施加原文的样本限制(剔除金融业、剔除特别处理与资不抵债样本、要求控制变量齐全)之后差距并不收敛,说明差异来自计算细节而非样本构成,可能的来源包括停用词表规模、章节提取范围,以及原文或许对部分多字词做过成词处理。因此引用本数据集时宜表述为"参照该文方法构建",而非对该文描述统计的完全复现;回归系数的量纲亦不宜与原文逐位比较。 - 关键词的实际有效性:原文只说明调用 jieba 模块分词,未说明是否将词库词加入用户词典。本数据集不将词库词加入用户词典,分词结果取自本平台对年报文本的统一预处理(其分词器在默认词典之外另载入一份通用技术词表,该词表与本词库仅有少数几处交互,经比对对六类词频与内外部构成的影响都很小)。据此复现的内外部风险构成、年度变动形态与取值上界均同原文一致。这一设定有一个必须知晓的含义:词库中的多字表述若未被默认词典收录,会被切分为更短的词而不再与词库精确匹配,因此相当大比例的词条在实际语料中不会产生任何命中,其中受影响最大的恰是原材料价格、汇率波动、采购成本、供应链中断这类字面上最贴近供应链情境的表述。指标取值因而集中由少数被默认词典收录的高频词驱动:其中疫情、防控等疫病相关表述贡献了相当份额,构成外部风险在公共卫生冲击年份大幅上升的直接来源,属于有效信号;而"健康""流动资金""信用"等通用表述同样占据可观份额,属于噪声成分。这是原文方法本身的性质,本数据集忠实复现,未以扩充用户词典的方式改变口径;使用者可借助数据集给出的六个分项词频判断各类别的实际贡献。 - 风险来源的划分:原文明确给出了五类风险的内外部归属,未说明收购风险的归属,而其所报告的内部风险与外部风险之和恰等于总体风险,说明六类必须全部分入两组。本数据集将收购风险计入外部风险,该设定下内部风险所占份额及外部风险的年度变动幅度均与原文更为接近。使用者若需另一种划分,可用数据集给出的分项词频自行调整。需要注意的是,各类词条被分词切开的比例相差悬殊——外部风险中的气候与流行病一类几乎全部可以匹配,而成本、市场两类的绝大部分不可匹配——因此内部与外部两个分量的相对大小在相当程度上取决于分词粒度而非真实的风险构成;建议将两者视为各有侧重的两个文本强度指标,不宜单独解读其相对大小或分别的回归系数。 这些通用表述并不必然指向供应链情境,由此带来行业间的系统性差异:以健康、医疗、卫生为主营业务的企业,相关词汇的自然使用频率远高于其他行业,指标水平相应偏高并占据取值最高的位置;正在推进重大资产重组的企业也会因"重组"等词密集出现而取得较高取值。指标捕捉的供应链特异成分因此小于其名称的字面含义,与整体风险披露密度及行业属性存在重叠。词表逐字取自原文,未作增删;建议加入行业与年份固定效应,并借助分项词频判断结果是否由某一类别或某一通用词主导。 - 指标性质:该指标衡量的是管理层感知并愿意披露的供应链风险,而非企业客观面临的全部供应链风险。原文通过与经济政策不确定性指数的走势比对、以及与另一套风险感知指标的相关性检验支持其测度效力。本数据集所在目录另有依据不同文献与词表构建的供应链风险指标,它们与本指标的相关程度很低,各自反映方法所定义的不同侧面;建议在稳健性检验中一并报告,选择哪一个应依据研究所要对话的文献。 - 时间维度的使用提醒:外部风险的年度起伏主要由疫病相关词汇驱动,因此在以公共卫生冲击为处理事件的研究设计中,该指标的时间变异与处理变量高度重合,容易造成处理效应的误判;而在全球航运与大宗商品价格剧烈波动的年份,最贴近该情境的成本类分项上升,总指标却因疫病词回落而下降。凡涉及时间维度的识别,建议同时报告剔除气候与流行病一类后的结果。 - 其他局限:指标为比率,分母取决于"管理层讨论与分析"部分的篇幅,而该篇幅在样本期内因披露格式准则修订发生过明显变化,故年度拐点同时受分子与分母驱动,处理时点若邻近这些变更年份需做安慰剂检验;做时间序列解读时建议同时观察数据集给出的词数与词频,或将其对数值作为控制变量。
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。