供应链风险(LLM测度)

「供应链风险(LLM测度)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 69,680。 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法构建的企业供应链风险披露指数。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数20
样本量69,680
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年度报告所属会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • NCandidateSents [备选风险语句数] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,年报全文按句切分后,同一语句中同时出现供应链类关键词与风险类关键词的语句数量,构成供应链风险语义判别的备选语料规模。
  • NValidSents [有效供应链风险语句数] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,备选语句经大语言模型语义判别后,确认为真实反映企业所面临供应链风险的语句数量,等于五个风险维度语句数之和。
  • LnSCR [企业供应链风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+经大语言模型判别确认的供应链风险相关有效语句数量)。用作研究变量,越大代表企业管理层对供应链风险的感知、关注与公开披露程度越高。
  • LnSCRSupply [供应端风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+归入供应端风险维度的有效语句数),供应端风险指企业在获取原材料、零部件和服务过程中,因供应商不稳定、采购成本波动或供应渠道受阻等因素引发的风险。用作研究变量,越大代表企业披露的供应端风险越多。
  • LnSCROperation [运营端风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+归入运营端风险维度的有效语句数),运营端风险指从采购到交付的全流程中,因物流、仓储、生产组织、库存管理等环节出现问题,导致效率下降或流程中断的风险。用作研究变量,越大代表企业披露的运营端风险越多。
  • LnSCRDemand [需求端风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+归入需求端风险维度的有效语句数),需求端风险指在产品或服务交付下游客户、实现价值变现的过程中,因市场需求波动、客户结构失衡等导致的滞销或营收不稳定风险。用作研究变量,越大代表企业披露的需求端风险越多。
  • LnSCRExternal [外部环境风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+归入外部环境风险维度的有效语句数),外部环境风险指源于宏观外部环境、企业无法直接控制的因素,对供应链各环节造成系统性冲击的风险。用作研究变量,越大代表企业披露的外部环境风险越多。
  • LnSCRDigital [数字化转型风险] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+归入数字化转型风险维度的有效语句数),数字化转型风险指企业在使用数字化工具进行供应链管理优化时,因技术故障、转型不畅等问题导致效率未达预期或成本上升的风险。用作研究变量,越大代表企业披露的数字化转型风险越多。注意:所用关键词库不含企业资源计划、仓储管理系统等数字化词汇,该维度语句极少进入备选语料,取值高度集中于零,不宜单独用作研究变量。
  • LnSCR1 [供应链风险(传统文本分析法)] — 参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法,计算公式为:ln(1+年报全文中供应链风险关键词的总出现频次),为不经大语言模型语义判别的传统文本分析法口径,用作主口径的稳健性对比。该口径与年报篇幅高度相关,其关键词频次中风险类泛指词占比约五成,宜作主口径的对照而非独立的供应链风险度量。

常见问题

「供应链风险(LLM测度)」是什么数据集?
供应链风险(LLM测度),隶属供应链。参考刘歆、杨亚平 (2026, 山西财经大学学报)的方法构建的企业供应链风险披露指数。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:备选风险语句数、有效供应链风险语句数、企业供应链风险、供应端风险、运营端风险、需求端风险、外部环境风险、数字化转型风险、供应链风险(传统文本分析法)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,680 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的供应商与客户通常数量众多、地域分布广泛,且出于商业机密保护的考虑,供应链结构的具体信息往往披露有限。然而企业在年度报告中所作的风险陈述,凝结了管理层对经营风险的系统总结与前瞻判断,构成了外部观察者识别企业供应链风险的重要信息来源。本指标据此从年报文本出发,度量企业管理层对供应链风险的感知、关注与公开披露程度。 传统的文本度量依赖关键词词典直接计数,存在两类固有缺陷:一方面词典的构建难以做到完备,可能遗漏实际属于供应链风险却未被收录的表述;另一方面单纯基于关键词匹配容易发生误判,把语义无关的文本纳入风险统计——年报中大量关于收入确认时所有权风险报酬转移、存货跌价准备计提方法的会计准则固定表述即属此类,它们含有"风险""存货""客户"等词,却与企业实际面临的供应链风险无关。本指标在词典法的基础上引入大语言模型对测算流程加以优化:词典只承担备选语料的召回,语句是否真实反映供应链风险则交由模型作语义判别。 计算分三步展开。第一步是备选语料召回。年报文本由版式文档转换而来,其中的换行绝大多数是排版造成的硬换行而非句子边界,直接以换行切分会得到版面文本行而不是语句,使跨行的完整风险陈述因供应链词与风险词分落两行而被整条漏掉。因此先把硬换行接回段落——上一行未以句末标点或顿号、逗号收尾,且下一行不以编号开头时,将两行拼接——再以中文句号、问号、感叹号、分号切分为语句,保留长度在 10 至 300 字符之间的片段(下界剔除标题碎片与表格残片,上界避免超出模型的上下文预算)。随后以一部包含 140 个供应链词与 99 个风险词的关键词库对语句作匹配,当同一语句中同时出现供应链类词与风险类词时,该句进入备选语料库。关键词匹配采用 Aho-Corasick 多模式自动机,并按结束位置取最长匹配作去重,以免"中断"与"供应中断"这类存在子串包含关系的词条把同一次出现重复计入。 第二步是语义判别与维度归类。对备选语料中的每一条语句,由大语言模型作双重判别:一是判定该句是否真实反映企业面临的供应链风险,二是将判定为有效的语句归入五大风险维度之一。供应端风险指企业在获取原材料、零部件和服务的过程中,因供应商不稳定、采购成本波动或供应渠道受阻等因素引发的风险;运营端风险指从采购到交付的全流程中,因物流、仓储、生产组织、库存管理等环节出现问题,导致效率下降或流程中断的风险;需求端风险指在产品或服务交付下游客户、实现价值变现的过程中,因市场需求波动、客户结构失衡等导致的滞销或营收不稳定风险;外部环境风险指源于宏观外部环境、企业无法直接控制的因素,对供应链各环节造成系统性冲击的风险,具有突发性和全局性特征;数字化转型风险指企业在使用数字化工具进行供应链管理优化时,因技术故障、转型不畅等问题导致效率未达预期或成本上升的风险。判别时温度参数设为 0 以保证结果可复现,每条语句至多归入一个维度。 第三步是指数构建。将企业当年在五大风险维度下经模型识别为有效的风险描述语句数量加总,对该总和加 1 后取自然对数,即得企业供应链风险披露指数: $$\mathit{lnSCR}{it}=\ln\left(1+\sum{d=1}^{5} N{it}^{d}\right)$$ 其中 $N{it}^{d}$ 为企业 $i$ 在第 $t$ 年被判定归属于维度 $d$ 的有效风险语句数量。五个维度各自的风险水平以同样方式定义,即对该维度的有效语句数加 1 取自然对数,可分别用作被解释变量以识别不同类型供应链风险的差异化表现。 作为对照口径,本数据集同时提供传统文本分析法下的度量:统计年报全文中供应链风险关键词的总出现频次,对其加 1 后取自然对数。该口径不经过语义判别,反映的是关键词的机械匹配强度,可用于与主口径作稳健性对比;其性质与适用边界见补充说明。 补充说明 - 样本口径:输出覆盖全部可得年份与全部行业,不预先施加原文回归样本的限制(原文样本区间为 2015—2023 年,剔除 ST、ST、PT 类公司与金融行业企业,并对连续变量作上下 1% 缩尾)。本数据集各指标均不缩尾,使用者需按研究设计自行截取样本,其描述统计因而不与原文表 1 直接可比。年报文本无法读取或全文过短的企业年不进入样本。 - 召回词典:原文所用的 226 个关键词词表未随文公开,本数据集改用规模相当的同域供应链风险词典(140 个供应链词与 99 个风险词)承担召回。在原文的流程设计中词典仅用于第三步的备选语料召回,判定标准由语言模型给出,词典本身不进入指标计算,因此替换的影响集中于备选集边界而非判定口径;但备选集边界的差异仍会传导至最终计数,本指标与原文并非同一词典下的严格复现。 - 召回逻辑:原文仅说明筛选"包含相关词汇的句子",未指明是任一词命中还是多类词共现。本数据集对两种逻辑各完整跑过一遍判别流程作对比,共现口径在均值、标准差与分布两端均与原文表 1 接近,任一词命中口径则均值显著偏高、标准差大幅压缩且不存在取零的企业年,形态与原文不符,据此采用共现口径。该口径相对更严,会漏掉风险语义由词典外词汇承载的语句,计数略偏保守。 - 判别模型与提示词:原文使用的在线大模型服务在本地不可得,改用本地部署的同类中文大模型完成判别,原文预实验的对比对象亦包含同族模型。提示词中的五大维度定义逐字取自原文,其中排除会计准则一般性定义、否定式表述与供应链无关内容的约束为本实现所加。不同模型与提示词的语义判别边界不同,指标的绝对水平因而不宜与原文逐点比较,横截面与时序上的相对差异则不受影响。 - 数字化转型维度:所采用的替代词典系为传统供应链风险场景构建,不含企业资源计划、仓储管理系统等数字化词汇,该维度的语句基本无法通过召回进入备选语料,其取值因而高度集中于零。该维度不宜单独用作研究变量,其余四个维度不受影响。原文中该维度的回归系数亦不显著。 - 对照口径的性质:传统文本分析法口径与年报篇幅高度相关(与年报字节数的对数相关系数约 0.85,去除年份均值后仍约 0.50),其分子中"损失、影响、风险、客户、存货、可能"一类泛指词合计约占五成,供应链专指词不足一成。原因在于关键词库本身是供应链词与风险词两类词的合集,在全文上直接加总计频时,风险类泛指词脱离供应链语境仍被计入。因此该口径在相当程度上度量的是年报篇幅与风险措辞密度,宜作主口径的对照而非独立的供应链风险度量——这正是原文批评传统词典法、进而引入语义判别的理由。作为对比,主口径与年报篇幅的相关系数为 0.51,去除年份均值后降至 0.15,与企业规模的相关系数接近于零。 - 构念边界与时序解读:本指标度量的是管理层对供应链风险的披露与关注程度,而非结构上的客观暴露,与实际客户、供应商集中度的相关接近于零,二者不可互替;行业间差异符合预期(制造业与农业、采矿业较高,金融业与房地产业较低)。年度均值与年报篇幅高度同向,以篇幅标准化后个别年份的抬升并不突出,故时序变化不宜直接解读为对特定宏观事件的响应;跨年比较须加年份固定效应,面板设定建议按公司聚类标准误。 - 其他局限:语义判别的整体正确率与原文自报水平同量级,但进入分子的有效语句其精确率略低,误判集中于财务报表科目行、仅述应对措施而未指明风险的语句以及信用风险的准则样板段落,使测量误差与年报版式相关而非纯随机。披露规范的变化会同时影响取值,早期年份的年报篇幅与披露规范与近年差异较大。少数公司取值受坏账明细等表格行重复计入抬高,作缩尾即可消除。代码域含 B 股与退市板块代码,限定 A 股样本时应按代码前缀过滤。 参考文献 - 刘歆,杨亚平.有为之手:政府采购与企业供应链风险——基于大语言模型的经验证据[J].山西财经大学学报,2026,48(02):75-87. - Wu D. Text-Based Measure of Supply Chain Risk Exposure[J]. Management Science, 2024, 70(07): 4781-4801.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。