供应链风险感知(文本分析法)

「供应链风险感知(文本分析法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 67,314。 衡量企业对供应链风险的感知水平。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数18
样本量67,314
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • SCR_W [供应链风险感知-词频] — 参考Wu (2024, Management Science)的方法,中国适配参照罗丹等(2025, 科学决策),计算公式为:ln(共现次数+1)。定位MD&A文本中供应链关键词(jieba分词),检查前后10个词窗口内是否出现风险关键词,统计共现次数后取自然对数。用作研究变量,越大代表企业供应链风险感知越强
  • SCR_C [供应链风险感知-字符] — 参考Wu (2024, Management Science)的方法,计算公式为:ln(共现字符数+1)。定位MD&A文本中供应链关键词的字符位置,截取前后15个字符检查是否出现风险关键词,统计共现的供应链关键词字符数后取自然对数。作为供应链风险感知-词频的稳健性检验替代变量
  • CoocCount [共现次数] — 参考Wu (2024, Management Science)的方法,供应链风险感知-词频的原始共现计数(未取对数),即在10词窗口内与风险关键词共现的供应链关键词个数。单位:次
  • CoocCharCount [共现字符数] — 参考Wu (2024, Management Science)的方法,供应链风险感知-字符的原始共现字符计数(未取对数),即在15字符窗口内与风险关键词共现的供应链关键词字符数。单位:个
  • SCWordCount [供应链词频] — MD&A文本中供应链关键词出现的总次数(jieba分词后统计)。单位:次
  • TotalChars [总中文字符数] — MD&A文本中中文字符总数。单位:个
  • MDAExtracted [MDA提取标志] — 是否成功提取管理层讨论与分析章节(0=否,1=是),MDA提取标志=0时人工智能水平-MDA基于全文计算

常见问题

「供应链风险感知(文本分析法)」是什么数据集?
供应链风险感知(文本分析法),隶属供应链。衡量企业对供应链风险的感知水平。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:供应链风险感知-词频、供应链风险感知-字符、共现次数、共现字符数、供应链词频、总中文字符数、MDA提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,314 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集采用文本分析方法,从上市公司年报的“管理层讨论与分析”(MD&A)章节中度量企业对供应链风险的感知水平。该方法借鉴了Wu (2024)的研究思路,并结合中国市场的文本特征进行了适配。其核心思想是,当企业在讨论供应链相关议题时,若同时提及风险,则表明其感知到了供应链风险。通过统计供应链关键词与风险关键词在特定文本窗口内的共现频率,可以量化这种风险感知的强度。 首先,从年报中提取MD&A文本。若成功提取,则基于该章节文本进行计算;若提取失败(MDAExtracted=0),则基于年报全文进行计算。在文本处理中,使用中文分词工具对文本进行分词,并识别两类关键词:供应链关键词(如“供应商”、“物流”、“库存”等)和风险关键词(如“风险”、“波动”、“中断”等)。 计算过程涉及两个核心的原始计数变量。CoocCount(共现次数)度量在词级别上的共现强度:定位到每一个供应链关键词后,检查其前后10个词的窗口内是否出现风险关键词,若出现则计一次共现,统计所有供应链关键词的此类共现总次数。CoocCharCount(共现字符数)则在字符级别上提供另一种度量:定位到供应链关键词的字符位置,截取其前后15个字符的窗口,检查其中是否出现风险关键词,并统计所有共现的供应链关键词的字符总数。作为基础统计量,SCWordCount记录了MD&A中供应链关键词出现的总次数,TotalChars记录了用于分析的文本总字符数。 最终的核心指标通过对上述原始计数进行标准化处理得到,以缓解极端值的影响并使其更符合正态分布。主要研究变量为SCRW(供应链风险感知-词频),其计算公式为: $$SCR\W = \ln(CoocCount + 1)$$ 作为稳健性检验的替代变量,SCRC(供应链风险感知-字符)的计算公式为: $$SCR\C = \ln(CoocCharCount + 1)$$ 其中$CoocCount$为供应链词与风险词在10词窗口内的共现次数,$CoocCharCount$为在15字符窗口内共现的供应链词字符数。指标值越大,代表企业从文本中反映出的供应链风险感知越强。 补充说明 - 计算基于上市公司年报的MD&A章节文本,若该章节提取失败,则基于年报全文计算。 - 对SCRW和SCRC的原始计数(CoocCount, CoocCharCount)进行了加1后取自然对数的处理。 参考文献 - Wu D. Measuring supply chain risks using text analysis[J]. Management Science, 2024. - 罗丹,李婉丽,徐香,等.供应链风险感知与企业投资效率[J].科学决策,2025,(1):82-105.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。