供应链中断风险(种子词拓展文本分析)
「供应链中断风险(种子词拓展文本分析)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,856。 衡量企业面临的供应链中断风险。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 67,856 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年报对应年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- SeedFreq [种子词词频] — 参考江伟, 王楠, 曹少鹏(2025, 南开管理评论)的方法,20个供应链中断风险种子词在MD&A文本中的匹配总词频。单位:次
- ExpandFreq [扩展词词频] — 参考江伟, 王楠, 曹少鹏(2025, 南开管理评论)的方法,基于Word2Vec种子词扩展后197个关键词在MD&A文本中的匹配总词频。单位:次
- TotalWords [MD&A总词数] — jieba分词后MD&A章节(或全文)的总词数。单位:个
- SCDRisk1 [供应链中断风险指数1] — 参考江伟, 王楠, 曹少鹏(2025, 南开管理评论)的方法,计算公式为:扩展词词频/MD&A总词数。用作研究变量,越大代表供应链中断风险讨论越多。单位:比例
- SCDRisk2 [供应链中断风险指数2] — 参考江伟, 王楠, 曹少鹏(2025, 南开管理评论)的方法,计算公式为:ln(1+扩展词词频)。用作研究变量,越大代表供应链中断风险讨论越多
- SCDRisk3 [供应链中断风险指数3] — 参考江伟, 王楠, 曹少鹏(2025, 南开管理评论)的方法,计算公式为:种子词词频/MD&A总词数。仅使用20个原始种子词,用作稳健性检验。单位:比例
- MDAExtracted [MD&A提取标志] — 是否成功提取MD&A章节(0=否,1=是)。提取失败时使用年报全文替代
- ExpandedDictSize [扩展词典规模] — Word2Vec种子词扩展后的关键词总数(含种子词)。单位:个
常见问题
- 「供应链中断风险(种子词拓展文本分析)」是什么数据集?
- 供应链中断风险(种子词拓展文本分析),隶属供应链。衡量企业面临的供应链中断风险。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:种子词词频、扩展词词频、MD&A总词数、供应链中断风险指数1、供应链中断风险指数2、供应链中断风险指数3、MD&A提取标志、扩展词典规模。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,856 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集提供了基于上市公司年报文本分析的企业供应链中断风险度量指标。该方法借鉴了江伟、王楠和曹少鹏(2025)的研究,通过自然语言处理技术,从公司管理层讨论与分析(MD&A)文本中捕捉与供应链中断风险相关的讨论强度,以此作为风险的代理变量。其核心思路是,公司在年报中提及供应链中断相关词汇的频率越高,可能表明其面临的供应链风险越大或管理层对此越为关注。 首先,研究选取了20个与供应链中断风险相关的种子词。随后,利用Word2Vec词嵌入模型(CBOW架构,向量维度200,窗口大小5)在全部上市公司年报的MD&A文本语料上进行训练,以捕捉词语的语义关联。对于每个种子词,计算其在词向量空间中的余弦相似度,选取最相似的10个词语,合并去重后形成一个扩展的关键词表,最终包含197个关键词(含原始种子词)。SeedFreq即为20个原始种子词在目标公司MD&A文本中出现的总次数,ExpandFreq为扩展后完整词表中所有关键词在文本中出现的总次数,TotalWords为经过分词处理后MD&A文本(若提取失败则使用年报全文)的总词数。 基于上述基础变量,构建了三个核心的供应链中断风险指标。SCDRisk1是主要的研究变量,计算为扩展关键词词频占总词数的比例,用以标准化文本长度的影响。SCDRisk2为扩展关键词词频加1后的自然对数值,作为另一种形式的强度度量。SCDRisk3则作为稳健性检验指标,仅使用原始种子词的词频占总词数的比例进行计算。 计算公式分别为: $$SCDRisk1 = \frac{ExpandFreq}{TotalWords}$$ $$SCDRisk2 = \ln(1 + ExpandFreq)$$ $$SCDRisk3 = \frac{SeedFreq}{TotalWords}$$ 其中$ExpandFreq$为扩展关键词词频,$TotalWords$为MD&A总词数,$SeedFreq$为种子词词频。 补充说明 - 文本来源为公司年报,优先提取“管理层讨论与分析”(MD&A)章节内容进行分析。若MD&A章节提取失败(MDAExtracted=0),则使用年报全文作为分析文本。 - 文本处理采用jieba分词工具进行分词。 参考文献 - 江伟, 王楠, 曹少鹏. 供应链中断风险的度量与应用:基于词嵌入模型的分析[J]. 南开管理评论, 2025, 28(4): 109-120.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。