供应链数字化(MD&A词频占比)
「供应链数字化(MD&A词频占比)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 28 个变量,样本量约 69,576。 参考贾俊伟等(2024,管理科学)的方法,基于《供应链数字化管理指南》将企业供应链数字化划分为计划/采购/生产/销售/物流5维度,用文本分析法统计供应链数字化关
| 时间跨度 | 1992-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 28 |
| 样本量 | 69,576 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报对应会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- Freq_Plan [计划数字化词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:计划数字化维度22个关键词(智能决策/智能预测/数字化计划等)在年报管理层讨论与分析部分出现的总次数(Aho-Corasick最左最长非重叠匹配)
- Freq_Purchase [采购数字化词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:采购数字化维度22个关键词(数字化采购/智慧寻源/采购平台等)在年报管理层讨论与分析部分出现的总次数
- Freq_Produce [生产数字化词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:生产数字化维度34个关键词(智能制造/工业互联网/数字工厂等)在年报管理层讨论与分析部分出现的总次数
- Freq_Sales [销售数字化词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:销售数字化维度27个关键词(电子商务/数字营销/O2O等)在年报管理层讨论与分析部分出现的总次数
- Freq_Logistics [物流数字化词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:物流数字化维度27个关键词(智慧物流/智能仓储/数字物流平台等)在年报管理层讨论与分析部分出现的总次数
- FreqTotal [供应链数字化关键词总词频] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:计划/采购/生产/销售/物流五维度共132个供应链数字化关键词在年报管理层讨论与分析部分出现的总次数,为供应链数字化指标的分子
- MDAWords [MD&A语段长度] — 计算公式为:年报管理层讨论与分析部分经jieba分词后的总词数(去停用词与纯标点数字),为供应链数字化指标的分母
- IsMDAExtracted [是否成功提取MD&A(0=否,1=是)] — 是否成功从年报中提取到管理层讨论与分析章节(0=否,1=是)。为0时该章节提取失败并回退全文参与计算,此时供应链数字化指标为全文口径
- SCD [供应链数字化] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:供应链数字化关键词总词频除以年报管理层讨论与分析语段长度再乘以100。用作研究变量,越大代表企业供应链数字化程度越高
- SCD_IndAdj [供应链数字化行业调整值] — 参考贾俊伟等(2024,管理科学)稳健性检验的方法,计算公式为:供应链数字化(SCD)减去其所在分年度分行业(中上协行业分类)的均值,剔除行业系统性差异后的相对水平(行业内当年样本不足10时回退年度全样本均值)
- SCD_Ln [供应链数字化对数值] — 参考贾俊伟等(2024,管理科学)稳健性检验的方法,计算公式为:供应链数字化关键词总词频加1取自然对数
- SCD_Std [供应链数字化标准化值] — 参考贾俊伟等(2024,管理科学)稳健性检验的方法,计算公式为:对供应链数字化关键词总词频进行全样本离差(极差)标准化,取值介于0与1之间,反映企业供应链数字化水平在样本中的相对位置
- SCD_Plan [计划数字化指数] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:计划数字化维度关键词词频除以MD&A语段长度再乘以100,衡量供应链计划环节的数字化程度
- SCD_Purchase [采购数字化指数] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:采购数字化维度关键词词频除以MD&A语段长度再乘以100,衡量供应链采购环节的数字化程度
- SCD_Produce [生产数字化指数] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:生产数字化维度关键词词频除以MD&A语段长度再乘以100,衡量供应链生产环节的数字化程度
- SCD_Sales [销售数字化指数] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:销售数字化维度关键词词频除以MD&A语段长度再乘以100,衡量供应链销售环节的数字化程度
- SCD_Logistics [物流数字化指数] — 参考贾俊伟等(2024,管理科学)的方法,计算公式为:物流数字化维度关键词词频除以MD&A语段长度再乘以100,衡量供应链物流环节的数字化程度
常见问题
- 「供应链数字化(MD&A词频占比)」是什么数据集?
- 供应链数字化(MD&A词频占比),隶属供应链。参考贾俊伟等(2024,管理科学)的方法,基于《供应链数字化管理指南》将企业供应链数字化划分为计划/采购/生产/销售/物流5维度,用文本分析法统计供应链数字化关
- 该数据集的时间范围是?
- 覆盖 1992-2025 年。
- 包含哪些变量/指标?
- 共 28 个变量。核心指标包括:计划数字化词频、采购数字化词频、生产数字化词频、销售数字化词频、物流数字化词频、供应链数字化关键词总词频、MD&A语段长度、是否成功提取MD&A(0=否,1=是)、供应链数字化、供应链数字化行业调整值、供应链数字化对数值、供应链数字化标准化值、计划数字化指数、采购数字化指数、生产数字化指数、销售数字化指数、物流数字化指数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,576 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 供应链数字化是数字技术在企业供应链业务场景中的开发利用,表现为企业计划、采购、生产、销售和物流等环节与数字技术的深度融合。参考贾俊伟等(2024)的方法,本指标依据国家市场监督管理总局与国家标准化管理委员会2022年联合发布的《供应链数字化管理指南》,将企业供应链数字化解构为计划数字化、采购数字化、生产数字化、销售数字化和物流数字化五个维度,并借助文本分析方法,从上市公司年报的"管理层讨论与分析(MD&A)"部分刻画企业层面的供应链数字化程度。 具体而言,先构建涵盖上述五个维度的供应链数字化关键词词典(共132个关键词,如"智能制造""工业互联网""数字化采购""智慧寻源""电子商务""数字营销""智慧物流""智能仓储"等),再统计这些关键词在年报MD&A部分出现的总词频。记企业$i$在第$t$年MD&A中供应链数字化关键词的总词频为$FreqTotal{i,t}$,MD&A语段长度(经中文分词后的总词数)为$MDAWords{i,t}$。考虑到不同年报MD&A部分文本长度的差异,用关键词总词频除以MD&A语段长度并乘以100测度企业供应链数字化程度: $$ SCD{i,t} = \frac{FreqTotal{i,t}}{MDAWords{i,t}} \times 100 $$ 其测量数值越大,表示企业供应链数字化程度越高。关键词匹配采用多模式匹配算法一次扫描完成,并对存在包含关系的关键词(如"智能生产"是"智能生产线"的子串)执行最左最长非重叠匹配,使每处文本仅计一个最长关键词,避免重复计数;对英文关键词施加词边界约束,避免其嵌入更长字符串时误命中。 在核心指标之外,进一步提供三类稳健性度量与五个分环节指数。稳健性度量包括:经分年度分行业均值调整后的$SCD\IndAdj$($SCD$减去其所在年度、所在行业的均值,以剔除行业系统性差异,行业内当年样本不足10家时回退当年全样本均值);对数化度量$SCD\Ln = \ln(FreqTotal+1)$;以及对关键词总词频作全样本离差(极差)标准化得到的$SCD\Std$(取值介于0与1之间,反映企业供应链数字化水平在样本中的相对位置)。五个分环节指数$SCD\Plan$、$SCD\Purchase$、$SCD\Produce$、$SCD\Sales$、$SCD\Logistics$分别以对应维度的关键词词频除以MD&A语段长度再乘以100,用于刻画供应链各具体环节的数字化程度。 补充说明 关键词词典严格采用文献表1公布的五维度132个关键词逐字复现。文献在构词时曾借助Word2Vec相似词技术对人工初选词集作相似词扩充,但该扩充依赖作者训练语料,无法复现,且自行扩充关键词会引入主观性,故本指标仅采用文献公布的词典。这一处理使关键词总词频较文献口径略低,但逐年趋势与文献表2的特征事实高度一致(如2020年至2021年供应链数字化词汇的显著跃升在本指标中同样清晰可见)。 样本覆盖全部A股上市公司与年报可得的全部年份,未套用文献实证部分"剔除金融、ST及信息技术类企业、限定2010至2022年"的研究子样,以便使用者按需筛选;由此,信息技术、互联网等数字化程度极高的行业被纳入,个别企业的指标水平会高于文献报告的上限。指标为原始测度,未作缩尾处理。对于MD&A章节提取是否成功,以$IsMDAExtracted$标识:取值为0时表示提取失败并回退至年报全文参与计算,此时指标为全文口径,使用者可据此字段筛选严格的MD&A口径;早期年份(2000年及以前)受年报格式限制提取成功率偏低,但该时期供应链数字化关键词命中极少、指标近似为零,对结果影响有限。为避免极小分母造成的虚假极端值,剔除了MD&A语段长度过短(不足300词,多为截断或残缺报告)的样本。 参考文献 - 贾俊伟, 武瑛, 何年初, 许江波. 供应链数字化与企业生产率: 要素配置和供应链治理视角[J]. 管理科学, 2024, 37(3): 88-105.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。