生产网络数字技术扩散

「生产网络数字技术扩散」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 36 个变量,样本量约 44,596。 参考金星晔等 (2026, 管理世界)的方法,将上市公司年报中的主营业务描述文本与2017年全国投入产出表的149个产品部门相匹配,构建上市公司之间在投入品与产

时间跨度2015-2025 年
数据频率年度
层级上市公司
变量数36
样本量44,596
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年度报告所属会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • IsDigiTech [是否使用数字技术] — 是否使用数字技术(0=否,1=是)。该变量即金星晔等 (2026, 管理世界)生产网络扩散研究中的数字技术使用变量,其测度方法出自金星晔等 (2024, 经济研究),计算公式为:企业当年只要使用了大数据、人工智能、移动互联、云计算、物联网、区块链六类数字技术中的任意一种则取1,六类均未使用则取0。该变量既是生产网络中被加权汇总的扩散源,也是扩散效应研究的被解释变量
  • TopSectorCode [最匹配产品部门代码] — 企业主营业务文本与投入产出表149个产品部门的文本相似度最高者所对应的产品部门代码(5位)。属生产网络构建过程的中间信息,因文本匹配存在噪声,不建议用作企业行业分类标识
  • TopSectorName [最匹配产品部门名称] — 企业主营业务文本与投入产出表149个产品部门的文本相似度最高者所对应的产品部门名称。属生产网络构建过程的中间信息,因文本匹配存在噪声,不建议用作企业行业分类标识
  • TopSectorSim [最匹配产品部门相似度] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:企业主营业务产品词向量与最匹配产品部门词向量之间的余弦相似度。取值介于0与1之间,越大表示该产品部门归属越可靠,可用作部门匹配结果的置信度
  • RelationUp [上游生产网络关联强度合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:生产网络中全部企业作为上游方与该企业之间关联程度的合计。关联程度由双方主营产品在投入产出表中的垂直关联程度决定,数值越大表示该企业在生产网络中承接的上游关联越广越强
  • RelationDown [下游生产网络关联强度合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:该企业作为上游方与生产网络中全部企业之间关联程度的合计。数值越大表示该企业的产出在生产网络中被下游使用得越广越强
  • NAsCoreUpstream [作为核心上游被依赖企业数] — 参考金星晔等 (2026, 管理世界)界定关联企业时采用的前1%关联强度阈值,计算公式为:对每家企业按关联强度取前1%的对手方作为其核心上游,统计该企业被多少家企业列入核心上游名单。数值越大表示该企业作为供给方被依赖的范围越广。因核心地位高度集中,多数企业取值为0;该变量的年度均值在构造上等于阈值对应的企业数,随样本规模变化,不宜跨年度直接比较
  • NAsCoreDownstream [作为核心下游被依赖企业数] — 参考金星晔等 (2026, 管理世界)界定关联企业时采用的前1%关联强度阈值,计算公式为:对每家企业按关联强度取前1%的对手方作为其核心下游,统计该企业被多少家企业列入核心下游名单。数值越大表示该企业作为需求方被依赖的范围越广。因核心地位高度集中,多数企业取值为0;该变量的年度均值在构造上等于阈值对应的企业数,随样本规模变化,不宜跨年度直接比较
  • DTDiffusion [生产网络数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上游企业与全部下游企业当年是否使用数字技术分别加权求和后相加。关联程度由双方主营产品在2017年投入产出表中的垂直关联程度决定。用作研究变量,越大代表该企业在生产网络中面临的数字技术扩散压力越强。使用时应同时控制所处行业与所在地区的平均数字技术使用水平,并纳入企业与年份固定效应
  • DTDiffusionUp [上游数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上游企业当年是否使用数字技术加权求和。用作研究变量,越大代表来自上游方向的数字技术扩散越强
  • DTDiffusionDown [下游数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部下游企业当年是否使用数字技术加权求和。用作研究变量,越大代表来自下游方向的数字技术扩散越强
  • DTDiffusionWeight [规模加权数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在以生产网络关联程度加权的基础上,再以上下游企业的公司规模加权,并除以同样加权的规模合计。该口径在构造上已将关联强度总量约去,余下的是关联强度加权的上下游企业采用率,刻画的构念与主指标不同,不宜视为主指标的等价替代
  • DTDiffusionNoSelf [剔除自身的数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在生产网络数字技术扩散的基础上,扣除企业自身与自身之间关联所贡献的部分,仅保留不同企业之间的扩散。用于排除企业因经营多元化而同时充当上游与下游所带来的自相关干扰
  • DTDiffusionNoCity [剔除同城市关联的数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在生产网络数字技术扩散的基础上,将与焦点企业注册于同一城市的上下游企业的关联权重置为零后重新加权求和。用于排除地理邻近带来的空间溢出干扰。企业注册地城市未知时该指标取缺失值
  • DTDiffusionNoProvince [剔除同省份关联的数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在生产网络数字技术扩散的基础上,将与焦点企业注册于同一省份的上下游企业的关联权重置为零后重新加权求和。用于排除区域政策环境与要素市场一体化带来的干扰。企业注册地省份未知时该指标取缺失值
  • DTDiffusionTier2 [二阶生产网络数字技术扩散] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:将生产网络关联矩阵自乘一次后,以所得的二阶关联程度为权重,对上下游企业当年是否使用数字技术加权求和。用于刻画数字技术沿生产网络向更高层级传播的溢出效应,越大代表该企业所处的二阶网络中数字技术渗透越深
  • DTIndustry [所处行业平均数字技术使用] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:该企业当年所处二级行业内全部上市公司是否使用数字技术的算术平均值,按原文口径包含焦点企业自身。用作生产网络扩散效应回归中的行业层面控制变量
  • DTCity [所在城市平均数字技术使用] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:该企业当年注册地所在城市内全部上市公司是否使用数字技术的算术平均值,按原文口径包含焦点企业自身。用作生产网络扩散效应回归中的地区层面控制变量。城市内上市公司数量较少时该均值受焦点企业自身影响较大
  • SizeNetwork [上下游企业规模加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的公司规模加权求和,公司规模为总资产的自然对数。用作生产网络扩散效应回归中的关联企业特征控制变量
  • AgeNetwork [上下游企业上市年限加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的上市年限加权求和,上市年限为上市年数加一后取自然对数。用作生产网络扩散效应回归中的关联企业特征控制变量
  • LevNetwork [上下游企业资产负债率加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的资产负债率加权求和,资产负债率为总负债与总资产之比。用作生产网络扩散效应回归中的关联企业特征控制变量
  • LiquidNetwork [上下游企业流动比率加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的流动比率加权求和,流动比率为流动资产与总资产之比。用作生产网络扩散效应回归中的关联企业特征控制变量
  • GrowthNetwork [上下游企业营收增长率加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的营业收入年度增长率加权求和。用作生产网络扩散效应回归中的关联企业特征控制变量
  • CFNetwork [上下游企业经营现金流加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业的经营现金流比率加权求和,经营现金流比率为经营活动产生的现金流量净额与总资产之比。用作生产网络扩散效应回归中的关联企业特征控制变量
  • DualNetwork [上下游企业两职合一加权合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联程度为权重,对全部上下游企业董事长是否兼任总经理的取值加权求和。用作生产网络扩散效应回归中的关联企业特征控制变量

常见问题

「生产网络数字技术扩散」是什么数据集?
生产网络数字技术扩散,隶属供应链。参考金星晔等 (2026, 管理世界)的方法,将上市公司年报中的主营业务描述文本与2017年全国投入产出表的149个产品部门相匹配,构建上市公司之间在投入品与产
该数据集的时间范围是?
覆盖 2015-2025 年。
包含哪些变量/指标?
共 36 个变量。核心指标包括:是否使用数字技术、最匹配产品部门代码、最匹配产品部门名称、最匹配产品部门相似度、上游生产网络关联强度合计、下游生产网络关联强度合计、作为核心上游被依赖企业数、作为核心下游被依赖企业数、生产网络数字技术扩散、上游数字技术扩散、下游数字技术扩散、规模加权数字技术扩散、剔除自身的数字技术扩散、剔除同城市关联的数字技术扩散、剔除同省份关联的数字技术扩散、二阶生产网络数字技术扩散、所处行业平均数字技术使用、所在城市平均数字技术使用、上下游企业规模加权合计、上下游企业上市年限加权合计、上下游企业资产负债率加权合计、上下游企业流动比率加权合计、上下游企业营收增长率加权合计、上下游企业经营现金流加权合计、上下游企业两职合一加权合计。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 44,596 条观测。
数据是如何测算/获取的?
指标定义与计算方法 数字技术在企业之间的扩散,并不只发生在已经存在实际交易的供应商与客户之间。处在同一条产业链上的企业,即便没有直接的购销往来,也会因为共用技术标准、共享产品接口、面对相同的中间品质量要求与竞争压力,而在技术选择上相互牵引。要刻画这种以投入产出结构为骨架的技术传导,就需要一张覆盖面足够宽、又能反映企业异质性的企业间生产网络。本数据集参考金星晔等 (2026, 管理世界)的方法,把上市公司年度报告中的主营业务描述文本与投入产出表中的产品部门相匹配,据此构建上市公司之间在投入品与产出品层面的结构性关联,并在此网络上测度数字技术由上下游关联企业向焦点企业扩散的强度。 构建网络的第一步是刻画产品部门之间的垂直关联程度。以全国投入产出表的中间流量矩阵 $CFLOW$ 为基础,把行方向的产品部门 $c$ 视为上游、列方向的产品部门 $d$ 视为下游,分别按行与按列做归一化: $$SUPP{cd}=\frac{CFLOW{cd}}{\sum{d=1}^{149}CFLOW{cd}},\qquad CUST{cd}=\frac{CFLOW{cd}}{\sum{c=1}^{149}CFLOW{cd}}$$ 其中 $SUPP{cd}$ 表示上游部门 $c$ 的总产出中用于生产下游部门 $d$ 的比例,$CUST{cd}$ 表示生产下游部门 $d$ 的总投入中上游部门 $c$ 所占的比例。两者的算术平均即为产品部门层面的垂直关联矩阵: $$V=\frac{SUPP+CUST}{2}$$ $V$ 的维度为 149 乘 149,元素 $v{cd}$ 越大,表示产品 $c$ 与产品 $d$ 之间的上下游关联越紧密。 第二步是把上市公司落到这 149 个产品部门上。自公司业务概要成为年度报告的规定披露内容以来,上市公司需要说明报告期内所从事的主要业务、主要产品及其用途。据此提取每家公司当年的主营业务描述文本,剔除其中"不涉及""不包含"一类的排除性语句,再做中文分词与停用词过滤。为了让产品名称能被完整切分而不被拆散,分词前先把上市公司披露的主营业务产品名称加入分词词库;分词之后,仅保留落在产品词表内的词,从而把经营模式、行业地位等叙述性内容滤去,得到企业 $f$ 在 $t$ 年的主营产品词集合,并据此构造词频-逆文档频率向量 $X{ft}$。 产品部门一侧作同样处理。投入产出表的部门分类建立在国民经济行业分类基础之上,因而每个产品部门都能对应到该分类中的一组类目。取这些类目的名称与释义文句作为该部门的商品描述文本,重复上述分词与停用词过滤,得到部门 $p$ 的词向量 $Yp$。企业向量与部门向量在同一词表空间内拟合,二者的余弦相似度构成企业—部门相似度矩阵: $$Bt=\left[b{fp}\right],\qquad b{fp}=\cos\left(X{ft},Yp\right)$$ $b{fp}$ 越接近 1,说明该公司的主营产品与该产品部门越接近。 第三步把部门层面的垂直关联映射回企业层面。企业之间的关联强度等于双方产品构成经由产品部门垂直关联矩阵的加权耦合: $$Relationt=Bt\times V\times Bt^{\mathsf{T}}$$ 矩阵 $Relationt$ 的维度为企业数乘企业数,元素 $relation{ijt}$ 表示 $t$ 年企业 $i$ 作为上游、企业 $j$ 作为下游时二者的关联程度。由于投入产出表中每个部门同时扮演供给者与需求者,任一企业在网络中也同时具备上游与下游两重身份。 在此基础上,核心指标衡量与焦点企业相关联的上下游企业的数字技术使用情况,按关联强度加权汇总: $$DT\Diffusion{it}=\sum{j}relation{jit}\times DT\Adoption{jt}+\sum{k}relation{ikt}\times DT\Adoption{ikt}$$ 其中第一项沿关联矩阵的列方向求和,刻画上游企业对焦点企业的技术扩散;第二项沿行方向求和,刻画下游企业的技术扩散。$DT\Adoption$ 为企业当年是否使用大数据、人工智能、移动互联、云计算、物联网、区块链六类数字技术之一的二元变量,其测度沿用金星晔等 (2024, 经济研究)提出的方法,即以人工标注语料微调预训练语言模型后,对年报语句逐句判别企业对各类数字技术的实际使用情况。该二元变量同时作为本数据集的字段输出,便于使用者复核加权过程或直接用作被解释变量。 围绕核心指标,数据集提供若干替代口径。区分扩散来源的两个分量分别只保留上游项或下游项。规模加权口径在关联强度之上再以上下游企业规模加权并除以加权后的规模合计。剔除自身口径扣除企业因经营多元化而同时充当上下游所贡献的部分。剔除同城市与剔除同省份两个口径,把注册地与焦点企业相同的关联方权重置零,用于分离地理邻近带来的空间溢出。二阶口径将关联矩阵自乘一次,以刻画技术沿生产网络向更高层级的传播。此外,按前百分之一的关联强度阈值界定核心上下游,统计焦点企业被多少家企业列入核心名单,用以描述其在网络中作为供给方或需求方被依赖的广度。 数据集还以同一加权结构汇总了上下游关联企业的公司特征,包括公司规模、上市年限、资产负债率、流动比率、营业收入增长率、经营现金流比率与两职合一,并给出焦点企业所处行业与所在城市的平均数字技术使用水平。这些变量是在生产网络视角下开展回归分析时的配套控制变量,若没有企业间关联强度矩阵则无法构造。 补充说明 - 样本口径:起始年份取决于公司业务概要成为年报规定披露内容的时点,此前的年度报告没有可比的业务描述章节,无法向前延伸。数据集不预先剔除金融业、交易状态异常的公司或存在缺失的观测,也不做缩尾处理,这些回归样本限制留给使用者按研究设计自行施加。未能匹配到任何产品部门的企业,其网络类指标取缺失值而非零;注册地未知的企业,剔除同城市与同省份两个口径同样取缺失值,以免与"剔除后没有变化"相混淆。 - 产品词表的替代:原文以电商商品词库与商业数据库中的主营产品名称共同构成产品关键词,前者无法获取,本实现仅以上市公司披露的主营业务产品名称构建产品词表。该词表包含少量行业名与应用领域词汇,会使企业—部门相似度矩阵偏稠密,方向上抬高关联强度的绝对量级。 - 词频权重的取词参数:原文未公布构造词频-逆文档频率向量时的取词参数。本实现固定最低文档频次为 2、最高文档频率为 0.07,并对词频取对数变换;该取值依据原文报告的网络加权控制变量与对应企业层面变量之比反解出的关联强度总量校准而得。本实现产出的同一比值高于原文报告值,主要来自对无法测度者的处理差异与替代产品词表的稠密程度。 - 部门与行业类目的对照:原文未公布投入产出表产品部门与国民经济行业分类的对照表。本实现对一个大类恰对应一个产品部门的情形取整个大类的类目文本;对一个大类对应多个产品部门的情形,按部门名称与中类名称逐条建立映射并人工复核,已校验每个中类恰好归属一个部门,不存在遗漏、重复或越界。部门释义取类目的定义句,与原文举例引用的释义范围一致。 - 指标的结构性质:由该方法构造的生产网络接近完全连通,投入产出表中仅约四分之一的部门对没有往来。因此关联强度加权的邻居采用率在年度内变异较小,核心指标的横截面变异主要来自关联强度总量,与企业在生产网络中的中心程度高度相关。这一性质由上述公式结构决定,对企业—部门相似度矩阵作不同程度的稀疏化处理均无法改变。识别扩散效应时应如原文那样同时控制行业与地区的平均数字技术使用水平,并纳入企业与年份固定效应。规模加权口径在构造上已把关联强度总量约去,刻画的构念与核心指标不同,宜作为独立视角而非核心指标的等价替代。 - 网络覆盖与年度可比性:生产网络只在当年具备主营业务描述文本的上市公司之间构建,不在样本内的关联方贡献为零;语料覆盖率在样本期内逐年提升,并偏向规模较大的公司,注册于北京证券交易所与科创板的公司覆盖相对偏低。关联强度总量同时受样本内企业数量与逐年重新拟合的词频权重影响,绝对水平不宜跨年度直接比较,建议纳入年份固定效应。核心上下游被依赖企业数按比例阈值界定,其年度均值在构造上取决于该阈值对应的企业数量,同样不宜跨年度直接比较。 - 其他说明:最匹配产品部门及其相似度是网络计算过程中的中间信息,相似度水平偏低且存在年际波动,宜配合相似度一同查看,不建议用作企业行业分类标识。行业与城市平均数字技术使用水平按原文口径包含焦点企业自身,城市内上市公司数量较少时该均值受自身取值影响较大,对地区层面识别敏感的设计可改用留一法均值。网络加权的上下游企业特征按加权求和计算,关联企业该项特征缺失时按零计入,因而这些变量同时含有关联企业信息可得性的成分。 参考文献 - 金星晔,赵晟坤,郅曼琳,等.生产网络视角下的数字技术扩散效应:经验证据、影响路径与经济后果[J].管理世界,2026,42(8):37-58+73+59. - 金星晔,左从江,方明月,等.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,(3):34-53.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。