中间品质量调整

「中间品质量调整」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 39 个变量,样本量约 44,596。 测度焦点企业在生产网络中所依赖的上下游关联企业的中间品质量水平。

时间跨度2015-2025 年
数据频率年度
层级上市公司
变量数39
样本量44,596
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 该年度对应的证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • ReportChars [年报中文字符数] — 计算公式为:年报全文中汉字字符的个数,用作产品质量关注度词频占比的分母,控制年报篇幅逐年膨胀带来的机械影响
  • BQFreqSelf [自身广义质量关注度(词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:广义产品质量词典全部关键词在本企业当年年报全文中的命中总次数除以年报中文字符数。广义词典共32个关键词,在狭义词典基础上增加工艺、工序、转型、升级、新产品、新技术、改造、改良、技改、技术提升、技术革新、技术变革等技术改造类词汇。命中计数按结束位置作最长匹配去重,一次“产品升级”不再被额外计为一次“升级”
  • BQTfidfSelf [自身广义质量关注度(TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:对广义质量词典的每个关键词,以其在本企业当年年报中的命中次数除以年报中文字符数作为词频项,乘以该关键词的逆文档频率后求和。逆文档频率为ln((1+年报总份数)/(1+含该关键词的年报份数))+1,在全样本上一次性拟合以保证指标跨年度可比
  • NQFreqSelf [自身狭义质量关注度(词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:狭义产品质量词典全部关键词在本企业当年年报全文中的命中总次数除以年报中文字符数。狭义词典共20个关键词,聚焦质量、品质、精品、优质、产品竞争力、精益生产、提质增效、产品良率、性价比、产品可靠性等直接指向产品质量的表述
  • NQTfidfSelf [自身狭义质量关注度(TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:对狭义质量词典的每个关键词,以其在本企业当年年报中的命中次数除以年报中文字符数作为词频项,乘以该关键词的逆文档频率后求和,逆文档频率口径与广义TF-IDF法一致
  • LaborPaySelf [自身人均劳动力工资(对数)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:ln(1+支付给职工以及为职工支付的现金除以员工总数)。在竞争性劳动力市场中较高的薪酬通常反映企业对高技能员工的吸引与留用,因而对应更高的生产过程控制水平与产品质量表现
  • RelationUp [上游关联强度合计] — 计算公式为:全部上游企业与本企业之间生产网络关联强度的合计,用作加权平均口径质量指标的分母
  • RelationDown [下游关联强度合计] — 计算公式为:本企业与全部下游企业之间生产网络关联强度的合计,用作加权平均口径质量指标的分母
  • BQFreq [中间品质量(广义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,将全部上游企业与全部下游企业的广义质量关注度(词频法)加权求和到本企业。该指标刻画本企业在生产网络中所依赖的上下游企业中间品质量水平,用作研究变量,越大代表本企业面临的上下游中间品质量水平越高
  • BQTfidf [中间品质量(广义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,将全部上游企业与全部下游企业的广义质量关注度(TF-IDF法)加权求和到本企业。该指标刻画本企业在生产网络中所依赖的上下游企业中间品质量水平,用作研究变量,越大代表本企业面临的上下游中间品质量水平越高
  • NQFreq [中间品质量(狭义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,将全部上游企业与全部下游企业的狭义质量关注度(词频法)加权求和到本企业。该指标刻画本企业在生产网络中所依赖的上下游企业中间品质量水平,用作研究变量,越大代表本企业面临的上下游中间品质量水平越高
  • NQTfidf [中间品质量(狭义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,将全部上游企业与全部下游企业的狭义质量关注度(TF-IDF法)加权求和到本企业。该指标刻画本企业在生产网络中所依赖的上下游企业中间品质量水平,用作研究变量,越大代表本企业面临的上下游中间品质量水平越高
  • QLaborPay [中间品质量(人均工资法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,将全部上游企业与全部下游企业的人均劳动力工资对数加权求和到本企业。该指标刻画本企业在生产网络中所依赖的上下游企业中间品质量水平,用作研究变量,越大代表本企业面临的上下游中间品质量水平越高
  • BQFreqUp [上游中间品质量(广义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部上游企业的广义质量关注度(词频法)加权求和到本企业,刻画上游中间品质量的提升压力
  • BQFreqDown [下游中间品质量(广义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部下游企业的广义质量关注度(词频法)加权求和到本企业,刻画下游对高质量中间品的需求压力
  • BQTfidfUp [上游中间品质量(广义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部上游企业的广义质量关注度(TF-IDF法)加权求和到本企业,刻画上游中间品质量的提升压力
  • BQTfidfDown [下游中间品质量(广义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部下游企业的广义质量关注度(TF-IDF法)加权求和到本企业,刻画下游对高质量中间品的需求压力
  • NQFreqUp [上游中间品质量(狭义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部上游企业的狭义质量关注度(词频法)加权求和到本企业,刻画上游中间品质量的提升压力
  • NQFreqDown [下游中间品质量(狭义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部下游企业的狭义质量关注度(词频法)加权求和到本企业,刻画下游对高质量中间品的需求压力
  • NQTfidfUp [上游中间品质量(狭义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部上游企业的狭义质量关注度(TF-IDF法)加权求和到本企业,刻画上游中间品质量的提升压力
  • NQTfidfDown [下游中间品质量(狭义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部下游企业的狭义质量关注度(TF-IDF法)加权求和到本企业,刻画下游对高质量中间品的需求压力
  • QLaborPayUp [上游中间品质量(人均工资法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部上游企业的人均劳动力工资对数加权求和到本企业,刻画上游中间品质量的提升压力
  • QLaborPayDown [下游中间品质量(人均工资法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:以生产网络关联强度为权重,仅将全部下游企业的人均劳动力工资对数加权求和到本企业,刻画下游对高质量中间品的需求压力
  • BQFreqAvg [中间品质量均值(广义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:上下游企业广义质量关注度(词频法)的加权求和值除以上下游关联强度合计,即按生产网络权重对关联企业质量指标取加权平均。该口径已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量
  • BQTfidfAvg [中间品质量均值(广义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:上下游企业广义质量关注度(TF-IDF法)的加权求和值除以上下游关联强度合计,即按生产网络权重对关联企业质量指标取加权平均。该口径已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量
  • NQFreqAvg [中间品质量均值(狭义词频法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:上下游企业狭义质量关注度(词频法)的加权求和值除以上下游关联强度合计,即按生产网络权重对关联企业质量指标取加权平均。该口径已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量
  • NQTfidfAvg [中间品质量均值(狭义TF-IDF法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:上下游企业狭义质量关注度(TF-IDF法)的加权求和值除以上下游关联强度合计,即按生产网络权重对关联企业质量指标取加权平均。该口径已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量
  • QLaborPayAvg [中间品质量均值(人均工资法)] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:上下游企业人均劳动力工资对数的加权求和值除以上下游关联强度合计,即按生产网络权重对关联企业质量指标取加权平均。该口径已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量

常见问题

「中间品质量调整」是什么数据集?
中间品质量调整,隶属供应链。测度焦点企业在生产网络中所依赖的上下游关联企业的中间品质量水平。
该数据集的时间范围是?
覆盖 2015-2025 年。
包含哪些变量/指标?
共 39 个变量。核心指标包括:年报中文字符数、自身广义质量关注度(词频法)、自身广义质量关注度(TF-IDF法)、自身狭义质量关注度(词频法)、自身狭义质量关注度(TF-IDF法)、自身人均劳动力工资(对数)、上游关联强度合计、下游关联强度合计、中间品质量(广义词频法)、中间品质量(广义TF-IDF法)、中间品质量(狭义词频法)、中间品质量(狭义TF-IDF法)、中间品质量(人均工资法)、上游中间品质量(广义词频法)、下游中间品质量(广义词频法)、上游中间品质量(广义TF-IDF法)、下游中间品质量(广义TF-IDF法)、上游中间品质量(狭义词频法)、下游中间品质量(狭义词频法)、上游中间品质量(狭义TF-IDF法)、下游中间品质量(狭义TF-IDF法)、上游中间品质量(人均工资法)、下游中间品质量(人均工资法)、中间品质量均值(广义词频法)、中间品质量均值(广义TF-IDF法) 等。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 44,596 条观测。
数据是如何测算/获取的?
指标定义与计算方法 在生产网络中,企业所使用的中间品质量并非由自身单独决定,而是由其上游供给方的产品质量水平与下游需求方对高质量中间品的要求共同塑造。上游企业提升中间品质量,会直接改善焦点企业可获得的投入品;下游企业对高质量中间品的需求加强,则会向焦点企业传导质量压力。本数据集正是沿这一双向传导逻辑,测度焦点企业在生产网络中所依赖的上下游关联企业的中间品质量水平,参考金星晔等 (2026, 管理世界) 的方法构建。整个测度分为两步:先在企业层面构造产品质量的代理变量,再沿企业间生产网络的关联强度把这些代理变量加权汇总到焦点企业—年度层面。 第一步,构建企业间生产网络。 网络的骨架来自全国投入产出表的中间流量矩阵。记 $CFLOW{cd}$ 为上游产品部门 $c$ 流向下游产品部门 $d$ 的中间品流量,先从供给侧与需求侧两个方向分别归一化: $$SUPP{cd}=\frac{CFLOW{cd}}{\sum{d}CFLOW{cd}},\qquad CUST{cd}=\frac{CFLOW{cd}}{\sum{c}CFLOW{cd}}$$ 前者表示上游部门 $c$ 的总产出中用于生产下游部门 $d$ 的比例,后者表示下游部门 $d$ 的总投入中来自上游部门 $c$ 的比例。二者取算术平均得到产品部门之间的垂直关联矩阵 $V=(SUPP+CUST)/2$。 要把部门层面的关联映射到企业层面,需要先确定每家企业在产品部门空间中的位置。为此,从企业年度报告中截取主营业务的描述文本,剔除其中的排除性表述后分词,以产品关键词表筛选,再取词频—逆文档频率表示,得到企业的产品词向量 $X{ft}$;对 $149$ 个产品部门,则依据其在国民经济行业分类中对应类目的名称与释义文本,在同一空间内构造部门词向量 $Yp$。企业与部门的匹配度由二者的余弦相似度给出,$b{fp}=\cos(X{ft},Yp)$,全部企业的匹配度构成矩阵 $Bt$。企业间的生产网络关联强度即为 $$Relationt=Bt\times V\times Bt^{T}$$ 其中元素 $relation{ijt}$ 度量上游企业 $i$ 与下游企业 $j$ 在 $t$ 年的关联程度:只有当两家企业各自匹配到的产品部门之间存在投入产出往来时,该元素才取正值。 第二步,构造企业层面的产品质量代理变量。 采用两类互补的刻画方式,共五个指标。 一类是基于年度报告文本的产品质量关注度,这一从年报中提取关键词刻画生产网络企业特征的思路,源自包群与廖赛男 (2023) 的研究。依据原文给出的两套关键词典统计:狭义词典包含 $20$ 个关键词,聚焦质量、品质、精品、优质、产品竞争力、精益生产、提质增效、产品良率、性价比、产品可靠性等直接指向产品质量的表述;广义词典在此基础上再加入工艺、工序、转型、升级、新产品、新技术、改造、改良、技改、技术提升、技术革新、技术变革等技术改造类词汇,共 $32$ 个关键词。对每套词典分别采用词频统计与词频—逆文档频率两种算法。词频法以关键词在年报全文中的命中总次数除以年报中文字符数: $$Freq{ft}=\frac{\sum{k\in D}n{kft}}{Chars{ft}}$$ 其中 $n{kft}$ 为关键词 $k$ 的命中次数,$D$ 为对应词典,$Chars{ft}$ 为年报中文字符数。以字符数作分母,是为了剔除年报篇幅本身的变化对指标的机械影响。命中次数按结束位置作最长匹配去重,使一次"产品升级"不会被额外计为一次"升级"。词频—逆文档频率法则在词频项上再按关键词的稀缺程度加权: $$TFIDF{ft}=\sum{k\in D}\frac{n{kft}}{Chars{ft}}\times idfk,\qquad idfk=\ln\frac{1+N}{1+dfk}+1$$ 其中 $N$ 为年报总份数,$dfk$ 为含关键词 $k$ 的年报份数。逆文档频率在全样本上一次性拟合而非逐年拟合,使同一关键词的权重在整个样本期内保持恒定,指标的年度变化因而只反映披露内容本身的变化。这两套词典与两种算法交叉,得到四个文本型质量关注度指标,取值越高表明企业在信息披露中对产品质量议题的关注程度越强,可作为产品质量管理与改进努力的代理变量。 另一类代理变量是人均劳动力工资,取支付给职工以及为职工支付的现金与员工总数之比,并作对数化处理,$LaborPay{ft}=\ln(1+\text{人均劳动力工资})$。其依据在于,竞争性劳动力市场中较高的薪酬通常反映企业对高技能员工的吸引与留用,从而对应更高的生产过程控制水平与产品质量表现。 第三步,沿生产网络加权汇总。 记 $Q{ft}$ 为上述任一企业层面质量代理变量,焦点企业 $i$ 所面临的中间品质量水平由其全部上游与下游关联企业的质量指标按关联强度加权求和得到: $$Q\network{it}=\underbrace{\sum{j}relation{jit}\,Q{jt}}{\text{上游项}}+\underbrace{\sum{k}relation{ikt}\,Q{kt}}{\text{下游项}}$$ 第一项沿关联强度矩阵的列方向求和,刻画上游企业向焦点企业传导的中间品质量;第二项沿行方向求和,刻画下游企业对焦点企业提出的质量要求。二者之和即为核心指标,取值越大表明焦点企业在生产网络中所依赖的上下游中间品质量水平越高。该加权结构与同一文献用于测度生产网络技术扩散的结构完全一致,只是把权重所乘的对象由技术采纳替换为产品质量。 在核心指标之外,数据集另提供两组配套口径。其一是上游项与下游项的单独取值,对应原文关于质量压力双向传导的机制表述,便于区分中间品质量的供给侧改善与需求侧拉动。其二是加权平均口径,即把上述加权求和值再除以上下游关联强度的合计: $$Q\avg{it}=\frac{Q\network{it}}{\sum{j}relation{jit}+\sum{k}relation{ikt}}$$ 该口径在构造上已将关联强度总量约去,反映的是关联企业的平均质量水平而非质量总量。数据集同时输出上游与下游关联强度合计本身,以及企业自身的五个质量代理变量与年报中文字符数,便于使用者按研究需要重新组合或作为控制变量。 补充说明 - 样本口径:覆盖当年具备年报主营业务描述文本的上市公司。不预先剔除金融业、ST 或缺失样本,也不作缩尾,回归样本的限制留给使用者按研究设计施加。样本起点取年报"公司业务概要"章节开始强制披露的报告期,终点随语料逐年延伸。 - 原文的第三类代理变量未纳入:原文除年报文本法与人均劳动力工资外,还以"上下游关联企业是否建立产品质量管理体系"作为一种代理,并据此构造第三个网络加权变量。该项所依据的企业社会责任与治理专项数据不在本数据集的数据范围内,且以其他来源拼凑近似替代会改变变量的构念,因此不予提供。本数据集实现的是原文六个变量中的五个。 - 三处口径由本实现确定:原文未公布词频指标的归一化方式、逆文档频率的拟合范围,以及人均工资是否取对数。本实现分别取以年报中文字符数为分母(同类披露关注度指标的主流做法,可参见袁淳等 (2021))、在全样本上一次性拟合逆文档频率、对人均工资取对数。前两项使指标跨年度可比,第三项避免少数极端值主导网络加权结果,但也意味着与原文的绝对量级可能存在差异。人均工资的分母取自结构化的员工人数数据而非年报文本中的首个人数,以避免母公司与合并口径、在职与退休口径被混取。 - 加权求和口径与网络规模的关系:核心指标忠实沿用原文的加权求和结构,而该结构的横截面变异主要来自关联强度总量,而非关联企业之间的质量差异。根本原因在于企业层面质量代理的离散程度远小于其均值,在关联稠密的加权网络中,加权求和便趋近于质量均值乘以关联强度总量。使用核心指标识别中间品质量的作用时,建议同时控制上下游关联强度合计(数据集已输出),或改用加权平均口径;原文的基准设定也相应地同时控制了行业与地区层面的平均水平,并纳入企业与年份固定效应。 - 两组口径刻画不同构念:加权求和含网络规模信息,加权平均不含,二者相关性低,不宜互相替代。加权平均口径的代价是在关联稠密的网络中会向全样本平均质量收敛,组内变异小于核心指标。核心指标的绝对水平亦不宜跨年度直接比较,宜纳入年份固定效应。 - 词频法与词频—逆文档频率法高度接近:同一词典下两种算法的结果高度一致,因为词典中"质量""升级""品质"等词几乎出现于每一份年报,其逆文档频率接近 $1$ 且贡献了绝大部分词频。二者可互为稳健性参考,但不构成相互独立的两种测度;广义与狭义两套词典之间则确实提供了增量信息。 - 关键词按字符串匹配,不区分语境:"质量"一词在年报中亦会出现于资产质量、盈利质量等非中间品语境,广义词典额外纳入的转型、升级、改造等词在披露中更为泛用。狭义词典的语境噪声相对更小,广义词典的覆盖面相对更广,两者并列输出供对照。 - 人均工资指标在金融业大多缺失:现金流量表按一般工商企业口径读取,银行、保险、证券等企业的报表属另一口径,其职工薪酬现金流不进入本数据集,因此金融业企业的人均劳动力工资多为缺失,金融业也占了该指标全部缺失观测的过半。四个文本类质量指标不受影响,金融业同样可得。多数研究本就剔除金融业;若研究设计需要保留,建议改用文本类指标。 - 其他局限:生产网络仅在当年具备主营业务描述文本的上市公司之间构建,不在样本内的关联方贡献为零,语料覆盖偏向规模较大的公司;未能匹配到任何产品部门的企业,其网络类指标置为缺失而非零;关联企业质量指标缺失时按零计入加权,故核心指标同时含有关联企业指标可得性的信息;极少数企业年因披露的员工人数与职工薪酬现金流不匹配而使人均工资出现异常值,对数化已大幅压缩其影响,使用企业自身口径时建议先行缩尾。 参考文献 - 金星晔, 赵晟坤, 郅曼琳, 等. 生产网络视角下的数字技术扩散效应:经验证据、影响路径与经济后果[J]. 管理世界, 2026, 42(8): 37-58+73+59. - 包群, 廖赛男. 国内生产网络与间接出口外溢:基于客户——供应商关系的证据[J]. 管理世界, 2023, 39(8): 32-51. - 袁淳, 肖土盛, 耿春晓, 等. 数字化转型与企业分工:专业化还是纵向一体化[J]. 中国工业经济, 2021, (9): 137-155.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。