生产网络数字技术知识溢出
「生产网络数字技术知识溢出」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 22 个变量,样本量约 44,596。 参考金星晔等 (2026, 管理世界)的方法,将上市公司年报中的主营业务描述文本与2017年全国投入产出表的149个产品部门相匹配,构建上市公司之间在投入品与产
| 时间跨度 | 2015-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 22 |
| 样本量 | 44,596 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- AverageCitation [生产网络专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:对焦点企业在生产网络上的每一家关联企业,若焦点企业当年申请的专利引用了该关联企业的专利则取值1、否则取值0,以该关联企业与焦点企业的上下游关联强度为权重加权,上游方向与下游方向分别加总后相加。用作研究变量,越大代表焦点企业通过专利引用渠道从生产网络关联企业获得的知识溢出越强。
- AverageTS [生产网络平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:先以两家企业截至当年申请的全部专利在国际专利分类大类上的份额向量计算余弦相似度作为技术相似度,再以关联企业与焦点企业的上下游关联强度为权重加权,上游方向与下游方向分别加总后相加。用作研究变量,越大代表焦点企业与其生产网络关联企业的技术领域重叠越高、吸收外部知识的基础越好。
- AverageCitationUp [上游专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:生产网络专利引用知识溢出中来自上游关联企业的加总项,即仅以焦点企业与其上游企业的关联强度为权重加权是否引用的取值。越大代表来自上游的知识溢出越强。
- AverageCitationDown [下游专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:生产网络专利引用知识溢出中来自下游关联企业的加总项,即仅以焦点企业与其下游企业的关联强度为权重加权是否引用的取值。越大代表来自下游的知识溢出越强。
- AverageCitationExSelf [剔除自身的专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在生产网络专利引用知识溢出的基础上剔除焦点企业引用自身专利所贡献的部分,仅保留跨企业的引用关系。用作研究变量,越大代表纯粹来自其他企业的专利引用知识溢出越强。
- AverageCitationCount [引用次数口径的专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:将是否引用的0-1取值替换为焦点企业当年引用该关联企业专利的实际次数,再按与生产网络专利引用知识溢出相同的关联强度加权方式加总。越大代表引用关联企业专利的频次越高。
- AverageCitationMean [关联强度加权平均的专利引用知识溢出] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:生产网络专利引用知识溢出除以焦点企业上下游关联强度的总量,得到关联强度加权平均意义上的引用比例。该口径不受企业在生产网络中关联强度总量的影响,越大代表焦点企业引用的关联企业在其生产网络中的权重越高。
- AverageTSUp [上游平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:生产网络平均技术相似度中来自上游关联企业的加总项,即仅以焦点企业与其上游企业的关联强度为权重加权双方的技术相似度。越大代表与上游企业的技术重叠越高。
- AverageTSDown [下游平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:生产网络平均技术相似度中来自下游关联企业的加总项,即仅以焦点企业与其下游企业的关联强度为权重加权双方的技术相似度。越大代表与下游企业的技术重叠越高。
- AverageTSExSelf [剔除自身的平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:在生产网络平均技术相似度的基础上剔除焦点企业与自身技术相似度(恒等于1)所贡献的部分,仅保留与其他企业的技术重叠。越大代表与外部关联企业的技术重叠越高。
- AverageTSMean [关联强度加权平均的技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:生产网络平均技术相似度除以焦点企业上下游关联强度的总量,得到关联强度加权平均意义上的技术相似度,取值范围为0到1。该口径不受企业在生产网络中关联强度总量的影响,越大代表焦点企业与其生产网络关联企业在技术领域上越接近。
常见问题
- 「生产网络数字技术知识溢出」是什么数据集?
- 生产网络数字技术知识溢出,隶属供应链。参考金星晔等 (2026, 管理世界)的方法,将上市公司年报中的主营业务描述文本与2017年全国投入产出表的149个产品部门相匹配,构建上市公司之间在投入品与产
- 该数据集的时间范围是?
- 覆盖 2015-2025 年。
- 包含哪些变量/指标?
- 共 22 个变量。核心指标包括:生产网络专利引用知识溢出、生产网络平均技术相似度、上游专利引用知识溢出、下游专利引用知识溢出、剔除自身的专利引用知识溢出、引用次数口径的专利引用知识溢出、关联强度加权平均的专利引用知识溢出、上游平均技术相似度、下游平均技术相似度、剔除自身的平均技术相似度、关联强度加权平均的技术相似度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 44,596 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识溢出并不是企业可以自动获取的准公共品。上下游企业在投入品与产出品层面的结构性依赖,使双方在技术标准、产品接口与生产流程上相互衔接,也因此伴随更频繁的技术接触与学习机会;上游企业嵌在中间品里的工艺改进与技术模块,会在投入使用的过程中影响下游企业的生产方式与技术选择。这条渠道能否真正打通,又取决于双方的知识基础是否足够接近——当关联企业的技术与焦点企业在技术空间中的位置相近时,吸收外部知识的成本会大幅下降。本数据集参考金星晔等 (2026, 管理世界)的方法,把上市公司年度报告中的主营业务描述文本与投入产出表中的产品部门相匹配,构建上市公司之间在投入品与产出品层面的生产网络,并沿该网络从专利引用与技术相似度两个方向测度焦点企业与其上下游关联企业之间的知识溢出强度。 测度的基础是企业间生产网络。先刻画产品部门之间的垂直关联:以全国投入产出表的中间流量矩阵 $CFLOW$ 为基础,把行方向的产品部门 $c$ 视为上游、列方向的产品部门 $d$ 视为下游,分别按行与按列做归一化,得到 $SUPP{cd}=CFLOW{cd}/\sum{d}CFLOW{cd}$ 与 $CUST{cd}=CFLOW{cd}/\sum{c}CFLOW{cd}$,前者表示上游部门 $c$ 的总产出中用于生产下游部门 $d$ 的比例,后者表示生产下游部门 $d$ 的总投入中上游部门 $c$ 所占的比例。两者的算术平均构成 149 乘 149 的产品部门垂直关联矩阵: $$V=\frac{SUPP+CUST}{2}$$ 再把上市公司落到这 149 个产品部门上。自公司业务概要成为年度报告的规定披露内容以来,上市公司需要说明报告期内所从事的主要业务、主要产品及其用途。据此提取每家公司当年的主营业务描述文本,剔除其中"不涉及""不包含"一类的排除性语句,做中文分词与停用词过滤,仅保留落在产品词表内的词,构造企业 $f$ 在 $t$ 年的产品词向量 $X{ft}$。产品部门一侧取国民经济行业分类中对应类目的名称与释义文句,作同样处理得到部门词向量 $Yp$。二者在同一词表空间内的余弦相似度构成企业—部门相似度矩阵 $Bt=[b{fp}]$,$b{fp}=\cos(X{ft},Yp)$。企业之间的关联强度即为双方产品构成经由产品部门垂直关联矩阵的加权耦合: $$Relationt=Bt\times V\times Bt^{\mathsf{T}}$$ 其中 $relation{ji}$ 表示焦点企业 $i$ 与其上游企业 $j$ 之间的关联强度,$relation{ik}$ 表示焦点企业 $i$ 与其下游企业 $k$ 之间的关联强度。由于投入产出表中每个部门同时扮演供给者与需求者,任一企业在网络中也同时具备上游与下游两重身份。 专利引用渠道。 知识流动比一般生产要素更抽象、更难直接观察,而专利引用信息能够较为清晰地反映知识的来源与去向。其基本判断是:焦点企业引用上游或下游关联企业专利的情况越多,关联企业对焦点企业的技术影响就越强。据此构造焦点企业引用上下游关联企业专利的指标: $$Average\ Citation{it}=\sum{j}relation{ji}\times Citation{jit}+\sum{k}relation{ik}\times Citation{kit}$$ 其中 $Citation{jit}$ 在焦点企业 $i$ 于 $t$ 年申请的专利引用了关联企业 $j$ 的专利时取值 1、否则取值 0,$Citation{kit}$ 对下游企业同理。第一项沿关联矩阵的列方向求和,刻画来自上游的知识溢出;第二项沿行方向求和,刻画来自下游的知识溢出。引用关系的年份取引用方专利的申请年。 技术相似度渠道。 焦点企业能否有效利用外部知识,取决于其自身技术与外部知识之间的重叠程度。参考 Jaffe (1986, AER)提出的企业间技术相似度,以企业拥有的专利在各技术分类中的分布向量刻画其技术位置。令 $T{it}=\{S1,S2,\dots,Sn\}$,其中 $Sn$ 为企业在技术分类 $n$ 中的专利份额,分类依据为专利所属的国际专利分类大类;两家企业的技术相似度为两个分布向量的夹角余弦: $$TS{ij(k)t}=\frac{T{it}\cdot T{j(k)t}^{\mathsf{T}}}{\sqrt{\left(T{it}\cdot T{it}^{\mathsf{T}}\right)\times\left(T{j(k)t}\cdot T{j(k)t}^{\mathsf{T}}\right)}}$$ 该指标取值范围为 0 到 1,越接近 1 表示两家企业在技术空间中的位置越接近。再以生产网络关联强度为权重,把焦点企业与各关联企业之间的技术相似度加权汇总到企业—年度层面: $$Average\ TS{it}=\sum{j}relation{ji}\times TS{jit}+\sum{k}relation{ik}\times TS{ikt}$$ 替代口径。 两条渠道各自提供若干替代口径。区分溢出来源的分量分别只保留上游项或下游项。剔除自身口径扣除焦点企业因经营多元化而同时充当自身上下游所贡献的部分:在引用渠道上即扣除企业引用自身专利的部分,在技术相似度渠道上即扣除企业与自身技术相似度恒等于 1 所贡献的部分。关联强度加权平均口径把上述加总值除以焦点企业上下游关联强度的总量,得到不受企业在网络中关联强度总量影响的相对水平。引用渠道另提供以实际引用次数替代是否引用取值的口径。 补充说明 - 样本口径:起始年份取决于公司业务概要成为年报规定披露内容的时点,此前的年度报告没有可比的业务描述章节,无法向前延伸;末端年份同时受专利数据年份上限约束。数据集不预先剔除金融业、交易状态异常的公司或存在缺失的观测,也不做缩尾处理,这些回归样本限制留给使用者按研究设计自行施加。未能匹配到任何产品部门的企业,其全部指标取缺失值;焦点企业没有专利时技术相似度的分母为零、该指标无定义,技术相似度一侧的字段取缺失值,而引用一侧取零,因为"没有引用任何关联企业的专利"是真实的零。 - 生产网络构建的口径:与本数据集配套的生产网络指标采用同一套构造流程与参数。原文以电商商品词库与商业数据库中的主营产品名称共同构成产品关键词,前者无法获取,本实现仅以上市公司披露的主营业务产品名称构建产品词表,该词表包含少量行业名与应用领域词汇,会使企业—部门相似度矩阵偏稠密,方向上抬高关联强度的绝对量级。原文未公布构造词频-逆文档频率向量时的取词参数与产品部门同行业分类的对照表,本实现分别按固定取词参数与逐条建立并人工复核的部门对照关系处理。 - 两处口径歧义的双实现:原文正文把引用渠道指标称为"引用上下游关联企业专利的平均次数",而公式下方对该变量的定义是"焦点企业在当年是否引用了关联企业的专利"。本数据集以公式的明文定义为基准口径,另按正文的次数表述给出引用次数口径。同样地,两条渠道的公式均为关联强度加权求和而未除以权重之和,但指标命名为"平均";本数据集以公式为基准口径,另给出除以关联强度总量的加权平均口径,两种解读均可直接取用。 - 技术分布向量的统计窗口与时间趋势:原文只给出该向量的年度下标而未说明专利的统计窗口。本实现取企业截至当年申请的全部专利构成累计分布向量,对应"企业拥有的专利在各技术分类中的分布"的字面含义。需要注意的是,累计口径下企业覆盖的技术分类数随年份单调增加,任意两家企业的余弦相似度会随之机械上升;在固定企业集合、排除样本构成变化的检验中,随机企业对的平均相似度升幅与本渠道指标的同期升幅量级相当,因此该渠道的时间趋势基本由累计口径本身解释,不宜解读为企业间技术的真实趋同。该漂移的斜率还是企业特异的(专利积累快的企业升得更快),年份固定效应只能吸收其共同截距。做跨期比较,或把本渠道与其他同样单调上升的变量交乘时,建议加入企业特定的线性时间趋势,或按研究需要以滚动窗口重构分布向量。 - 引用渠道的时效性与适用年份:专利自申请至公开存在法定滞后,最近若干个申请年度的引用关系尚未完全进入可观测范围。这一影响不限于可被年份固定效应吸收的水平位移:以样本中段的某一截面为基准,引用渠道指标的横截面秩相关随年份推移逐年下降,降幅明显大于技术相似度渠道,其零值比例在末端年份也回升到样本中段水平之上。换言之,末端若干年度的引用渠道排序会相当程度上反映专利公开的快慢。以引用渠道为核心变量的研究,建议把样本截至引用数据成熟的年份;技术相似度渠道不受此约束。 - 引用渠道与企业自身专利规模:公式把是否引用设为二元取值,但企业当年申请的专利越多,至少引用过一次的关联企业就越多,因此本渠道各口径与企业当年专利申请量高度相关,加权平均口径尤甚。使用时建议同时控制企业自身的专利申请量,并报告限定在当年有专利企业子样本上的结果,以区分"知识溢出增强"与"专利产出增多"这两种经济含义不同的机制。技术相似度渠道与专利申请量的相关要弱得多。相应地,引用渠道取零的观测有两种来源:一种是有专利但未引用任何关联上市公司专利的行为性零,另一种是企业当年及以前没有专利因而不可能产生引用的构造性零,后者恰是技术相似度取缺失值的那批观测;对零值结构敏感的设计宜先按企业是否有专利分层。 - 指标的结构性质:由该方法构造的生产网络接近完全连通,因此求和口径指标的横截面变异有相当一部分来自关联强度总量,与企业在生产网络中的中心程度相关;关注关联企业特征本身的研究可使用加权平均口径,该口径在构造上已把关联强度总量约去。这一点在与配套的生产网络扩散指标联用时尤其重要:两者使用同一套关联强度权重,求和口径之间因而共享同一个乘性因子,剔除关联强度总量后两者的偏相关会大幅下降,而加权平均口径之间的相关接近于零。把本数据集用作该扩散指标的机制变量时,建议同时报告加权平均口径的结果并在回归中控制关联强度总量。此外,由于技术相似度矩阵对称且两个加总项覆盖同一个企业对全集,技术相似度的上游分量与下游分量在任一年度内的横截面总和恒等(二者的分布形态仍不同),这是公式的数学性质,不宜解读为上下游知识溢出强度相同;引用渠道因引用关系稀疏而没有这一性质。自身项在两条渠道上的权重差别很大:技术相似度一侧影响甚微,引用一侧则不可忽略,关注纯粹跨企业知识流动的研究应使用剔除自身口径。 - 其他说明:生产网络只在当年具备主营业务描述文本的上市公司之间构建,不在样本内的关联方贡献为零;语料覆盖率在样本期内逐年提升,并偏向规模较大的公司。引用关系同样只覆盖双方均为上市公司的情形,与公式中关联企业均为上市公司的设定相符;引用方企业按去除文献种类代码后的专利公开号回映射识别,以覆盖同一件发明在申请公开与授权公告两个阶段使用不同编号的情形,同一件专利对同一件被引专利的引用只计一次。技术相似度一侧的缺失偏向规模较小、技术密集度较低的公司,注册于北京证券交易所的公司缺失相对集中;两条渠道的有效观测数因此不同,若同时报告并比较两者的系数,宜先统一到两者均非缺失的公共样本上。引用次数口径高度右偏,直接进入最小二乘回归时结果易由头部少数企业决定,建议取对数或缩尾后使用。 参考文献 - 金星晔,赵晟坤,郅曼琳,等.生产网络视角下的数字技术扩散效应:经验证据、影响路径与经济后果[J].管理世界,2026,42(8):37-58+73+59. - Jaffe A B.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。