生产网络技术相似度

「生产网络技术相似度」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 44,596。 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,以上市公司年报主营业务描述文本与2017年全国投入产出表149个产品部门构建的

时间跨度2015-2025 年
数据频率年度
层级上市公司
变量数23
样本量44,596
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentStock [累计专利申请数] — 计算公式为:截至当年(含当年)企业本身及其子公司、联营企业、合营企业累计申请的专利件数。该数量是构造企业技术领域分布向量的规模基础,数值越大表示企业积累的技术成果越多
  • NTechClass [累计专利覆盖技术大类数] — 计算公式为:企业累计申请的专利按主分类号归入的不同国际专利分类大类的个数。该个数等于企业技术领域分布向量中取值非零的维度数,数值越大表示企业的技术布局越分散
  • RelationUp [上游生产网络关联强度合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:生产网络中全部企业作为上游方与该企业之间关联程度的合计。关联程度由双方主营产品在投入产出表中的垂直关联程度决定,数值越大表示该企业在生产网络中承接的上游关联越广越强。该合计值是上游平均技术相似度的权重总量
  • RelationDown [下游生产网络关联强度合计] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:该企业作为上游方与生产网络中全部企业之间关联程度的合计。数值越大表示该企业的产出在生产网络中被下游使用得越广越强。该合计值是下游平均技术相似度的权重总量
  • RelationSelf [自身项生产网络关联强度] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:企业与其自身在生产网络关联强度矩阵中所对应的对角元素取值,反映企业因经营多元化而同时充当上游与下游的程度。剔除自身口径的平均技术相似度即由基准指标减去该项的两倍得到
  • RelationPatented [有专利关联方的关联强度合计] — 计算公式为:上下游关联企业中拥有专利、因而技术相似度有定义的那部分企业,其与焦点企业之间关联强度的上下游合计值。该合计值是关联强度加权平均技术相似度的分母
  • AverageTS [生产网络平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:焦点企业与各上游企业的技术相似度按生产网络关联强度加权求和,再加上与各下游企业的技术相似度按关联强度加权求和。其中企业间技术相似度为两家企业各国际专利分类大类专利份额向量的夹角余弦,取值介于0与1之间。用作研究变量,越大代表焦点企业与其生产网络中关联企业在技术领域上的重叠程度越高、吸收关联企业知识成果的成本越低。该口径的横截面变异有过半来自关联强度总量即企业在生产网络中的中心程度;使用时须纳入企业与年份固定效应,与同源的生产网络数字技术扩散指标配套做分组检验时应改用关联强度加权平均技术相似度
  • AverageTSUp [上游平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:焦点企业与生产网络中各上游企业的技术相似度按上下游关联强度加权求和,即生产网络平均技术相似度中来自上游方向的部分。用作研究变量,越大代表焦点企业与其上游供给方的技术领域越接近。因产品部门垂直关联矩阵近乎对称,该字段与下游平均技术相似度高度共线,两者不宜用于检验上下游溢出的非对称性
  • AverageTSDown [下游平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:焦点企业与生产网络中各下游企业的技术相似度按上下游关联强度加权求和,即生产网络平均技术相似度中来自下游方向的部分。用作研究变量,越大代表焦点企业与其下游需求方的技术领域越接近。因产品部门垂直关联矩阵近乎对称,该字段与上游平均技术相似度高度共线,两者不宜用于检验上下游溢出的非对称性
  • AverageTSNoSelf [剔除自身的平均技术相似度] — 参考金星晔等 (2026, 管理世界)的方法,计算公式为:在生产网络平均技术相似度的加权求和中排除焦点企业自身充当关联方的情形,即基准指标减去自身项关联强度的两倍。用于排除企业因经营多元化而同时充当上游与下游所带来的自相关干扰
  • AverageTSMean [关联强度加权平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:生产网络平均技术相似度的加权求和值除以其权重总量(分母仅计入技术相似度有定义、即关联方拥有专利的那部分关联强度),即以上下游关联强度为权重对企业间技术相似度取加权平均数,取值介于0与1之间。用作研究变量,越大代表焦点企业与关联企业的技术领域越接近;该口径已将企业在生产网络中关联强度总量的影响约去,是与同源的生产网络数字技术扩散指标配套做分组检验时应选用的口径。受累计专利存量口径下关联方技术覆盖面逐年变宽的影响,该指标含机械上升趋势,跨年度比较须纳入年份固定效应
  • AverageTSSubclass [技术小类口径平均技术相似度] — 参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,计算公式为:与生产网络平均技术相似度相同,但企业技术领域分布向量改按更细的国际专利分类小类划分。用于检验技术分类粒度对结果的敏感性,取值系统性低于大类口径

常见问题

「生产网络技术相似度」是什么数据集?
生产网络技术相似度,隶属供应链。参考金星晔等 (2026, 管理世界)与Jaffe (1986, AER)的方法,以上市公司年报主营业务描述文本与2017年全国投入产出表149个产品部门构建的
该数据集的时间范围是?
覆盖 2015-2025 年。
包含哪些变量/指标?
共 23 个变量。核心指标包括:累计专利申请数、累计专利覆盖技术大类数、上游生产网络关联强度合计、下游生产网络关联强度合计、自身项生产网络关联强度、有专利关联方的关联强度合计、生产网络平均技术相似度、上游平均技术相似度、下游平均技术相似度、剔除自身的平均技术相似度、关联强度加权平均技术相似度、技术小类口径平均技术相似度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 44,596 条观测。
数据是如何测算/获取的?
指标定义与计算方法 知识沿产业链的流动比资金与中间品更加抽象,也更难直接观测。一家企业能否把上下游伙伴的技术成果真正吸收进来,很大程度上取决于双方技术组合的重叠程度:当关联企业所处的技术领域与自身相近时,理解、消化并把外部知识重组进自身技术成果的成本会大幅下降;反之,即便存在紧密的购销关系,技术上的距离也会让知识流动难以落地。本数据集参考金星晔等 (2026, 管理世界)的方法,先以上市公司年度报告中的主营业务描述文本与投入产出表中的产品部门相匹配,构建上市公司之间在投入品与产出品层面的生产网络,再以 Jaffe (1986, AER)提出的技术接近度刻画企业两两之间的技术相似度,最后按生产网络关联强度把它汇总到企业—年度层面,得到焦点企业与其生产网络中关联企业之间的平均技术相似度。 构建网络的第一步是刻画产品部门之间的垂直关联程度。以全国投入产出表的中间流量矩阵 $CFLOW$ 为基础,把行方向的产品部门 $c$ 视为上游、列方向的产品部门 $d$ 视为下游,分别按行与按列做归一化: $$SUPP{cd}=\frac{CFLOW{cd}}{\sum{d=1}^{149}CFLOW{cd}},\qquad CUST{cd}=\frac{CFLOW{cd}}{\sum{c=1}^{149}CFLOW{cd}}$$ 其中 $SUPP{cd}$ 表示上游部门 $c$ 的总产出中用于生产下游部门 $d$ 的比例,$CUST{cd}$ 表示生产下游部门 $d$ 的总投入中上游部门 $c$ 所占的比例。两者的算术平均即为产品部门层面的垂直关联矩阵 $V=(SUPP+CUST)/2$,其维度为 149 乘 149,元素 $v{cd}$ 越大表示两个产品之间的上下游关联越紧密。 第二步把上市公司落到这 149 个产品部门上。自公司业务概要成为年度报告的规定披露内容以来,上市公司需要说明报告期内所从事的主要业务、主要产品及其用途。据此提取每家公司当年的主营业务描述文本,剔除其中"不涉及""不包含"一类的排除性语句,再做中文分词与停用词过滤;分词前先把上市公司披露的主营业务产品名称加入分词词库,使产品名称能被完整切分,分词后仅保留落在产品词表内的词,从而滤去经营模式与行业地位等叙述性内容,据此构造企业 $f$ 在 $t$ 年的主营产品词频-逆文档频率向量 $X{ft}$。产品部门一侧作同样处理:投入产出表的部门分类建立在国民经济行业分类基础之上,取每个部门所对应类目的名称与释义文句作为其商品描述文本,重复分词与停用词过滤得到部门词向量 $Yp$。企业向量与部门向量在同一词表空间内拟合,二者的余弦相似度构成企业—部门相似度矩阵 $Bt=[b{fp}]$,其中 $b{fp}=\cos(X{ft},Yp)$。把部门层面的垂直关联映射回企业层面,即得企业间关联强度矩阵: $$Relationt=Bt\times V\times Bt^{\mathsf{T}}$$ 元素 $relation{ijt}$ 表示 $t$ 年企业 $i$ 作为上游、企业 $j$ 作为下游时二者的关联程度。由于投入产出表中每个部门同时扮演供给者与需求者,任一企业在网络中也同时具备上游与下游两重身份:沿列方向可识别其上游伙伴,沿行方向可识别其下游伙伴。数据集把这两个方向的关联强度合计分别作为上游与下游关联强度总量输出,它们正是后续加权汇总的权重总量。 第三步刻画企业两两之间的技术距离。把企业已申请的专利按主分类号归入国际专利分类的技术大类,统计其在各技术大类中的专利份额,得到技术分布向量 $T=[S1,S2,\dots,Sn]$,其中 $Sn$ 为该企业落在技术大类 $n$ 的专利占其全部专利的比重,各分量之和为一。企业 $i$ 与企业 $j$ 之间的技术相似度定义为两个技术分布向量的夹角余弦: $$TS{ij(k)t}=\frac{T{it}\times T'{j(k)t}}{\sqrt{\left(T{it}T'{it}\right)}\times\sqrt{\left(T{j(k)t}T'{j(k)t}\right)}}$$ 该指数取值介于 0 与 1 之间,取值越大表示两家企业在技术空间中的位置越接近。两家企业若完全布局于同一批技术领域且份额结构一致则取值为一,若技术领域毫无交集则取值为零。数据集同时输出构造该向量所用的累计专利申请数与其覆盖的技术大类数,前者是向量的规模基础,后者等于向量中取值非零的维度数,可用于判断技术布局的集中还是分散。 最后一步把两两之间的技术相似度按生产网络关联强度汇总到焦点企业—年度层面,得到核心指标: $$Average\,TS{it}=\sum{j}relation{ijt}\times TS{ijt}+\sum{k}relation{ikt}\times TS{ikt}$$ 其中第一项沿关联矩阵的列方向求和,$j$ 为焦点企业 $i$ 的上游企业;第二项沿行方向求和,$k$ 为其下游企业。该指标数值越大,表示焦点企业与其生产网络中关联企业在技术领域上的重叠程度越高、吸收关联企业知识成果的成本越低,因而更可能成为沿产业链传导的技术与知识的有效承接方。数据集把上式的两项分别输出为上游平均技术相似度与下游平均技术相似度,便于区分知识来自供给侧还是需求侧。 围绕核心指标,数据集提供三个替代口径。剔除自身口径在加权求和中排除焦点企业自身充当关联方的情形,用以排除企业因经营多元化而同时充当上游与下游所带来的干扰,其扣除项即关联强度矩阵的对角元素,也作为字段单独输出;原文为数字技术扩散指标定义了这一剔除规则,本数据集把同一规则平移到技术相似度的加权汇总上。关联强度加权平均口径把加权求和值除以其权重总量,得到以关联强度为权重的技术相似度加权平均数,取值同样介于 0 与 1 之间;该口径把企业在生产网络中关联强度总量的影响约去,反映的是纯粹的技术接近程度,其分母只累计技术相似度有定义的那部分关联强度,并作为字段单独输出以便复核。技术小类口径把技术分布向量改按更细的国际专利分类小类划分,用于检验技术分类粒度对结果的影响,其取值系统性低于大类口径;原文只写"技术大类"而未说明确切位数,故两种粒度并存备查。 补充说明 - 样本口径:起始年份取决于公司业务概要成为年报规定披露内容的时点,此前的年度报告没有可比的业务描述章节,无法向前延伸;末端年份同时受语料可得性与专利数据年度上限约束。数据集不预先剔除金融业、交易状态异常的公司或存在缺失的观测,也不做缩尾处理,这些回归样本限制留给使用者按研究设计自行施加。 - 两种口径刻画不同构念,选择会改变结论:核心指标忠实于原文公式,是关联强度加权的求和值,其横截面变异有过半可由关联强度总量单独解释,即相当大一部分来自企业在生产网络中的中心程度;加权平均口径已将权重总量约去,反映纯粹的技术接近程度。两者相关性远低于一般替代口径之间的水平,不能互相替代。与同源的生产网络数字技术扩散指标配套使用时应选加权平均口径:求和口径与该扩散指标共享同一关联强度矩阵因而高度相关,若按它分组检验扩散效应,等同于按被检验的处理变量自身量级分组,高分组系数更显著属构造性结果;加权平均口径与该扩散指标几乎不相关,是分组检验的正确选择。同源数据集中各网络加权控制变量也与求和口径严重共线。 - 网络加权带来的增量信息有限:把关联强度权重整体替换为等权、即改对当年全样本求平均技术相似度所得的安慰剂变量,与加权平均口径高度相关且逐年稳定。这是近乎完全连通的加权网络的必然结果——投入产出表中仅约四分之一的部门对没有往来,关联强度加权的邻居均值因而与全样本均值趋同。换言之加权平均口径的横截面变异大部分来自企业专利组合有多大众化,只有小部分来自生产网络结构;求和口径与该安慰剂的相关性则低得多,网络信息主要经由关联强度总量进入。需要识别生产网络专属效应的设计,应显式控制同年全样本平均相似度,或借助网络结构的外生变动。 - 两种口径都含机械上升趋势:累计存量口径下,随着关联方企业的技术分类覆盖面逐年变宽,与任何固定技术分布向量的夹角余弦都会机械上升。在技术大类数于样本期内几乎冻结的企业子样本中,加权平均口径仍呈现与全样本同向同量级的上涨,说明趋势并非来自焦点企业自身。求和口径另叠加关联强度总量的年度漂移。两种口径的绝对水平均不宜跨年度直接比较,须纳入年份固定效应;年份固定效应吸收共同水平,但吸收不掉异质暴露——关联方集合扩张更快的企业会呈现更强的上升,双重差分与事件研究若处理时点与网络组成变化相关仍会受影响。 - 上下游分解不支持非对称性检验:产品部门垂直关联矩阵按上下游两个方向取算术平均后近乎对称,使关联矩阵与其转置高度相似,上游与下游两个分量因而高度共线。两项同时进入回归会产生严重共线并出现符号翻转,分别进入又无法区分来源。检验"上游溢出与下游溢出孰强"的研究不宜依赖本数据集的上下游分解。 - 技术分布向量的口径选择:原文只写"企业拥有的专利分布向量",未说明存量还是流量,本实现取截至观测年累计申请的专利。专利归属纳入上市公司本身及其子公司、联营企业与合营企业,与原文按名称及参控股关系逐条匹配的表述一致。专利类型上纳入发明专利与实用新型两类,而 Jaffe 的美国样本不存在实用新型这一类别,中国的实用新型又集中于少数技术大类,会抬高机械制造类企业与同行的相似度;两种类型口径下的技术分布向量对多数企业接近一致,但对相当一部分企业有实质差异,数据集未提供仅发明口径的对照字段。一件专利仅按主分类号计入一个技术类别,使各分类份额之和恰为一;主分类号缺失时回退取该专利全部分类号中的首位。技术分类粒度上以三字符的技术大类为基准并另给小类口径备查。 - 适用范围:焦点企业没有专利时技术分布向量为零向量,相似度公式分母为零、取值无定义,该企业年的全部平均技术相似度字段取缺失值而非零;关联方没有专利时该配对按零贡献计入求和,并从加权平均口径的分母中剔除。指标随技术大类数单调上升,跨度超过一个标准差;技术大类数极少的企业其向量近乎退化为单位基向量,相似度只能取少数离散值。建议限定技术大类数不低于五、或累计专利数不低于十后使用,并注意金融业与房地产业的零专利比例与低技术大类数占比明显偏高。 - 覆盖结构与末端年份:关联强度矩阵的构造与参数设定同原文的生产网络实现完全一致,包括以上市公司披露的主营产品名称替代原文的电商商品词库、取词参数由原文报告的描述统计反解校准、以及部门与行业类目的自建对照表;这些设定影响关联强度的绝对量级,因而同比例影响求和口径的水平值,不影响加权平均口径。网络只在当年具备主营业务描述文本的上市公司之间构建,不在样本内的关联方贡献为零,语料覆盖偏向规模较大的公司;未能匹配到任何产品部门的企业,其全部网络类字段取缺失值而非零。最末观测年相对前一年少收录了一批仍处上市状态的公司,掉样率按行业门类差异显著且与本指标的门类均值差异同向,会在最末年制造虚假的水平抬升;同时该年专利申请量因公开滞后尚在填充中,各字段会在下一次数据更新后变化。最末年宜作稳健性年份而非主样本。 - 北京证券交易所样本:该板块证券代码已整体迁移至新号段,迁移前后的代码在面板中属不同主体,企业固定效应、滞后项与一阶差分对这批公司失效;上游专利名称词典按当前代码构建,旧代码年份的专利匹配系统性偏少,使该板块的零专利比例与专利存量在迁移年出现不真实的跃升。涉及时序分析的研究建议整体剔除该板块。
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。