企业技术复杂性(IPC双模网络反射法)

「企业技术复杂性(IPC双模网络反射法)」,覆盖 1989-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 88,588。 基于专利国际专利分类四位小类构建企业-技术共现网络,以显性技术优势筛出企业的优势技术类别,再按反射法迭代测度企业技术复杂度。

时间跨度1989-2025 年
数据频率年度
层级上市公司
变量数15
样本量88,588
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 指标所属年份,第t年的取值由第t-4年至第t年共5年窗口内申请的专利计算得到
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • WindowPatentCount [窗口专利数量] — 参考刘蕾蕾等(2026,科技进步与对策)的方法,计算公式为:第t-4年至第t年共5年窗口内该企业申请且含有效国际专利分类号的专利件数,是构建企业-技术共现网络的计数基数
  • TechDiversity [技术多样性] — 参考刘蕾蕾等(2026,科技进步与对策)的方法,计算公式为:企业在5年窗口内具有相对技术优势的国际专利分类四位小类数量,即企业-技术双模矩阵中该企业所在行的元素之和。相对技术优势指企业在某技术类别上的专利份额不低于该技术类别在全部A股上市公司中的平均份额。取值越大代表企业优势技术领域的覆盖面越广
  • AvgTechUbiquity [平均技术遍在性] — 参考刘蕾蕾等(2026,科技进步与对策)的方法,计算公式为:企业全部相对技术优势类别所对应的技术遍在性的算术平均,其中技术遍在性指在该技术类别上具有相对技术优势的A股上市公司家数。取值越大代表企业的优势技术越普遍、越容易被其它企业掌握。该值随当年网络中的企业家数同向变动,跨年度比较需控制年份固定效应
  • TechComplexity [技术复杂度] — 参考刘蕾蕾等(2026,科技进步与对策)基于Hidalgo和Hausmann(2009,PNAS)反射法的测度方法,计算公式为:在企业-技术双模网络上作两次反射迭代后的企业侧取值,即企业全部相对技术优势类别的取值的算术平均,其中每个技术类别的取值等于在该类别上具有相对技术优势的全部上市公司的技术多样性均值。用作研究变量,取值越大代表企业的优势技术越集中于由技术多元化企业共同掌握的领域,在原文中被解释为企业技术构成的复杂度越高。该值的水平随年度网络稠密度上升,跨年度比较需控制年份固定效应

常见问题

「企业技术复杂性(IPC双模网络反射法)」是什么数据集?
企业技术复杂性(IPC双模网络反射法),隶属创新与知识产权。基于专利国际专利分类四位小类构建企业-技术共现网络,以显性技术优势筛出企业的优势技术类别,再按反射法迭代测度企业技术复杂度。
该数据集的时间范围是?
覆盖 1989-2025 年。
包含哪些变量/指标?
共 15 个变量。核心指标包括:窗口专利数量、技术多样性、平均技术遍在性、技术复杂度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 88,588 条观测。
数据是如何测算/获取的?
指标定义与计算方法 技术复杂性刻画的是企业技术构成被其他企业复制的难度。其思想源自经济复杂度理论:一个复杂的经济体之所以具有竞争优势,是因为它能够生产别人生产不出来的、非普遍存在的产品;把这一思路移植到企业层面,如果一家企业所涉足的技术类别难以被其他企业模仿,就说明该企业拥有高度复杂的技术构成。本数据集据此以专利数据为基础,构建企业与技术类别之间的双模网络,并在该网络上迭代测算企业技术复杂度。 技术类别以国际专利分类号的四位小类表征,这是专利计量中表示技术要素的通行粒度。考虑到企业知识吸收与创新活动存在周期性,网络按五年滚动窗口构建:第 $t$ 年的全部指标均由第 $t-4$ 年至第 $t$ 年申请的专利计算,取值标注在窗口末年 $t$ 上,使用者可根据研究设计自行滞后。一件专利在其涉及的每个不重复四位小类上各计一件,因此 $x{E,i}$ 表示企业 $E$ 在窗口内于技术类别 $i$ 上拥有的专利件数,这一矩阵即企业—技术共现网络的权重。 网络建成后,第一步是识别企业真正具备优势的技术领域,而非简单罗列它申请过专利的所有领域。判据是显性技术优势:若企业 $E$ 在技术类别 $i$ 上的专利占其自身专利组合的份额,高于该技术类别在全部企业专利组合中的平均份额,则认定该企业在此类别上具有相对技术优势。 $$RTA{E,i}=\frac{x{E,i}\big/\sum{i}x{E,i}}{\sum{E}x{E,i}\big/\sum{E}\sum{i}x{E,i}}$$ 据此把加权网络二值化为企业—技术双模矩阵 $M$:当 $RTA{E,i}\geq 1$ 时 $M{E,i}=1$,否则为 $0$。矩阵 $M$ 的两侧度中心性分别给出两个基础量。企业侧的度中心性即技术多样性,等于该企业具有相对技术优势的技术类别数量,$T{E,0}=\sum{i}M{E,i}$;技术侧的度中心性即技术遍在性,等于在该技术类别上具有相对技术优势的企业家数,$T{i,0}=\sum{E}M{E,i}$。多样性衡量企业优势技术的覆盖广度,遍在性衡量一项技术被多少企业共同掌握——遍在性越低,说明该技术越稀缺、越不易被模仿。 第二步是在双模网络上作反射法迭代,让企业侧与技术侧的信息相互校正,从而得到比单纯计数更细粒度的估计。迭代规则是:企业的取值取其全部优势技术在上一轮取值的平均,技术的取值取掌握它的全部企业在上一轮取值的平均。 $$T{E,n}=\frac{1}{T{E,0}}\sum{i}M{E,i}\,T{i,n-1},\qquad T{i,n}=\frac{1}{T{i,0}}\sum{E}M{E,i}\,T{E,n-1}$$ 第一次迭代得到平均技术遍在性 $T{E,1}$,即企业全部优势技术类别遍在性的算术平均,它反映企业的技术组合整体上有多普遍。第二次迭代得到本数据集的核心指标技术复杂度 $T{E,2}$:此时每个技术类别已被替换为"掌握该技术的企业的平均技术多样性",再对企业的全部优势技术求平均。因此技术复杂度衡量的是,企业的优势技术在多大程度上集中于那些由技术多元化企业共同掌握的领域。 补充说明 - 样本口径:覆盖全部A股上市公司,不预先剔除任何行业,也不作缩尾处理,使用者可按研究需要自行施加样本限制。仅当企业在五年窗口内有专利时才有取值,因此与财务面板合并时会损失无专利企业;这些企业系统性偏小,且本指标没有自然零点,缺失不可填零。样本参照系包含尚未上市与已退市的年份,窗口末年的取值会随年度更新而重算。 - 参照系与原文的差别:显性技术优势与技术遍在性都是跨企业统计量,其取值取决于把哪些企业放进网络。原文的参照系是国家级专精特新上市企业,本数据集为服务通用研究改用全部A股上市公司,并在建网前剔除混入专利数据的新三板挂牌公司、B股独立上市公司与已弃用的历史代码。因此本数据集的绝对水平与原文报告的数值不可直接比较,企业之间的相对含义不变。此外,一件专利若同时关联多家上市公司(联合申请或母子公司),会在每家公司的技术组合中各计一次。 - 迭代次数的选择:原文只写"在一系列 $n$ 次迭代"而未指明具体次数,本数据集取 $n=2$。这一选择并非无关紧要:反射序列的排序按迭代次数的奇偶交替反向,相邻两次迭代给出的企业排序呈负相关,改用相邻次数会使回归系数变号。该方法的来源文献在城市层面取 $n=20$,并规定"排序在相邻两步之间稳定时停止迭代"。这一停止准则在企业层面并不成立:企业—技术二模网络远比城市—技术网络稠密,反射序列迅速收敛到平凡解,取 $n=20$ 时企业间的截面差异只存在于第五、六位有效数字,大量企业取值完全并列,相邻两次迭代的排序仍在按奇偶反向,且所得排序与技术多样性近乎正交、构念表现更差。因此本数据集取仍保留截面区分度、方向与复杂度一致的低阶偶数次反射。若需贴近来源文献的高阶取值,可按上式自行续迭代。 - 跨年度可比性:显性技术优势的参照系逐年扩张,企业平均优势技术数随之上升,带动技术多样性、平均技术遍在性与技术复杂度的水平值逐年抬升,同时年内离散度收窄。这一上升来自全网判定的稠密化而非企业自身变化,跨期使用须加入年份固定效应,或先作年内标准化。样本期最早的若干年网络中企业极少,取值不宜与后期混用。 - 数值构成:技术复杂度与企业技术多样性、专利规模在年内呈正相关;行业格局上采矿、电力与建筑类高于信息技术与金融类。建议在回归中同时控制专利规模、行业与年份固定效应。当企业的优势技术类别只有一个时,其技术复杂度退化为该唯一技术类别的取值,与企业自身特征无关,并会出现多家企业取值完全相同的情形;数据集已提供技术多样性与窗口专利数量两列,可据以过滤。 - 其他局限:五年重叠窗口使相邻年度取值高度相关,企业内部可用变异有限,不适合直接用于以企业固定效应识别短期冲击的设计;申请年度上限取当前自然年的前一年(与本数据库其余专利类数据集统一口径),当年申请的专利因约十八个月的公开滞后而绝大多数尚未入库,保留会产出严重失真的当年行并污染滚动窗口,故不予输出;即便如此,专利公开滞后仍使样本末端年份的专利不完整且实用新型占比明显偏低,会压低末年的技术多样性与技术复杂度;数据源同时包含发明专利与实用新型,原文未限定专利类型,若仅用发明专利重算,企业排序会有一定幅度的重排。 参考文献 - 刘蕾蕾,巴志超,孟凯,等.技术复杂性、知识整合能力与企业高质量发展——来自专精特新中小企业的证据[J].科技进步与对策,2026,43(2):71-83. - HIDALGO C A, HAUSMANN R. The building blocks of economic complexity[J]. Proceedings of the National Academy of Sciences, 2009, 106(26): 10570-10575. - BALLAND P A, RIGBY D. The geography of complex knowledge[J]. Economic Geography, 2017, 93(1): 1-23.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。