国际技术捕获效应

「国际技术捕获效应」,覆盖 1985-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 96,764。 基于专利后向引证测度企业从外部技术池中捕获技术溢出的程度。

时间跨度1985-2025 年
数据频率年度
层级上市公司
变量数23
样本量96,764
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • InventPatentCount [发明专利申请量(中间变量)] — 中间变量。上市公司本体当年申请的发明专利件数,当年未申请的记为0。它是主指标的计算基础,也可用于区分主指标的两类零值:本字段为0表示本体当年无发明专利申请,本字段为正而主指标为0表示有申请但未产生对外引证
  • PatentFamilyCount [简单同族数(中间变量)] — 中间变量。上述发明专利所归属的简单专利同族去重个数,同一同族内的多件专利只计1个。简单同族指共享相同优先权的一组专利文献,是主指标的聚合与去重单位
  • CitingPatentCount [含后向引证的发明专利数(中间变量)] — 中间变量。上述发明专利中至少发出一条后向引证的件数,在剔除自引之前统计。它与发明专利申请量之比反映当年引证记录的完整程度,用于判断观测是否可靠,本身不宜作为技术捕获规模的度量
  • RawCitationCount [原始后向引证次数(中间变量)] — 中间变量。上述发明专利发出的后向引证总条数,为剔除自引与同族内去重之前的原始计数。本字段减去自引证次数再减去主指标,即为同族内去重所消去的数量
  • SelfCitationCount [自引证次数(中间变量)] — 中间变量。上述发明专利引证本体名下既有专利的次数。自引反映企业对自有技术的延续与深化,属于内部知识积累而非外部技术捕获,故在计算主指标时被剔除
  • FCitation [家族引证次数(国际技术捕获主指标)] — 本数据集的主指标(水平值形式),即企业的国际技术捕获程度。参考曲如晓等 (2025, 世界经济)的方法,计算公式为:上市公司本体当年申请的发明专利所在的简单同族,对本企业以外专利发出的引证次数之和,其中同族内不同专利文献引证同一篇专利时计为1次,且剔除引证本企业专利的自引部分。用作研究变量,越大代表企业从外部技术池中捕获的技术溢出越多;因分布高度右偏,回归中通常改用其对数形式
  • LnFCitation [家族引证次数对数(国际技术捕获主指标)] — 本数据集的主指标(对数形式),回归分析中通常直接使用本字段。参考曲如晓等 (2025, 世界经济)的方法,计算公式为:ln(1+家族引证次数)。取对数以缓解引证次数分布的右偏,加一使当年未产生对外引证的企业年度仍保留在样本中。用作研究变量,越大代表企业的国际技术捕获程度越高
  • GroupInventPatentCount [发明专利申请量(集团口径·中间变量)] — 中间变量,对应稳健性指标的计算基础。按集团口径统计的当年发明专利申请件数,专利归属范围含上市公司本体、子公司、联营企业、合营企业与联合申请。本字段与发明专利申请量之差即为非本体主体贡献的部分
  • GroupFCitation [家族引证次数(集团口径·稳健性指标)] — 稳健性指标(水平值形式),供更换专利归属口径的稳健性检验使用。算法与主指标相同,区别仅在于专利归属范围扩展至上市公司本体、子公司、联营企业、合营企业与联合申请,自引也相应按集团名下全部专利剔除。因两个口径的自引集合不同,少数企业年度的本字段会略低于主指标
  • GroupLnFCitation [家族引证次数对数(集团口径·稳健性指标)] — 稳健性指标(对数形式),供更换专利归属口径的稳健性检验使用。计算公式为:ln(1+集团口径家族引证次数)。含义与主指标的对数形式相同,区别仅在于专利归属范围扩展至子公司、联营企业、合营企业与联合申请
  • IsCleanWindow [是否处于干净窗口(样本筛选标识)] — 样本筛选标识,用于剔除引证记录不完整的年度(0=否,1=是),取值为1的区间为2010年至2021年。早期年份的引证记录稀疏,此后随专利检索报告电子化而大幅跃升并趋于稳定;临近当期的年份则因专利公开与检索报告出具的滞后而尚未成熟。需注意本标识只表示该年度引证记录基本齐备,并不表示窗口内跨年水平可比——窗口内每件专利著录的引证条数仍在持续上升,做依赖时序水平的设计时应加入年份固定效应
  • IsListed [当年是否已上市(样本筛选标识)] — 样本筛选标识,用于剔除上市前年度(0=否,1=是),判定方式为上市日期所在年份不晚于当年、且未退市或退市年份不早于当年。因专利按当前企业名录回溯归属,面板中含相当比例早于上市年份的观测,做首次公开发行或并购前后的事件研究时可据本字段截断样本

常见问题

「国际技术捕获效应」是什么数据集?
国际技术捕获效应,隶属创新与知识产权。基于专利后向引证测度企业从外部技术池中捕获技术溢出的程度。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 23 个变量。核心指标包括:发明专利申请量(中间变量)、简单同族数(中间变量)、含后向引证的发明专利数(中间变量)、原始后向引证次数(中间变量)、自引证次数(中间变量)、家族引证次数(国际技术捕获主指标)、家族引证次数对数(国际技术捕获主指标)、发明专利申请量(集团口径·中间变量)、家族引证次数(集团口径·稳健性指标)、家族引证次数对数(集团口径·稳健性指标)、是否处于干净窗口(样本筛选标识)、当年是否已上市(样本筛选标识)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,764 条观测。
数据是如何测算/获取的?
指标定义与计算方法 在全球产业链网络中,处于中心位置的节点不仅拥有广泛的直接连接关系,还具有更为复杂的高阶连通关系,从而能够以更短的路径接触到伴随产业链条流动的无形知识与技术。曲如晓、王陆舰和邓颖(2025)将这一机制概括为技术捕获效应(technological capture effect):随着产业链合作的深化以及投入产出要素的持续交互,网络内的无形知识与技术资源逐渐成为企业创新的重要源泉,而中心节点因其更高的网络联结度和更丰富的交互机会,更容易捕获全球范围内的知识与技术资源。本数据集即刻画企业从外部技术池中捕获技术溢出的程度。 度量这一构念的关键在于找到企业"吸收了哪些外部技术"的显示性证据。专利的后向引用恰好提供了这样的证据:一件专利在申请时列出的引证文献,是审查与撰写过程中被认定为该发明所依托的既有技术,因而后向引用的规模直接反映了企业在多大范围内汲取了他人的技术成果。曲如晓等(2025)参考 Ayerst 等(2023)的做法,以企业发明专利的家族引证次数作为国际技术捕获程度的代理变量。之所以限定于发明专利,是因为发明专利须经实质审查并出具检索报告,其引证关系是对技术来源的实质认定;也正因如此,本指标的计算基础仅取企业当年申请的发明专利。 计算以简单同族(simple patent family)为聚合与去重的单位。同一项发明在不同受理局提交时会形成多件专利文献,它们共享相同的优先权而构成一个同族。若按单件专利累加引证,同一项技术依托关系会因申请地域的多寡而被重复计入,使跨企业比较受到海外布局策略的干扰。以同族为单位聚合,并规定同族内不同文献引证同一篇专利文献时只计一次,正是为了剔除这种重复。 在此基础上,核心指标定义为企业当年申请的发明专利所在的简单同族,对本企业以外的专利所发出的引证次数之和。排除本企业自身专利(即自引)是必要的:自引反映的是企业对自有技术的延续与深化,属于内部知识积累,而非从外部捕获的技术溢出。形式化地, $$FCitation{it}=\sum{s=0}^{t}\sum{h\neq i}Cites{it}^{hs}$$ 其中 $Cites{it}^{hs}$ 表示企业 $i$ 在第 $t$ 年申请的发明专利引证申请人 $h$ 在第 $s$ 年申请的专利的次数,$h\neq i$ 即排除自引。求和对被引专利的申请年份 $s$ 不设下限,涵盖历史上任意年份提交的专利;由于一件专利只可能引证申请在先的技术,$s\le t$ 这一约束自然成立,无须另行施加。 专利归属口径是本指标的一项关键设定。 上市公司名下的专利可由本体申请,也可由其子公司、联营企业、合营企业申请或以联合申请形式出现。本数据集的核心字段以上市公司本体申请的发明专利为计算基础:按原文的样本条件对两种口径分别标定后可以确认,原文报告的专利数量分布与本体口径吻合,而将子公司及其他关联主体一并纳入会使同一样本的水平成倍抬高。为兼顾与按集团口径构造的其他专利指标对齐的需要,数据集同时提供集团口径的三个平行字段(集团口径发明专利申请量、集团口径家族引证次数及其对数),其专利归属范围含本体、子公司、联营企业、合营企业与联合申请,自引也相应按集团名下全部专利剔除。两个口径各自内部自洽,使用者可按研究设计选择。 考虑到引证次数的分布高度右偏,回归分析中通常使用其对数形式 $LnFCitation=\ln(1+FCitation)$。加一处理使当年未产生对外引证的企业年度仍保留在样本中。 为便于取用,数据集的字段按角色分为四类,字段中文名后均以括号标明所属类别。 主指标为家族引证次数及其对数,即上式定义的国际技术捕获程度,回归分析中通常直接使用对数形式。稳健性指标为集团口径下的同名两项,供更换专利归属范围做稳健性检验。中间变量是计算链上的构件,用于判断主指标的构成与可靠程度而非直接进入回归:发明专利申请量与简单同族数分别是求和的基础与聚合单位,二者的差额反映企业当年申请中同族重复的程度;含后向引证的发明专利数记录当年实际发出引证的专利件数,与发明专利申请量之比即是该企业当年引证数据的完整程度;原始后向引证次数是在剔除自引与同族内去重之前的计数,自引证次数则是被 $h\neq i$ 条件排除的部分——由原始计数减去自引再减去主指标,即可还原同族内去重所消去的数量。样本筛选标识有两个:干净窗口标识指示该年度的引证记录是否基本齐备,上市状态标识指示该企业年度是否处于上市存续期间,二者用于在回归前筛掉不适用的观测。 补充说明 - 样本口径:面板覆盖全部上市公司年度,当年未申请发明专利者其各项计数记为零,与原文样本一致(原文基准回归中被解释变量对数值的最小值为零,表明零专利企业年度进入样本)。数据集不预先施加剔除金融业、剔除特别处理公司等回归样本限制,也不作缩尾处理。需注意零值有两种成因:本体当年未申请发明专利者可由发明专利申请量为零识别,有专利却未产生对外引证者其发明专利申请量为正;本体口径下前一类占比明显高于集团口径,这是口径本身的特征而非缺失。 - 同族的界定范围:原文基于覆盖全球的专利库构造简单同族,同族成员包含各受理局的对应件。本数据集的专利收录以中国上市公司为范围,同族的境外成员未被纳入,因此绝大多数发明专利在库内的同族仅有单一成员,同族内去重规则实际生效的比例很小,核心指标在多数情形下接近专利层面的计数。方向上这使指标低于原文口径,且低估程度与企业的海外专利布局强度正相关。 - 引证数据的年度可比性:后向引证的可得性在样本期内存在结构性变化:早期年份的引证记录稀疏,此后随检索报告电子化而大幅跃升并趋于稳定;临近当期的年份则因专利公开与检索报告出具的滞后而尚未成熟,其中最近一两年还受上游两类数据快照时点不一致的影响——公开较晚的专利已进入分母却尚不可能有引证记录进入分子。干净窗口标识(取值为一的区间为 2010 至 2021 年)用于筛出引证记录基本齐备的年度。但该标识只管外延不管内涵:在窗口内部,每件专利所著录的引证条数仍在持续上升,这是检索报告著录体例演变带来的机械成分,与企业技术捕获强度的真实变化混在一起。因此含年份固定效应的设定不受影响,而依赖时序水平的设计(处理时点与该趋势相关的双重差分、趋势项解释、跨期均值比较)需另行处理。 - 自引的识别范围:$h\neq i$ 条件通过"被引专利是否属于该公司名下的专利集合"来判定,该集合与分子口径保持一致——本体口径只剔本体专利,集团口径剔集团全部专利,两者均含发明专利与实用新型。由此带来一个需留意的现象:当本体引用自家子公司的专利时,该条引证在本体口径下计入而在集团口径下被判为自引剔除,故少数企业年度的集团口径引证数会略低于本体口径,这是两个口径各自自洽的结果。此外,企业在境外申请且未被收录的自有专利无法识别为自引,会计入核心指标。 - 专利归属为回溯口径:专利按当前企业名录回溯归属,今日子公司的历史专利被计入上市公司的全部历史年度,因而面板中含相当比例早于上市年份的观测,且这些行的地理与行业列按当前档案填充。数据集直接提供上市状态标识,做首次公开发行或并购前后的事件研究时可据以截断。 - 与专利规模的关系:核心指标与发明专利申请量高度相关,且每件发明专利对应的引证条数分布相当集中,这是检索报告著录体例(每份报告列出数量相近的对比文献)的直接结果。原文将专利数量与家族引证次数同作被解释变量,该相关性不构成问题;但若将本指标用作解释变量并同时控制专利数量,二者会严重共线。需要分离"强度"维度的研究,可用数据集提供的家族引证次数与发明专利申请量自行构造单位专利引证强度。 - 其他说明:实用新型不进入核心指标的计算基础(仅在自引判定中作为被引方出现),与原文以发明专利为基础的设定一致。核心指标涵盖企业发出的全部对外引证,不按被引专利的受理局作境内外拆分:一方面这与原文设定一致——原文即以企业在全球范围内对其他专利的引用程度整体代表其捕获的技术溢出;另一方面实测显示境外被引占比在外商独资、中外合资与内资企业之间几乎没有差异,说明该占比主要由检索报告的检索习惯决定,而非企业层面的国际技术获取行为,单独取境外子集并不能提供更贴近"国际化"的度量。证券代码方面,仅保留可与主库关联的代码,由此排除 B 股孪生码、旧三板代码与北交所转板前的旧代码,以免同一批专利被计入两个主体。最后需提示,含后向引证的发明专利数与原始后向引证次数均在剔除自引之前统计,二者刻画的是引证记录的可得性而非对外捕获的规模。 参考文献 - 曲如晓,王陆舰,邓颖.全球产业链中心地位与中国企业创新:基于复杂网络视角[J].世界经济,2025,48(6):39-68. - AYERST S,IBRAHIM F,MACKENZIE G,et al.Trade and diffusion of embodied technology: an empirical analysis[J].Journal of Monetary Economics,2023,137:128-145.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。