企业技术临近度

「企业技术临近度」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 71,565。 基于企业后向专利引用在技术领域上的分布,度量企业与其他上市公司在技术空间中的靠近程度。

时间跨度1990-2025 年
数据频率年度
层级上市公司
变量数19
样本量71,565
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度,本数据集各指标均为截至该年度的累计口径
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • CumExternalCitationCount [累计对外专利引用数] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:企业截至当年申请的全部专利所作出的后向引用中,剔除指向自身专利的自引之后的累计引用条数。该指标是技术领域份额分布的分母。用作研究变量,越大代表企业引用外部先行技术的累计规模越大
  • CitedIPCClassCount [累计被引技术领域数] — 计算公式为:企业截至当年的对外专利引用所涉及的不同国际专利分类小类的个数,即技术领域份额分布中取值非零的领域个数。用作研究变量,越大代表企业的知识来源覆盖的技术领域越广
  • OwnCitationConcentration [自身引用领域集中度] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:企业后向引用在各技术领域上份额的平方和,即技术临近度公式分母中的自相关项。取值介于技术领域总数的倒数与1之间。用作研究变量,越大代表企业的知识来源越集中于少数技术领域
  • TechRivalCount [技术对手企业数] — 参与技术临近度计算的其他上市公司数量,计算公式为:当年在市且截至当年已有可识别对外引用的上市公司数减一。该指标是平均技术临近度的分母,同一年度内对所有企业取值相同
  • TechProximityMean [平均技术临近度] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:焦点企业与当年全部其他上市公司之间技术临近度的算术平均。两家企业的技术临近度定义为双方后向引用在技术领域上份额分布向量的非中心相关系数(即余弦相似度),取值介于0与1之间,0表示两者引用的技术领域毫无交集,1表示引用分布完全相同。因比较对象为全部上市公司,该指标在同一年度内与企业技术方向在当年市场主流技术方向上的投影构成严格仿射关系,故宜解读为企业技术方向的主流化程度;若需度量与同行业技术对手的接近程度,应按行业分组后在组内重算。用作研究变量,越大代表企业的技术方向越接近市场主流方向
  • TechProximitySum [技术临近度总和] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:焦点企业与当年全部其他上市公司之间技术临近度之和,即原文将技术临近度转换为知识溢出权重时所使用的归一化分母。该指标与平均技术临近度在同一年度内仅相差一个对全体企业相同的乘数,二者严格共线,不可同时放入含年份固定效应的回归。用作研究变量,越大代表企业在技术空间中的邻居总量越大
  • TechProximityMax [最大技术临近度] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:焦点企业与当年全部其他上市公司之间技术临近度的最大值,刻画技术空间中最贴近的那一个对手。该指标是比较对象数以千计时的极值统计量,取值普遍逼近上界、区分度有限,且累计被引技术领域数极少的企业机械趋近于1,故不建议作为主回归的稳健性变量,使用前应对累计被引技术领域数设定下限。用作研究变量,越大代表存在与之技术基础越相似的对手
  • TechProximityMeanClass [平均技术临近度_大类口径] — 参考Noel and Schankerman (2013, JIE)的方法,计算公式为:将技术领域的划分粒度由国际专利分类小类放宽至大类之后重算的平均技术临近度,用于检验结论对技术分类粒度的敏感性。因类别更粗、领域重叠更易发生,取值系统性高于小类口径。用作研究变量,越大代表企业在粗粒度技术空间中与其他企业的平均距离越近

常见问题

「企业技术临近度」是什么数据集?
企业技术临近度,隶属创新与知识产权。基于企业后向专利引用在技术领域上的分布,度量企业与其他上市公司在技术空间中的靠近程度。
该数据集的时间范围是?
覆盖 1990-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:累计对外专利引用数、累计被引技术领域数、自身引用领域集中度、技术对手企业数、平均技术临近度、技术临近度总和、最大技术临近度、平均技术临近度_大类口径。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 71,565 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业在研发活动中并非孤立地积累知识,而是处在一个由技术领域构成的空间之中。两家企业若长期从同一批技术领域汲取知识,它们在技术空间中的位置就彼此靠近:一方的研发外溢更容易被另一方吸收,双方也更可能在专利权的边界上发生交叠与摩擦。技术临近度正是刻画这种"位置靠近程度"的基础构件,它既是度量知识溢出接受强度的权重来源,也是识别技术对手、进而讨论专利谈判与执行成本的前提。 Noel 和 Schankerman (2013) 在研究战略性专利行为时给出了本数据集所复现的测度。其出发点是:一件专利的后向引用直接标明了该发明所依托的先行技术,因而引用在技术领域上的分布,比专利本身在技术领域上的分布更贴近知识的实际流向。这是本指标与更早一脉测度的根本分野——Jaffe (1986) 所开创的经典做法以企业专利在技术类别上的分布构造邻近度,而本指标改以企业后向引用在技术类别上的分布构造。原文同时报告,两种口径在横截面上的相关系数为 0.69,即二者相关但并不等价,应当视为互为补充的替代口径而非同一指标。 构造分两步。第一步是把每家企业刻画成技术空间中的一个方向。对企业 $i$,收集其截至第 $t$ 年申请的全部专利所作出的后向引用,剔除指向自身专利的引用,再按被引专利所属的技术领域归类。此处有两点与原文的表述略有出入:原文以企业截至该年已获授权的专利为施引方,本实现对施引方不再额外施加授权状态的筛选,凡已公开的专利(含尚在审查中的发明申请)均计入,因而引用基数略宽;自引的识别依据是被引专利是否属于该公司自有专利集合,而该集合只覆盖境内公开的专利,企业引用自身境外同族专利的情形无法被识别为自引。令 $K$ 为技术领域的总数,$cite{ikt}$ 为落在领域 $k$ 的累计引用条数,$cite{it}=\sumk cite{ikt}$ 为累计引用总条数,则企业 $i$ 的引用分布向量为 $W{it}=\{w{ikt}\}{k=1}^{K}$,其中 $$w{ikt}=\frac{cite{ikt}}{cite{it}},\qquad \sum{k=1}^{K} w{ikt}=1$$ 技术领域以国际专利分类的小类为单位划分。选择这一层级,是因为它与原文所用分类体系的粒度最为接近,且原文在界定研究对象时本身即以该层级的某个具体小类为准绳。被引专利的领域归属取其主分类,使每条引用恰好归入一个领域,与原文"引用落在领域 $k$"的单一归属口径一致。 第二步是度量两个方向之间的夹角。企业 $i$ 与 $j$ 在第 $t$ 年的技术临近度定义为两个分布向量的非中心相关系数,即 $$\tau{ijt}=\frac{W{it}'W{jt}}{\left(W{it}'W{it}\right)^{1/2}\left(W{jt}'W{jt}\right)^{1/2}}$$ 由于份额向量各分量非负,$\tau{ijt}$ 必然落在 $[0,1]$ 区间:取 0 表示两家企业的引用在技术领域上毫无交集,取 1 表示二者的引用分布完全相同。分母中的 $W{it}'W{it}=\sumk w{ikt}^{2}$ 是企业自身引用分布的集中度,取值介于 $1/K$ 与 1 之间,越接近 1 说明该企业的知识来源越集中于少数技术领域;该量本身即作为中间变量输出,便于使用者判断某家企业的引用分布是宽广还是狭窄。 $\tau{ijt}$ 是企业对层面的量。为产出企业—年度面板,本数据集报告焦点企业与当年全部其他上市公司之间临近度的行内汇总。核心指标为平均技术临近度 $$\overline{\tau}{it}=\frac{1}{Nt-1}\sum{j\neq i}\tau{ijt}$$ 其中 $Nt$ 为第 $t$ 年参与比较的企业数,即当年在市且截至该年已有可识别对外引用的上市公司数量;分母 $Nt-1$ 亦作为中间变量输出。与之并列输出的是未经平均的求和式 $\sum{j\neq i}\tau{ijt}$,它正是原文用于把临近度转换为权重时所使用的归一化分母,因而与原文的对应最为直接;平均值则消除了逐年参与比较的企业数变化所带来的机械影响,在跨年度比较时更为可靠。需要留意的是,这两列在同一年度内只相差一个对全体企业相同的乘数,提供的是同一信息。 这里必须指出行内汇总的一个数学性质,它直接决定了指标该怎么解释。由于技术临近度是两个已作单位化的份额向量的内积,对全部对手求和可以改写为焦点企业的方向向量与"当年全部企业方向向量之和"的内积。后者在同一年度内是唯一的一个向量,把它单位化之后可以称作当年的市场主流技术方向 $\bar{V}t$。于是 $$\overline{\tau}{it}=\frac{\left\|\sumj V{jt}\right\|\cdot\left(V{it}'\bar{V}t\right)-1}{Nt-1}$$ 也就是说,在同一年度内平均技术临近度与"焦点企业技术方向在市场主流方向上的投影"构成严格的仿射变换,年度横截面的全部差异都由这一个投影决定。其含义是:取值高低反映的是企业的引用是否落在当期最主流的技术领域,而两家彼此几乎没有技术交集的企业完全可能取到相同的值。在原文的设定下这一性质并无妨碍——其比较对象限定在一组技术高度同质的同行业企业之内,主流方向即该行业的技术方向,投影大正等价于与同行接近。而当比较对象扩展到全部上市公司之后,主流方向变成全市场专利活动的加权平均方向,指标的含义随之从"与特定对手的接近程度"位移为"企业技术方向的主流化程度"。实测也印证了这一点:企业引用份额落在全市场最热门的那一批技术小类上的比例,与本指标高度相关;在行业层面,行业取值与该行业引用的主流化程度几乎完全同向,而与该行业的引用规模基本无关。引用高度集中于数据处理、数字通信与商业方法类领域的互联网、软件与资本市场服务居于高位,引用分散于各自专用技术领域的医药制造、化学原料与纺织居于低位,电子设备制造业尽管引用规模居前,却因引用分散而处于中下位置。 稳健性方面输出两列。其一是行内最大值 $\max{j\neq i}\tau{ijt}$,刻画焦点企业在技术空间中最贴近的那一个对手;其二是把技术领域的划分粒度由小类放宽到大类之后重算的平均技术临近度,用于检验结论对分类粒度的敏感性。后者因类别更粗、重叠更易发生,水平系统性高于主口径。需要留意的是,在数以千计的比较对象下取最大值是一个极值统计量,其取值会普遍逼近上界,这一性质与企业规模无关。 累计口径遵循原文的设定:引用存量累计至第 $t$ 年,企业在某年度没有新增对外引用时,其引用分布相对上一年保持不变。企业上市之前申请的专利所产生的引用同样计入累计存量。样本覆盖全部上市公司,不作行业与板块的限制,也不剔除金融业——本指标不涉及财务报表口径的可比性,因而不存在剔除的理由。所有输出变量均不作缩尾处理,因为由 $\tau$ 构造的各列在定义上已经落在有界区间内。 补充说明 - 对手集的范围决定了指标的绝对水平与构念:原文的样本是同属一个技术高度同质行业的一组公司,本数据集的比较对象则是当年在市的全部上市公司。跨行业的企业对在技术上大多毫无交集,因此本数据集的临近度水平显著低于原文报告值;若只在同行业内部比较,水平与原文报告的中位数相当接近。使用时应加入行业固定效应;若研究关心的是同行业技术对手,须按行业分组后在组内重算,不能直接使用本列(理由见正文关于投影性质的说明)。 - 固定效应设定下的必备控制:经公司与年度双向去均值之后,剩余变异中相当一部分可由企业自身引用存量与被引领域数的增长解释,而后者与研发投入、企业规模、政府补贴直接共变。在固定效应回归中应把累计对外引用数的对数与累计被引技术领域数一并作为控制变量,并报告加入前后的系数变化。 - 累计口径的固有性质:引用存量逐年积累,引用分布随之铺开、与他人的重叠机械上升,指标的年度均值因而呈现单调上行的趋势;同时,企业在某年度没有新增对外引用时取值相对上一年冻结,这类观测的逐年变化完全来自比较对象集合的变动而非自身行为。使用时须加入年份固定效应;又因比较对象集合随上市扩容而逐年改变成分,某一技术领域企业的集中上市会单独抬高该领域企业的取值,做双重差分或事件研究前须检查处理组是否与某一时期的行业性上市潮重合。 - 两端年份的可得性问题:后向引用记录的覆盖在样本前段明显偏薄,早期年份的取值主要由记录的可得性决定;样本末端则是另一个方向的问题——审查员引用通常要在申请之后数年才入库,因此最近若干个申请年的引用记录尚未成熟,表现为新增引用锐减、取值相对上一年大面积冻结、相邻年度高度雷同。这两端的年份仍照常输出,但建议将主回归窗口的下限设在引用覆盖稳定之后、上限留出若干年的引用成熟期,并把两端年份作为稳健性检验单独报告;尤其应避免把样本末端年份用作处理后时期,否则容易得到"指标不动"的假零效应。 - 行内最大值的机械性:取最大值是一个极值统计量,在数以千计的比较对象下几乎总能找到一个引用分布高度重合的对手,该列因而水平偏高、区分度有限,且这一点与企业规模无关。取值恰为 1 的观测绝大多数出现在累计被引领域数极少的企业上——两家企业各自只引用同一个技术领域时,临近度机械地等于 1。不建议作为主回归的稳健性变量;更适合用作"是否存在近乎同质的技术对手"的粗略标记,使用前应先对累计被引领域数设定下限。 - 三列汇总只有一个自由度:临近度总和等于平均值乘以比较对象个数,而后者在同一年度内对全体企业取同一个值。在含年份固定效应的回归中,总和与平均值给出完全相同的结果,两者不构成互为稳健性的检验,也不可同时放入同一回归。 - 缺失的方向与取值方向同向:指标缺失意味着企业截至该年没有任何可识别的对外引用。缺失率在专利活跃的制造业很低,在金融、零售、房地产一类行业则相当高;而恰恰是后面这些行业中留存下来的企业,因引用集中于数据处理与商业方法类领域而取到样本内的较高值。换言之,被剔除的是同行业内技术活动更少的那一批,这会同时抬高相关子样本的均值并压低其方差。若研究设计中"是否进入样本"与被解释变量相关,须做选择性检验,或至少把"当年是否有可识别对外引用"作为二元控制变量。缺失不可填 0 ——0 在本指标中已被赋予"与所有其他企业的引用分布均无交集"的实义,两者语义冲突。 - 稀疏引用分布的噪声:一部分企业年的累计引用条数与被引领域数都很少,极端情形下只引用了一个技术领域,此时临近度退化为"比较对象在该单一领域上的平均份额",与"两家企业有多相似"并非一回事。建议主回归对累计对外引用数或累计被引技术领域数设定下限做稳健性检验,限定在引用覆盖稳定之后的区间时,这样做的样本损失很小。 - 时点与前视:后向引用是在专利公开与实质审查阶段才形成的记录,而本指标按申请年归集,故第 $t$ 年的累计快照包含了其后若干年才实际可观测的引用信息。原文按申请年标定专利,具有同一性质。用作同期解释变量时存在前视信息,对时效敏感的识别策略应改用滞后项。
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。