企业技术溢出获得

「企业技术溢出获得」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 55,073。 参考沈坤荣等(2023, 中国工业经济)公式(24)与Bloom et al.

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数20
样本量55,073
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度与财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentCum [累计专利件数] — 截至当年的累计母公司专利申请件数(仅计入含有效IPC分类号的专利),是技术空间分布向量的构建基数。数值越小,企业的技术空间向量由越少的专利决定,测度噪声越大
  • TechFieldCum [累计技术领域数] — 截至当年企业累计涉足的IPC小类数量,即技术空间分布向量中取值为正的维度个数。数值越小,企业技术布局越集中
  • RDStock [研发资本存量] — 参考Griliches (1979, BJE)的永续盘存法,计算公式为:当年研发投入加上一年研发资本存量乘以0.85(年折旧率15%),首个观测年取当年研发投入除以0.20,单位为万元
  • TechSpilloverRaw [技术溢出获得原值] — 参考沈坤荣等(2023, 中国工业经济)公式(24)的方法,计算公式为:以本企业与样本内其他每一家企业的技术接近度为权重,对其他企业的研发资本存量加权求和(不含本企业自身),单位为万元
  • TechSpilloverGain [企业技术溢出获得] — 参考沈坤荣等(2023, 中国工业经济)公式(24)与Bloom et al. (2013, Econometrica)的方法,计算公式为:技术溢出获得原值的自然对数,其中技术接近度为两家企业在IPC技术领域上专利份额向量的余弦相似度。用作研究变量,越大代表企业从其他企业获得的技术知识溢出越多
  • TechSpilloverMahalanobis [跨技术领域技术溢出获得] — 参考沈坤荣等(2023, 中国工业经济)附录5的方法,计算公式为:在技术接近度矩阵中引入由各技术领域共同出现频率定义的领域相关性矩阵后重新加权求和,再取自然对数。放松了只有技术领域相同的企业之间才存在溢出这一假设,越大代表企业获得的跨技术领域知识溢出越多
  • TechSpilloverFlow [当年技术空间口径技术溢出获得] — 参考沈坤荣等(2023, 中国工业经济)公式(20)与公式(24)的方法,计算公式与企业技术溢出获得相同,但技术空间分布向量仅由当年申请的专利构成而非累计专利,当年未申请专利的企业取缺失值
  • TechSpilloverCity [同城市技术溢出获得] — 参考沈坤荣等(2023, 中国工业经济)表5的方法,计算公式与企业技术溢出获得相同,但加权求和仅限于注册在同一地级市的其他企业,用于考察技术溢出受行政边界的限制,越大代表企业获得的本市内技术溢出越多
  • TechSpilloverProvince [同省技术溢出获得] — 参考沈坤荣等(2023, 中国工业经济)表5的方法,计算公式与企业技术溢出获得相同,但加权求和仅限于注册在同一省份的其他企业,越大代表企业获得的本省内技术溢出越多

常见问题

「企业技术溢出获得」是什么数据集?
企业技术溢出获得,隶属创新与知识产权。参考沈坤荣等(2023, 中国工业经济)公式(24)与Bloom et al.
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:累计专利件数、累计技术领域数、研发资本存量、技术溢出获得原值、企业技术溢出获得、跨技术领域技术溢出获得、当年技术空间口径技术溢出获得、同城市技术溢出获得、同省技术溢出获得。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 55,073 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的技术进步不仅来自自身的研发投入,也来自其他企业研发活动的知识外溢。衡量一家企业究竟能从外部获得多少技术知识,关键在于回答两个问题:外部研发的"池子"有多大,以及这家企业与池中各个主体在技术上有多接近。技术空间越相近的企业,在知识结构、技术体系、所面临的技术难题与产业发展目标上共性越强,在协作解决问题与相互追赶竞争的过程中越容易彼此吸收与传播知识,因而越可能相互产生技术溢出。本数据集据此构造企业所获技术溢出的度量。 第一步是刻画企业的技术空间。以国际专利分类号作为技术领域的划分依据,把企业已申请专利按其所属技术领域归类,得到企业在各技术领域上的专利分布向量 $$Ti=(x{i,1},x{i,2},\dots,x{i,K})$$ 其中 $x{i,k}$ 为企业 $i$ 在第 $k$ 类技术领域的专利数量占其专利申请总量的比重,$K$ 为技术领域总数。同一件专利若在同一技术领域下挂有多个分类号,只计一次,以免分类号标注的疏密影响向量形状。核心口径下该向量由企业截至当年的累计专利构成,反映的是技术能力的存量而非当年新增。 第二步是度量任意两家企业的技术接近度。取两个技术空间分布向量的夹角余弦 $$\text{techprx}{i,l,t}=\frac{T{i,t}T'{l,t}}{(T{i,t}T'{i,t})^{1/2}(T{l,t}T'{l,t})^{1/2}}$$ 该值介于 0 与 1 之间,两家企业的技术布局完全重合时取 1,完全不相交时取 0。它既体现企业在技术领域上的相似性,也捕捉了企业在技术上的交流与互动。 第三步是度量每家企业可供外溢的研发规模。研发投入的效果具有跨期累积性,故不用当年流量而用资本存量,按永续盘存法递推 $$RDstock{i,t}=RD{i,t}+(1-\delta)RDstock{i,t-1},\quad \delta=0.15$$ 式中 $RD{i,t}$ 为企业当年的研发投入,涵盖费用化部分与资本化开发支出的变动,折旧率取 15%。企业首个观测年的初始存量按稳态假设取当年研发投入除以折旧率与稳态增长率之和,其中稳态增长率取 0.05。全部金额以万元计。 把前三步合起来,企业所获技术溢出定义为以技术接近度为权重、对样本内其他所有企业研发资本存量的加权求和 $$\text{techspill}{i,t}=\sum{l\neq i}\text{techprx}{i,l,t}\cdot RDstock{l,t}$$ 求和明确排除企业自身,因此该指标衡量的是外部知识池,而非企业自己的研发积累。核心指标取上式的自然对数。其直观逻辑是:企业之间在技术领域上越接近、互动交流越多,就越有可能受到其他企业的技术溢出。需要特别说明的是,由于该指标是从专利这一创新结果"事后"定义企业所受到的技术溢出,在考察外生冲击对企业所得技术溢出的影响时,解释变量通常需要取滞后一期。 上述构造隐含一个假设:只有技术空间相似的企业之间才存在溢出。为放松这一假设,本数据集另行给出考虑技术领域之间相关性的 Mahalanobis 指数版本。其思路是先用各技术领域共同出现在同一家企业中的"频率"来定义领域之间的相关性:把技术领域份额矩阵按企业方向标准化得到 $\tilde{X}$,按技术领域方向标准化得到 $\hat{X}$,前者刻画一家企业在各技术领域上的分布,后者刻画一个技术领域在各企业间的分布,进而得到技术领域相关矩阵与经其调整的接近度矩阵 $$\Omega=\hat{X}\hat{X}',\qquad TECH\M=\tilde{X}'\Omega\tilde{X}$$ 若两个技术领域频繁出现在同一家企业当中,即表明这两个领域的相关性更强,从而分处这两个领域的企业也更容易相互产生技术溢出。以 $TECH\M$ 的元素替代余弦接近度重新加权求和,即得到跨技术领域的溢出度量,它使得技术领域并不相同的企业之间也能够互相产生技术溢出。 数据集还提供三个替代口径。当年技术空间口径把分布向量改为仅由当年申请的专利构成,当年未申请专利的企业取缺失值。同城市口径与同省口径则把加权求和的范围分别限制在注册于同一地级市、同一省份的其他企业,用以考察技术信息流动是否受到行政边界的约束——若企业跨越行政边界获取技术溢出的能力增强,则说明技术信息的传递范围被有效扩大。注册地为县级市而缺少地级市代码的企业,先经行政区划对照表回填至所属地级市后再行分组,以免系统性遗漏东部县级市企业。 此外,数据集给出累计专利件数与累计技术领域数两个构件量,分别对应技术空间分布向量的构建基数与非零维数,便于使用者识别那些技术空间仅由个位数专利决定的观测。 补充说明 - 样本口径:涵盖累计已有专利且当年披露年报的一般工商业上市公司,未预先施加行业剔除、缩尾或最小观测数限制,使用者可按研究需要自行设定。金融业公司因财务报表类型差异不进入样本框。 - 技术领域的粒度:原文将技术领域表述为"三位码"分类号并给出领域总数,但按部与大类构成的三位码在全球仅有一百余个,与该总数不符,而按部、大类、小类构成的四字符小类数量与之吻合。本数据集据此按小类实现,与同一篇文献下另一指标的处理保持一致。 - 技术空间的时间窗口:原文正文在定义分布向量时表述为当年,但该溢出指标明确参考的原始文献采用企业历史累计专利的领域份额。核心口径采用累计,当年口径作为替代度量一并给出,两者可相互检验。 - 研发投入的披露:在研发费用于利润表单独列示成为强制要求之前,相当比例的企业年份缺少研发投入披露,未披露一律按零处理,使早期年份的研发资本存量与溢出池被低估,且池中权重在早期高度集中于少数披露企业。建议加入年份固定效应,并考虑把样本起点设在披露普遍化之后。 - 时间维的解释:指标的水平值取决于样本内企业数量与技术空间密度,其跨年变动包含样本构成的机械成分。任何设定都应包含年份固定效应,不宜直接解读时间趋势,也不适合用于事件研究的动态效应图。 - 缺失值的含义:当企业的技术空间与样本内其余企业完全不相交,或分组口径下同组内只有本企业时,加权求和的结果恰为零,取对数后表现为缺失,属于结构性零而非数据未采集;此类情形集中于技术领域极为冷僻或同组企业稀少的观测。 - 两类口径的差异:研发资本存量按合并报表计量,涵盖企业集团的全部研发投入;技术空间向量则仅由母公司名义申请的专利构成。对以子公司为主要创新载体的集团型企业,权重与方向的覆盖范围并不完全一致。 - 与专利类被解释变量的关系:技术空间向量由企业自身专利构建,企业进入新的技术领域会同时改变其技术空间与本指标;若被解释变量同样来自专利记录,二者共享同一构建口径,作中介变量时需在设定上加以区分。 - 其他局限:样本以拥有专利的制造业与信息技术类企业为主,金融、房地产等门类进入比例较低;样本框包含企业上市前已披露年报的年份,做政策评估时可考虑限定于上市后年份;本数据集的溢出池由上市公司构成,规模小于以全部工业企业为样本的原始研究,水平值不宜与原文描述统计直接比较;申请年份上限取当前自然年的前一年(与本数据库其余专利类数据集口径统一),但受专利公开约 18 个月行政滞后影响,末年专利收录仍不完整、可见量约为前一年的六成,末年取值会因此偏低,跨期比较须加入年份固定效应,需要末端干净的研究应自行截至前二年。 参考文献 - 沈坤荣,林剑威,傅元海.网络基础设施建设、信息可得性与企业创新边界[J].中国工业经济,2023(1):57-75. - Bloom N, Schankerman M, Van Reenen J. Identifying technology spillovers and product market rivalry[J]. Econometrica, 2013, 81(4): 1347-1393. - Jaffe A B. Technological opportunity and spillovers of R&D: evidence from firms' patents, profits, and market value[J]. The American Economic Review, 1986, 76(5): 984-1001. - Griliches Z. Issues in assessing the contribution of research and development to productivity growth[J]. The Bell Journal of Economics, 1979, 10(1): 92-116.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。