企业信息共享程度

「企业信息共享程度」,覆盖 1985-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 68,758。 基于专利引用关系度量企业与其研发合作者之间信息、知识与技术的共享充分程度。

时间跨度1985-2025 年
数据频率年度
层级上市公司
变量数21
样本量68,758
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentNum [发明专利申请量] — 当年归属该公司(按合并报表口径计入上市公司本身及其子公司)的发明专利申请件数,是企业信息共享程度做平均化处理时的分母
  • CoopPatentNum [合作研发发明专利数] — 当年申请人中出现本公司主体之外机构的发明专利件数,用于区分合作研发专利与独立研发专利;以本公司主体全称起头的内设研究院与分公司不计为外部机构
  • PartnerNum [外部合作者数量] — 当年全部合作研发发明专利的外部申请人去重计数,即企业当年合作者集合的规模;该数值越大,独立研发专利被判定为存在信息共享的概率机械越高,用作研究变量时建议与核心指标一并纳入回归
  • HasPartner [是否有外部合作者] — 当年是否存在外部研发合作者(0=否,1=是)
  • BackwardCiteNum [后向引用总次数] — 当年全部发明专利引用在先专利的总次数,是可供匹配合作者先前专利的引用池厚度
  • PartnerCiteNum [引用合作者先前专利次数] — 参考龙小宁等 (2023, 中国工业经济)的方法,计算公式为:当年全部发明专利引用合作者先前专利的次数之和,其中合作研发专利统计其自身合作者的先前专利、独立研发专利统计企业当年合作者集合的先前专利,被引专利的申请年份须早于焦点专利,且已剔除被引专利属于本公司自有专利组合的自引用
  • InfoShare [企业信息共享程度] — 参考龙小宁等 (2023, 中国工业经济)的方法,计算公式为:企业当年全部发明专利的ln(1+该专利引用合作者先前专利次数)的算术平均;合作研发专利统计其自身合作者的先前专利,独立研发专利统计企业当年合作者集合的先前专利,两者均剔除自引用。用作研究变量,越大代表企业与其研发合作者之间的信息、知识与技术共享越充分
  • InfoShareCoop [合作研发专利信息共享程度] — 参考龙小宁等 (2023, 中国工业经济)的方法,计算公式为:仅在当年合作研发发明专利子样本上计算的ln(1+引用该专利合作者先前专利次数)的算术平均;当年没有合作研发发明专利时取空值
  • InfoShareSolo [独立研发专利信息共享程度] — 参考龙小宁等 (2023, 中国工业经济)的方法,计算公式为:仅在当年独立研发发明专利子样本上计算的ln(1+引用企业当年合作者集合先前专利次数)的算术平均;当年没有独立研发发明专利时取空值
  • InfoShareFirm [企业层加总信息共享程度] — 参考龙小宁等 (2023, 中国工业经济)的方法,计算公式为:ln(1+当年引用合作者先前专利的总次数),将对数化处理放在企业层加总之后,不受企业当年专利件数多寡的平均化影响

常见问题

「企业信息共享程度」是什么数据集?
企业信息共享程度,隶属创新与知识产权。基于专利引用关系度量企业与其研发合作者之间信息、知识与技术的共享充分程度。
该数据集的时间范围是?
覆盖 1985-2025 年。
包含哪些变量/指标?
共 21 个变量。核心指标包括:发明专利申请量、合作研发发明专利数、外部合作者数量、是否有外部合作者、后向引用总次数、引用合作者先前专利次数、企业信息共享程度、合作研发专利信息共享程度、独立研发专利信息共享程度、企业层加总信息共享程度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 68,758 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业与外部机构开展合作研发时,能否真正从合作方获取信息、知识与技术,是合作研发能否转化为高质量创新的关键环节。理论上,合作各方之间的竞争关系越弱、所涉技术的初创性与基础性越强,双方越愿意深度分享各自掌握的核心知识;反之,出于保护自身市场地位的考虑,合作往往停留在浅层的、非核心的技术交流上。因此,度量企业与其合作者之间的信息共享程度,是理解不同合作研发模式在创新质量上为何出现系统性差异的核心环节。 本数据集参考龙小宁、刘灵子、张靖(2023)的方法,利用专利的引用关系刻画这一构念。其基本逻辑是:企业在研发一项技术并就此申请专利时,若该专利大量援引其合作方在此之前已经积累的专利技术,说明企业在合作过程中实际接触并吸收了合作方的知识存量,双方的信息共享因而更为充分;反之,若企业的专利与合作方的既有技术毫无引用关联,则合作更可能只是名义上的联合申请,并未发生实质性的知识流动。 指标的构建从专利的申请人信息出发。一项专利的申请人可能不止一个,凡申请人中出现了本企业及其纳入合并报表范围的主体之外的机构,即视为一项合作研发专利,这些外部申请人构成该专利的合作者;申请人全部为本企业自身主体的专利则为独立研发专利。判定"本企业主体"时,除名称完全相同外,还将以本企业主体全称起头的申请人一并归入内部——中文工商命名中"法人全称加分支名"的形式(如某股份公司下属的研究院、油田分公司)只可能是该法人的内设机构,不具独立法人资格,将其计为合作方会使指标退化为对自我援引的度量。已完成独立注册、名称不再共享前缀的同集团成员则仍按外部合作方处理,与其联合申请确为两个法人之间的合作。将企业在某一年度全部专利的外部合作者取并集,得到该企业当年的合作者集合。 在此基础上,对企业的每一件专利 $i$ 计算其对合作者先前技术的援引次数 $Ci$,并作对数化处理,得到专利层面的信息共享程度: $$Share{i}=\ln\left(1+C{i}\right)$$ $Ci$ 的统计范围依专利性质而不同。若 $i$ 为合作研发专利,$Ci$ 统计专利 $i$ 引用该专利自身合作者先前专利的次数;若 $i$ 为独立研发专利,$Ci$ 统计专利 $i$ 引用本企业当年合作者集合中各方先前专利的次数。此处的"先前"以被引专利的申请年份早于焦点专利的申请年份为准,即只有合作方在合作之前已经形成的技术积累才被计入,从而排除合作期间共同产出的技术。 一项关键的处理是剔除自引用。若企业 $i$ 专利所引用的,恰是它与该合作者此前共同申请的专利,这一引用有两种无法区分的来源:一是企业在合作中确实充分共享了信息并加以运用,二是企业出于抬高自身既有专利表面质量的动机而进行的策略性自我援引。由于二者在数据上不可辨识,凡被引专利属于本企业自有专利组合的引用一律予以剔除,使该指标更干净地反映合作双方之间的知识流动。 将专利层面的度量汇总到企业年度层面,得到核心指标——企业信息共享程度,即企业当年全部专利 $Sharei$ 的算术平均: $$InfoShare{j,t}=\frac{1}{N{j,t}}\sum{i\in\Omega{j,t}}\ln\left(1+C{i}\right)$$ 其中 $\Omega{j,t}$ 为企业 $j$ 在第 $t$ 年申请的全部专利集合,$N{j,t}$ 为其件数。该指标取值越大,代表企业当年在研发中越多地援引了合作方的既有技术积累,与合作者之间的信息共享越充分。 需要特别说明这一构造在合作研发专利与独立研发专利上的不同性质。合作研发专利的比对对象是该专利自身的合作方,数目固定;独立研发专利的比对对象则是企业当年的整个合作者集合,集合越大,一件独立专利偶然援引到其中某一方既有技术的概率就越高。因此在企业年度层面,独立研发专利那一支的取值与企业当年的合作者数量存在机械上的正向关联:按合作者数量分组观察,独立研发专利子样本的均值随合作者数量逐级抬升,而同期每件专利的后向引用条数几乎不变,说明抬升并非来自引用活动本身的增强,而是来自比对集合的扩张。原文以专利为观测单位并控制企业、技术领域与年份的交乘固定效应,这一成分被固定效应吸收;汇总到企业年度后它会显现出来。 数据集同时给出构建过程中的若干中间量,便于使用者复核与自行调整口径:当年专利申请件数、其中合作研发专利件数、外部合作者个数、当年是否存在外部合作者,以及作为引用池的后向引用总次数与剔除自引后援引合作者先前专利的总次数。另给出三个替代口径:仅在合作研发专利子样本上计算的均值、仅在独立研发专利子样本上计算的均值,以及将企业当年援引合作者先前专利的总次数直接作对数化处理得到的企业层加总口径 $\ln(1+\cdot)$。前两者用于分离两类专利各自的信息共享水平,后者不受企业专利件数多寡的平均化影响。 补充说明 - 样本口径:凡当年至少申请一件发明专利的企业年度均进入样本,不预先施加行业、板块或规模限制,亦不剔除金融类企业;使用者可按需自行按行业代码筛选。原文将样本限定为企业作为第一申请人且已获授权的发明专利,本数据集不施加这两项限制,凡归属该企业的发明专利申请均计入,因而覆盖面更广、引用密度略低于原文口径。专利按合并报表口径归集,即计入上市公司本身及其子公司申请的专利,不计入联营与合营企业的专利;同时归属多家上市公司的专利在各家面板中分别计入。 - 专利类型:焦点专利限定为发明专利。实用新型不进行实质审查,因而基本不产生审查员引用记录,若纳入将使指标在实用新型占比高的企业上机械地趋近于零,转而反映企业的专利类型结构而非信息共享水平。该限定属于方法本身的要求。 - 合作者的界定:外部合作者以申请人名称是否属于本企业主体集合来判定。若将企业自身的子公司视作合作者,指标将退化为对自我援引的度量,与剔除自引用的设计意图相悖。联营与合营企业不在合并报表范围内,与其联合申请按外部合作处理。名称匹配采用规范化后的精确匹配,同一主体的异名写法会形成漏匹配。 - 援引次数的计数:按引用关系计数,一件被引专利无论同时对应几位合作者都只计一次。判定"先前"时只能比对到申请年份,与焦点专利同年申请的合作方专利不计入,援引次数因而略偏保守。 - 引用数据的时间特征:专利引用信息在样本期的早段较为稀疏,在最近的申请年份则因专利公开与引用形成的滞后而尚未成熟,两端的引用池均明显薄于中段。受此影响,指标在样本期两端系统性偏低,跨年度比较时建议加入年份固定效应,或将分析窗口限定在引用池厚度稳定的中段区间。 - 与合作者数量的共线性(使用时必须处理):受上文所述构造性质影响,核心指标与外部合作者数量正相关,两者的秩相关接近 0.4。由于独立研发专利在企业年内通常占绝大多数,这一成分会传导到核心指标上。建议在回归中同时控制外部合作者数量;若研究关注的是合作过程本身的知识吸收,可改用仅在合作研发专利上计算的口径,其条件均值随合作者数量不升反降,不含该成分。 - 平均化的性质:核心指标为企业年内专利的算术平均,当年专利件数很少的企业年,单件专利的引用情况会主导取值,波动明显大于专利件数多的企业年。关注企业层总量而非人均强度的研究可改用加总口径,或在回归中控制专利件数。 - 集团内部关联的残余:内设机构已按上文规则归入本企业,但采用独立品牌、名称不共享前缀的同集团成员无法由名称识别,仍计为外部合作方。集团型企业的合作者数量与合作研发专利件数因而偏高,其指标中也会混入集团内部的知识流动。 - 其他局限:合作者的先前专利通过申请人名称定位,当合作者在其自身专利中并非第一申请人、且该专利不属于任何上市公司时无法被识别;境外被引专利没有中文申请人名称,以境外机构为合作方的情形同样无法匹配。两者均会使援引次数偏低。 参考文献 - 龙小宁,刘灵子,张靖.企业合作研发模式对创新质量的影响——基于中国专利数据的实证研究[J].中国工业经济,2023,(10):174-192.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。