企业与研发合作伙伴知识相关性
「企业与研发合作伙伴知识相关性」,覆盖 1993-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 23,657。 刻画焦点企业与其研发合作伙伴在知识领域构成上的接近程度。
| 时间跨度 | 1993-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 20 |
| 样本量 | 23,657 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 观测年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PartnerCount [研发合作伙伴数量] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法识别的研发合作伙伴规模,计算公式为:前五年(t-5至t-1年)内与本公司联合申请发明专利、且不属于本公司集团自身主体(本体、母公司、子公司、受同一母公司控制的其他企业、联营与合营企业)的企业类申请人去重数量。用作研究变量,越大代表企业研发合作网络覆盖的外部伙伴越多。
- FocalPatentCount [焦点企业前五年发明专利数] — 计算公式为:本公司(含其关联企业)在前五年(t-5至t-1年)内申请的发明专利件数合计,同一申请号只计一件。该值是知识相关性中本公司一侧知识领域向量的专利基数。
- PartnerPatentCount [合作伙伴前五年发明专利数] — 计算公式为:本公司全部研发合作伙伴在前五年(t-5至t-1年)内申请的发明专利件数之和,同一伙伴的同一申请号只计一件。该值是知识相关性中合作伙伴一侧知识领域向量的专利基数。
- FocalTechFieldCount [焦点企业知识领域数] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法对知识领域的界定,计算公式为:本公司前五年(t-5至t-1年)内申请的发明专利所载国际专利分类号取前四位(IPC小类,如C07C)后的去重数量。用作研究变量,越大代表企业自身知识基础覆盖的技术领域越广。
- PartnerTechFieldCount [合作伙伴知识领域数] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法对知识领域的界定,计算公式为:将本公司全部研发合作伙伴视为一个整体后,其前五年(t-5至t-1年)内申请的发明专利所载国际专利分类号取前四位(IPC小类)的去重数量。用作研究变量,越大代表合作伙伴整体知识基础覆盖的技术领域越广。
- KR [知识相关性] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法,计算公式为:以国际专利分类号前四位(IPC小类)为知识领域,分别统计本公司与其全部研发合作伙伴在前五年(t-5至t-1年)内申请的发明专利中各知识领域出现的次数,构成两个知识领域频次向量,再取两向量的余弦相似度,即各知识领域次数乘积之和除以两向量各自平方和之积的平方根。专利范围为发明专利,合作伙伴为剔除集团自身主体后的外部企业。取值介于0与1之间,为0表示双方知识领域完全不相关,越接近1表明双方知识领域越相近。用作研究变量,越大代表企业与其研发合作伙伴的知识基础越同质。
- KRAllPatent [知识相关性(含实用新型口径)] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法的同一公式,仅将专利范围由发明专利放宽至发明专利与实用新型专利合计后重新计算的知识相关性,计算公式与知识相关性一致。用作稳健性检验变量,越大代表企业与其研发合作伙伴的知识基础越同质。
- KRInclGroup [知识相关性(含集团内部协同口径)] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法的同一公式,仅将合作伙伴范围由外部企业放宽至联合申请发明专利中的全部企业类申请人(含本公司集团自身的母公司、子公司、联营与合营企业)后重新计算的知识相关性,对应原文仅检索上市公司本体专利时的口径,计算公式与知识相关性一致。该口径主要反映集团内部技术同构,取值高度向上限集中,用作与原文口径对标的参照变量,越大代表企业与其联合申请方的知识基础越同质。
- KRExclJoint [知识相关性(剔除双方共有专利口径)] — 参考刘凤朝、罗蕾、张淑慧(2021,科研管理)的方法的同一公式,仅在合作伙伴一侧的知识领域频次向量中扣除双方共同申请专利所贡献的次数后重新计算的知识相关性,用于检验知识相关性是否由双方合作专利本身驱动,计算公式与知识相关性一致。当合作伙伴在窗口内除双方合作专利外没有其他可检索专利时该值无定义。用作稳健性检验变量,越大代表企业与其研发合作伙伴在合作之外的知识基础越同质。
常见问题
- 「企业与研发合作伙伴知识相关性」是什么数据集?
- 企业与研发合作伙伴知识相关性,隶属创新与知识产权。刻画焦点企业与其研发合作伙伴在知识领域构成上的接近程度。
- 该数据集的时间范围是?
- 覆盖 1993-2025 年。
- 包含哪些变量/指标?
- 共 20 个变量。核心指标包括:研发合作伙伴数量、焦点企业前五年发明专利数、合作伙伴前五年发明专利数、焦点企业知识领域数、合作伙伴知识领域数、知识相关性、知识相关性(含实用新型口径)、知识相关性(含集团内部协同口径)、知识相关性(剔除双方共有专利口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 23,657 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业开展研发合作的前提,是与合作对象之间存在可以互通的知识基础。知识共享可以划分为知识访问与知识整合两个阶段:在知识访问阶段,企业接触并识别合作伙伴的知识领域,进行浅层学习;在知识整合阶段,企业需要把获取到的异质性知识吸收内化并应用于自身实践。合作双方知识基础的接近程度,决定了后一阶段的吸收效率与成本——当双方知识相关性较低时,企业对新知识的吸收能力有限,组织间学习效率不高;当知识相关性提高时,知识基础同质性增强,双方更易沟通并理解对方的知识元素,从而提升知识整合效率;而当知识相关性过高时,合作主体之间可供整合的异质性知识变少,既不利于扩大知识基础,也会加大自身特有知识组合的泄露风险。本数据集刻画的即是焦点企业与其研发合作伙伴之间的这一知识关系属性。 测度的基础是企业的专利知识结构。本数据集以国际专利分类号的前四位(即 IPC 小类,形如 C07C、H04M、G06F)表征一个知识领域,把企业在观测年份之前五年(第 $t-5$ 年至第 $t-1$ 年)申请的发明专利所载的全部分类号展开,统计每一类知识领域出现的次数,得到该企业的知识领域频次向量;主口径将专利范围限定在发明专利,与原始方法检索发明专利的处理一致。采用五年滚动窗口而非当年数据,是因为企业的知识基础是长期研发积累的结果,单一年度的专利产出波动较大,难以稳定刻画其技术构成;一件专利若同时载有多个分类号,则同时计入多个知识领域,因而该向量反映的是知识活动在技术空间上的分布强度,而非简单的专利计数。 研发合作伙伴通过联合申请专利来识别。当一项专利由两个及以上申请人共同提出时,除焦点企业自身之外的申请人即构成其合作对象;其中仅保留企业类申请人,权利人为高校、科研院所及个人的部分不计入,以使测度对象限定在企业间的研发合作上。在此基础上,本数据集进一步剔除属于焦点企业集团自身的主体,包括上市公司本体、其母公司、子公司、受同一母公司控制的其他企业,以及联营与合营企业;名称层面还对以集团主体全名为前缀的分支机构(如各类分公司、分厂、事业部)做归并处理。这一步是必要的:集团内部单位的技术领域天然高度重合,若将其计为合作伙伴,指标会向取值上限集中而丧失区分能力,也与"合作伙伴选择"这一构念相悖。合作伙伴的知识领域向量并不只取双方的合作专利,而是检索这些伙伴在同一窗口内申请的全部专利后汇总得到,并且按照"将所有合作伙伴看作一个整体"的处理方式,把同一焦点企业的全部伙伴合并为一个向量。 设 $p{ik}$ 为焦点企业 $i$ 在窗口内申请专利中第 $k$ 类知识领域出现的次数,$p{jk}$ 为其全部合作伙伴在同一窗口内的对应次数,$n$ 为知识领域总数,则知识相关性定义为两个频次向量的余弦相似度: $$KR{i,j}=\frac{\sum{k=1}^{n}p{ik}\,p{jk}}{\sqrt{\sum{k=1}^{n}p{ik}^{2}\cdot\sum{k=1}^{n}p{jk}^{2}}}$$ 该式取值介于 0 与 1 之间:取 0 表示双方知识领域完全不相关,即在任何一个技术小类上都没有共同布局;取值越接近 1,表明双方的知识领域构成越相近。由于余弦相似度只取决于向量的方向而与其长度无关,无论把各知识领域的次数按该主体的知识领域总数折算为占比,还是直接使用原始次数,所得结果完全相同,因此该测度不受双方专利规模差异的机械影响。 除主口径外,数据集提供三个稳健性口径,公式完全一致,仅改变一处输入。含实用新型口径将专利范围由发明专利放宽至发明专利与实用新型专利合计;含集团内部协同口径不剔除集团自身主体,对应仅检索上市公司本体专利时的处理方式;剔除双方共有专利口径则在合作伙伴一侧的向量中扣除双方共同申请专利所贡献的次数,用于检验知识相关性是否由合作专利本身驱动。伴随核心指标一并给出的,还有研发合作伙伴数量、双方各自在窗口内的专利件数与所覆盖的知识领域数,这些既是上述公式的计算构件,也可用于刻画合作广度与知识基础宽度。为使口径自洽,合作伙伴的识别范围与知识相关性的专利范围保持一致:主口径下只用发明专利的联合申请记录识别伙伴,含实用新型口径下则相应放宽。 补充说明 - 样本口径:本数据集覆盖全行业、全板块与全部可得年份,行域为窗口内至少存在一个外部企业合作伙伴的企业年。未进入本表的企业年意味着窗口内没有可识别的合作专利,属于结构性缺失而非数值缺失,不宜简单补零;使用时建议加入行业与年份固定效应。表中含上市前年度的观测(企业的专利活动可能早于上市),与财务数据合并时会自然滤除。 - 集团边界的识别限度:集团主体名单来自企业披露的关联方与子公司信息,无法穷尽全部同系统单位。少数伙伴数量极多的大型集团(以工程建设类为主)其"外部伙伴"中仍可能混有未被披露覆盖的同系统单位,使指标偏向取值上限;这类观测占比很低,可按合作伙伴数量设上限或加入规模控制做稳健性检验。 - 伙伴专利的检索范围:合作伙伴的专利组合以其作为首位申请人的记录为主,并已将双方共同申请的专利补回伙伴一侧;伙伴作为非首位申请人的其他专利不计入,会使伙伴向量的绝对规模偏小,但由于余弦相似度只取决于向量方向,对该缺口相对不敏感。少数伙伴(境外主体、更名或简称披露者)检索不到专利记录,其知识领域不进入合并向量。 - 共有专利的处理:按原始方法,双方共同申请的专利同时进入两侧向量。当某些企业年的合作伙伴在窗口内除双方合作专利外没有其他可检索专利时,指标会趋于反映合作专利本身;剔除双方共有专利口径正是为此提供的对照,其无定义的观测即对应这一情形,该缺失本身是有信息的标记。 - 各口径的适用性:含集团内部协同口径主要反映集团内部的技术同构,取值高度向上限集中,宜作为与原始方法对标的参照而非主回归变量。伙伴专利组合过薄时(如伙伴仅有个别专利),指标更多反映检索完整度而非知识距离,可按伙伴专利件数或知识领域数设最小门槛做稳健性检验。 - 其他局限:专利存在公开滞后,窗口末端年份的专利件数偏低,但因指标使用滞后五年窗口,该影响大部分已被窗口自身吸收。指标的变异以企业间差异为主,五年滚动窗口使同一企业的序列高度自相关,在企业固定效应设定下可用变异会明显减少。 参考文献 - 刘凤朝,罗蕾,张淑慧.知识属性、知识关系与研发合作企业创新绩效[J].科研管理,2021,42(11):155-163. - SUBRAMANIAN A M, BO W, KAH-HIN C. The role of knowledge base homogeneity in learning from strategic alliances[J]. Research Policy, 2018, 47(1): 158-168.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。