研发合作伙伴知识多样性
「研发合作伙伴知识多样性」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 85,000。 参考刘凤朝等 (2021, 科研管理)的方法,度量焦点企业外部研发合作伙伴群体整体的技术领域分散程度。
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 21 |
| 样本量 | 85,000 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 观测年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- KDStatus [指标状态] — 研发合作伙伴知识多样性的取值状态,用于区分指标为空的不同成因:Computed表示已算出;PartnerUnmatched表示存在企业类合作伙伴但其专利组合未能匹配到;AcademicOnly表示窗口内仅有大学或科研院所类伙伴、无企业类伙伴;NoPartner表示窗口内没有外部合作伙伴。指标为空不等同于取值为零,不可直接填充为零。
- PartnerFirmCount [合作伙伴企业数] — 前五年间与该公司联合申请过专利的外部企业数量,计算公式为:统计第t-5年至第t-1年间与该公司共同作为专利申请人、且不属于该公司集团体系的企业类主体的去重个数。取值为0表示该公司在该窗口内没有企业类研发合作伙伴。
- PartnerMatchedCount [实际计入伙伴数] — 上述合作伙伴中专利组合可获取、真正进入知识多样性计算的企业数量,计算公式为:统计合作伙伴中能在专利库中匹配到其自身专利记录的去重个数。该值与合作伙伴企业数之差,即因名称变更或简称等原因未能匹配而未计入的伙伴数量。
- PartnerPatentCount [合作伙伴专利总数] — 上述合作伙伴自身在前五年间申请的专利总数,计算公式为:合作伙伴集合中各企业于第t-5年至第t-1年申请的专利记录去重计数,即知识多样性公式中的分母。
- PartnerFieldCount [合作伙伴知识领域数] — 合作伙伴专利组合覆盖的知识领域数量,计算公式为:对合作伙伴前五年申请专利的国际专利分类主分类号取前四位(即国际专利分类子类)后统计其去重个数。
- PartnerKnowledgeHHI [合作伙伴知识领域赫芬达尔指数] — 参考刘凤朝等 (2021, 科研管理)的方法,衡量合作伙伴研发活动在各知识领域间的集中程度,计算公式为:∑(Pk/P)²,其中Pk为合作伙伴前五年申请专利中主分类落在第k个知识领域的专利数,P为合作伙伴前五年申请专利总数。数值越大表示合作伙伴的研发越集中于少数技术领域。
- KD [研发合作伙伴知识多样性] — 参考刘凤朝等 (2021, 科研管理)的方法,将焦点企业前五年的外部研发合作伙伴视为一个整体,以其专利知识领域分布的赫芬达尔指数的补数衡量知识多样性,计算公式为:1-∑(Pk/P)²,其中Pk为合作伙伴前五年申请专利中主分类落在第k个知识领域的专利数,P为合作伙伴前五年申请专利总数,知识领域按国际专利分类主分类号前四位划分。取值为0表示合作伙伴的研发集中在单一知识领域。用作研究变量,越大代表合作伙伴整体的知识领域越分散、焦点企业可接触与识别的外部知识范围越广。
- KD_AllIPC [知识多样性(全分类口径)] — 参考刘凤朝等 (2021, 科研管理)的方法,计算的知识多样性稳健性口径,计算公式为:1-∑(Pk/P)²,与主口径的差异在于每条专利在其涉及的全部国际专利分类子类中各计一次,而非仅计主分类。用于检验知识领域计数方式对结果的影响。
- KD_Frac [知识多样性(分数计数口径)] — 参考刘凤朝等 (2021, 科研管理)的方法,计算的知识多样性稳健性口径,计算公式为:1-∑(Pk/P)²,与主口径的差异在于每条专利的权重按其涉及的国际专利分类子类个数均分,使跨领域专利在各领域间分摊计入。用于检验知识领域计数方式对结果的影响。
- KD_InclAcad [知识多样性(含产学研口径)] — 参考刘凤朝等 (2021, 科研管理)的方法,计算的知识多样性稳健性口径,计算公式为:1-∑(Pk/P)²,与主口径的差异在于合作伙伴范围由仅企业扩展至同时包含大学与科研院所。用于检验合作伙伴类型限定对结果的影响。
常见问题
- 「研发合作伙伴知识多样性」是什么数据集?
- 研发合作伙伴知识多样性,隶属创新与知识产权。参考刘凤朝等 (2021, 科研管理)的方法,度量焦点企业外部研发合作伙伴群体整体的技术领域分散程度。
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 21 个变量。核心指标包括:指标状态、合作伙伴企业数、实际计入伙伴数、合作伙伴专利总数、合作伙伴知识领域数、合作伙伴知识领域赫芬达尔指数、研发合作伙伴知识多样性、知识多样性(全分类口径)、知识多样性(分数计数口径)、知识多样性(含产学研口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 85,000 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业在资源与能力受限时,往往通过研发合作从外部获取自身缺乏的技术知识。合作伙伴所掌握知识的属性,决定了焦点企业在知识共享过程中能够接触到的知识范围。刘凤朝等 (2021) 将研发合作视为企业间知识共享的过程,并把它划分为知识访问与知识整合两个阶段:在知识访问阶段,焦点企业接触合作伙伴广泛的知识领域、识别并获取所需知识;合作伙伴整体的知识领域越分散,焦点企业可供选择的合作领域与方向越多,越容易了解潜在的知识需求,从而为进一步整合新领域知识、提高自身知识多元化程度提供可能。本数据集据此刻画焦点企业外部研发合作伙伴群体整体的技术领域分散程度。 合作伙伴的识别以联合申请专利为依据。对焦点企业及其集团体系内实体在观测年度前五年间申请的专利,逐条解析其全部专利申请人,再从中剔除属于焦点企业集团体系的主体,余下的外部主体即为该窗口内的研发合作伙伴。体系内主体的名单由两部分构成:专利资料所载的该公司关联实体,以及关联方与控制人资料所载的母公司、子公司、控股股东与实际控制人;剔除时同时采用名称完全一致与名称词干前缀两条规则,词干指剥去末尾公司组织形式后的部分,用以捕捉「某某集团某某分公司」这类同集团分支机构。遵循原文口径,最后仅保留企业类合作伙伴,剔除大学、科研院所、个人以及政府与事业单位。 知识领域以国际专利分类号刻画。将上述合作伙伴视为一个整体,收集其自身在同一五年窗口内申请的全部专利,取每条专利主分类号的前四位(即国际专利分类子类,如 $A61K$)作为该专利所属的知识领域。设 $Pk$ 为合作伙伴专利中归属第 $k$ 个知识领域的专利数,$P$ 为合作伙伴专利总数,则 $Pk/P$ 为第 $k$ 个知识领域的专利占比,且 $\sumk Pk = P$。 知识多样性以知识领域分布的赫芬达尔指数的补数度量: $$KD{i,t} = 1 - \sum{k=1}^{n}\left(\frac{Pk}{P}\right)^{2}$$ 其中 $n$ 为合作伙伴专利覆盖的知识领域总数。$KD$ 取值为 0 表示合作伙伴的研发完全集中在单一知识领域;取值越大,表示合作伙伴整体的知识领域越分散,焦点企业可接触与识别的外部知识范围越广。相应地,赫芬达尔指数本身 $\sumk (Pk/P)^{2}$ 作为集中度度量一并给出,它与知识多样性之和恒为 1。 数据集同时给出若干用于判读与控制的辅助列:合作伙伴企业数为窗口内识别到的外部企业伙伴数量,实际计入伙伴数为其中专利组合可得、真正进入计算的数量,二者之差即因名称未能匹配而被丢弃的部分;合作伙伴专利总数与知识领域数分别是上式的分母与求和项数。此外单列指标状态一列,取值分别对应已算出、有企业伙伴但其专利未能匹配、窗口内仅有产学研伙伴、以及窗口内没有外部合作伙伴四种情形——多样性为空并不等同于取值为零,合作伙伴企业数与指标状态才是有无研发合作的判据。 围绕两处口径选择提供稳健性度量。其一是知识领域的计数方式:核心口径下每条专利仅按其主分类号归入一个知识领域,另给出两个替代口径——全分类口径令每条专利在其涉及的全部国际专利分类子类中各计一次,分数计数口径则令每条专利的权重按其涉及的子类个数均分,使跨领域专利在各领域间分摊计入。其二是合作伙伴的类型范围:核心口径遵循原文仅保留企业类伙伴,另给出将大学与科研院所一并纳入的口径。 补充说明 - 计数口径的选择:原文以"提取每条专利分类号的前四位"表征知识领域,同时将 $Pk/P$ 表述为"占专利总数的比例"。只有当每条专利归属单一领域时 $\sumk Pk = P$ 才成立,故核心口径按主分类归类;两个替代计数口径作为稳健性度量同时提供,使用者可依研究需要选用。 - 指标随伙伴组合规模上升:赫芬达尔指数的取值随分母专利数系统性上升,伙伴专利数很少时多样性会机械地趋近于 0,专利数为 1 时恒为 0,此时该值反映的是伙伴专利稀疏而非其研发确实集中于单一领域。因此本指标在时间上的抬升很大程度上跟随伙伴专利组合规模的扩大,不宜直接解读为研发合作网络的扩张。建议在回归中同时控制合作伙伴专利总数的对数,并可据该列设定最低专利数门槛做稳健性检验;原文同样未设此类门槛。 - 集团内部协作的识别边界:原文未对集团内实体作专门处理,本数据集按上述名单法剔除。该方法对简称与全称写法不一致的分支机构、以及控股股东上级集团下属的兄弟单位仍然无效,大型企业集团的伙伴池因此可能仍包含体系内单位、其多样性相应偏高;合作伙伴专利总数异常大的企业年多属此类,使用者可据该列识别并单独处理。 - 覆盖与缺失:合作伙伴名称经标准化后与专利库申请人名称精确匹配,名称变更、使用简称或境外注册的伙伴可能无法匹配,其专利组合不计入。指标只对窗口内存在可匹配企业伙伴的企业年有定义,可用样本偏向规模较大的企业、国有企业以及电力、采矿、建筑等行业,完整案例分析会把结论限制在这一范围,必要时可配合样本选择校正。 - 样本口径:本数据集不预先施加原文的行业与区间限制,覆盖全行业全板块及全部可得年份,使用者可按行业代码与年份自行筛选。输出行以专利活动年为准,含企业上市之前的年份与少量非主板主体,需要严格的上市公司面板时应按上市日期自行筛选。建议在回归中加入行业与年份固定效应。 - 其他局限:伙伴自身的专利按其作为第一申请人的记录归集,伙伴作为非第一申请人参与的专利不计入其组合;伙伴专利中包含与焦点企业共同申请的部分,该部分知识由双方共创,原文亦未剔除。专利自申请至公开存在法定滞后,临近观测期末的申请年专利收录相对不完整;少量专利缺少主分类号,相应企业年的核心口径无值而替代计数口径仍可得。 参考文献 - 刘凤朝,罗蕾,张淑慧.知识属性、知识关系与研发合作企业创新绩效[J].科研管理,2021,42(11):155-163.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。