企业知识距离(与合作伙伴技术距离)
「企业知识距离(与合作伙伴技术距离)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 24 个变量,样本量约 96,328。 参考于飞等(2021,科研管理)的方法测度企业与其研发合作伙伴之间的知识距离。
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 24 |
| 样本量 | 96,328 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 观测年份,专利按申请年度归年
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PartnerCount [合作伙伴数量] — 参考于飞等(2021,科研管理)的方法,知识距离计算公式中的合作伙伴个数N,计算公式为:三年窗口内与本公司联合申请过专利、且自身在该窗口内有可检索专利的外部企业去重计数。合作伙伴取联合申请专利的申请人中除本公司集团自身主体(母公司、子公司、同一母公司控制的其他企业、联营与合营企业)之外的企业类申请人,不含高校与科研院所。窗口内无此类合作伙伴时取0。三年窗口指观测年份前三年(t-3至t-1)
- FocalPatentCount3Y [本公司三年窗口专利数] — 技术领域份额计算公式中的分母N_i,计算公式为:本公司在三年窗口内申请且载有合法国际专利分类号的专利件数。该列对全部企业年度可得,与是否存在合作伙伴无关,可用于区分窗口内无专利与有专利但无合作伙伴两种情形。三年窗口指观测年份前三年(t-3至t-1)
- PartnerPatentCount3Y [合作伙伴三年窗口专利数] — 计算公式为:全部合作伙伴各自在三年窗口内申请且载有合法国际专利分类号的专利件数之和。合作伙伴的专利组合从全量中国专利库按其名称检索获得,并补回与本公司共同申请的专利。数值越小表示伙伴侧的技术份额向量越单薄,建议据此设置最小门槛做稳健性检验。三年窗口指观测年份前三年(t-3至t-1)
- FocalTechFieldCount [本公司技术大类数] — 计算公式为:本公司三年窗口内全部专利所涉及的国际专利分类三位大类去重计数。一件专利跨多个大类时各大类均计入。该列对全部企业年度可得,与是否存在合作伙伴无关。三年窗口指观测年份前三年(t-3至t-1)
- PartnerJointPatentShare [合作伙伴组合中共同申请专利占比] — 计算公式为:对每个合作伙伴j,计算其三年窗口内与本公司共同申请且载有合法国际专利分类号的专利件数占该伙伴同窗口专利总件数的比例,再对全部合作伙伴取算术平均,取值0到1。该列用于识别测度退化的观测:取值为1时,合作伙伴的技术领域份额向量完全由双方的合作专利构成,此时知识距离度量的不再是两家企业知识基础的差异,而是本公司自身技术组合与这次合作专利所属技术领域之间的距离。数值越大该观测的知识距离越不含合作伙伴自身信息,建议据此筛除或做稳健性检验。三年窗口指观测年份前三年(t-3至t-1)
- FocalTechConcentration [本公司技术份额平方和] — 参考于飞等(2021,科研管理)的方法,知识距离代数展开式的第一项,计算公式为:sum_k f_ik^2,其中f_ik为本公司三年窗口内涉及技术领域k的专利件数占同窗口专利总件数的比例。数值越大表示本公司技术越集中于少数领域。该列对全部窗口内有专利的企业年度可得,与是否存在合作伙伴无关。三年窗口指观测年份前三年(t-3至t-1)
- PartnerTechConcentration [合作伙伴技术份额平方和均值] — 参考于飞等(2021,科研管理)的方法,知识距离代数展开式的第二项,计算公式为:各合作伙伴自身技术份额平方和sum_k f_jk^2对全部合作伙伴取算术平均。数值越大表示合作伙伴各自的技术越集中于少数领域。三年窗口指观测年份前三年(t-3至t-1)
- FocalPartnerOverlap [双方技术份额内积均值] — 参考于飞等(2021,科研管理)的方法,知识距离代数展开式的第三项,计算公式为:本公司与各合作伙伴技术份额向量的内积sum_k f_ik*f_jk对全部合作伙伴取算术平均。数值越大表示双方涉足的技术领域重叠越多。三年窗口指观测年份前三年(t-3至t-1)
- KnowledgeDistance [知识距离] — 参考于飞等(2021,科研管理)的方法,计算公式为:先对每个合作伙伴j计算技术距离d_ijt=sum_k (f_ik-f_jk)^2,再对全部N个合作伙伴取算术平均KD_it=(1/N)*sum_j d_ijt。其中f_ik(f_jk)为本公司(合作伙伴j)三年窗口内涉及技术领域k的专利件数占同窗口专利总件数的比例,技术领域取国际专利分类三位大类,一件专利跨多个大类时各大类均计入。用作研究变量,越大代表企业与其合作伙伴的技术领域差异越大、所嵌入的属高知识距离联盟,越小代表技术领域重叠越多、属低知识距离联盟。该列等于本公司技术份额平方和加合作伙伴技术份额平方和均值减去双方技术份额内积均值的两倍。三年窗口指观测年份前三年(t-3至t-1)
- KnowledgeDistanceSubclass [知识距离(小类粒度)] — 参考于飞等(2021,科研管理)的方法,知识距离的稳健性口径,计算公式与主口径完全相同,仅把技术领域的划分粒度由国际专利分类三位大类改为四位小类。用于检验结论对技术领域划分粗细的敏感性。三年窗口指观测年份前三年(t-3至t-1)
- KnowledgeDistanceUnique [知识距离(单归属)] — 参考于飞等(2021,科研管理)的方法,知识距离的稳健性口径,计算公式与主口径完全相同,仅把一件专利的技术领域归属由涉及的全部大类各计一次改为只归入主分类号所属的一个大类,使各主体的技术领域份额之和恒等于1、距离取值回到0至2区间。主分类号缺失或不合法时回退到该专利全部合法分类号中字典序在前者。用于检验结论对专利分类标注深度的敏感性。三年窗口指观测年份前三年(t-3至t-1)
- KnowledgeDistanceEuclid [知识距离(开方欧氏距离)] — 参考于飞等(2021,科研管理)的方法,知识距离的稳健性口径,计算公式为:先对每个合作伙伴取技术距离的算术平方根sqrt(d_ijt),再对全部合作伙伴取算术平均。原文正文表述为欧几里得距离而所给公式为未开方的平方和,两者不等价且不能互相换算,主口径依原文公式不开方,本列提供符合欧几里得距离字面含义的版本。三年窗口指观测年份前三年(t-3至t-1)
- KnowledgeDistanceInvention [知识距离(仅发明专利)] — 参考于飞等(2021,科研管理)的方法,知识距离的稳健性口径,计算公式与主口径完全相同,仅把专利范围由全部专利(发明专利与实用新型)限定为发明专利,合作伙伴的识别同步限定在发明专利的联合申请记录上,以避免出现记为有合作伙伴但其发明专利为零的空转观测。三年窗口指观测年份前三年(t-3至t-1)
常见问题
- 「企业知识距离(与合作伙伴技术距离)」是什么数据集?
- 企业知识距离(与合作伙伴技术距离),隶属创新与知识产权。参考于飞等(2021,科研管理)的方法测度企业与其研发合作伙伴之间的知识距离。
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 24 个变量。核心指标包括:合作伙伴数量、本公司三年窗口专利数、合作伙伴三年窗口专利数、本公司技术大类数、合作伙伴组合中共同申请专利占比、本公司技术份额平方和、合作伙伴技术份额平方和均值、双方技术份额内积均值、知识距离、知识距离(小类粒度)、知识距离(单归属)、知识距离(开方欧氏距离)、知识距离(仅发明专利)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,328 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识距离刻画的是知识发送方与知识接收方之间知识基础的差异程度。企业开展创新往往需要越出自身既有的技术积累,从合作对象那里获取外部知识;合作各方的技术领域越接近,彼此对所交换知识的编码与吸收成本越低,但可获得的异质性知识也越有限;技术领域差异越大,可获得的异质性知识越丰富,跨组织的知识转移障碍与知识过载风险也随之上升。因此,企业所嵌入的合作关系究竟属于"低知识距离"还是"高知识距离",是理解其创新知识配置的一个基础维度。本数据集按照这一构念,测度焦点企业与其研发合作对象之间的技术领域差异。 测度的起点是把每个主体的技术构成表达为一个份额向量。以国际专利分类号标识技术领域,取分类号的三位大类作为领域单位。对主体 $i$,在观测年 $t$ 之前的三年窗口($t-3$ 至 $t-1$)内统计其申请的专利:设 $Ni$ 为该窗口内申请且载有合法分类号的专利件数,$n{ik}$ 为其中分类号涉及技术领域 $k$ 的专利件数,则该主体在领域 $k$ 上的份额为 $$f{ik} = \frac{n{ik}}{Ni}$$ 一件专利常同时载有跨若干领域的分类号,按上式的定义它会在所涉及的每个领域各计入一次(同一领域在同一件专利内只计一次),因此份额之和不小于 1,其数值等于每件专利平均涉及的领域数。这是原始定义"某领域专利数占专利总数的比例"的直接结果,本数据集予以保留,并另行提供单归属口径(一件专利只归入其主分类号所属领域,份额之和恒为 1)以供对照。 焦点企业 $i$ 与某一个合作对象 $j$ 之间的技术距离,定义为两个份额向量的逐领域差的平方和: $$d{ijt} = \sumk (f{ik} - f{jk})^2$$ 企业当年的知识距离,则是它与全部 $N$ 个合作对象之间技术距离的算术平均: $$KD{it} = \frac{1}{N}\sum{j=1}^{N} d{ijt}$$ 此处的 $N$ 只计窗口内自身有可检索专利的合作对象。某合作对象若在窗口内没有任何可检索的专利,其份额向量无定义;以零向量代入会使该对的距离退化为只由焦点企业自身技术集中度决定的量,与这位合作对象的技术构成无关,故不计入分母。代价是输出的合作伙伴数会小于该企业实际的联合申请对象数,差额主要是仅有一两件合作专利、自身无其他专利可检索的小微主体。 上式可以精确地展开为三个具有独立经济含义的部分: $$KD{it} = \underbrace{\sumk f{ik}^2}{\text{焦点企业技术集中度}} + \underbrace{\frac{1}{N}\sum{j}\sumk f{jk}^2}{\text{合作伙伴技术集中度均值}} - 2\underbrace{\frac{1}{N}\sum{j}\sumk f{ik}f{jk}}{\text{双方技术份额内积均值}}$$ 三个部分均作为独立字段输出。它们回答的是同一个问题的不同侧面:一家企业的知识距离之所以偏大,可能是因为它自身的技术高度集中于少数领域,可能是因为它的合作对象各自高度集中,也可能是因为双方涉足的领域几乎不重叠。三者与知识距离之间是代数恒等关系,使用者可据此拆解指标的来源,也可用于在回归中分离规模性成分与结构性成分。 合作对象通过联合申请专利识别:一件专利的申请人中,除焦点企业集团自身主体(本体、母公司、子公司、受同一母公司控制的兄弟公司、联营与合营企业)之外的企业类申请人,即视为该窗口内的研发合作对象。集团自身主体的名单由专利记录中已匹配的集团实体、子公司与联营合营企业信息、关联方信息等多个来源合并而成;归并时除精确匹配外,还剥离分支机构后缀与法定组织形式后缀后比对,使"某某有限公司"与"某某股份有限公司"这类改制前后的同一主体能够识别为一体,避免企业把改制前的自己计为外部合作对象。企业类申请人的判定以法定组织形式为先:带有限公司、股份公司等组织形式的判为企业法人,即使其名称中含研究院、技术中心等字样——这类公司制研发主体在法律上是企业;无法定组织形式者再按名称特征判定,并排除事业单位性质的科研院所。高校及其关联主体一律不计入。 合作对象自身的技术份额向量并不只用双方的合作专利构成,而是从全量中国专利库中按其名称检索其在同一窗口内的全部专利组合;由于该库对每件专利只登记一个申请人名,双方共同申请的专利通常登记在焦点企业名下,故另从专利申请人明细中把这部分专利补回合作对象名下,避免其向量被系统性低估。对每个合作对象另计算其组合中由双方合作专利构成的比例,按合作对象取平均后作为独立字段输出,用于识别测度退化的观测。 除主口径外,另提供四个稳健口径,均与主口径同公式、同窗口、同样本,仅在单一维度上替换:技术领域粒度由三位大类改为四位小类;专利的领域归属由多归属改为单归属;距离由平方和改为先对每个合作对象取平方根再平均(对应"欧几里得距离"的字面读法,与未开方的定义不能互相换算);以及把专利范围限定为发明专利,此时合作对象的识别亦同步限定在发明专利的联合申请记录上,以避免出现"记为有合作对象但其发明专利为零"的空转观测。 补充说明 - 样本口径:覆盖全部板块、全部行业与全部可得年份,不预先施加任何回归样本限制,使用者可按行业代码与年份自行截取。 - 两侧主体的聚合层级不同(使用前必读):焦点企业侧是集团口径(合并本体、子公司与联营合营),合作对象侧只能按单一法人名检索,拿不到对方的集团全貌。以同时出现在两侧的同一批上市公司作对照,同一家公司在合作对象口径下的技术份额平方和明显更高、覆盖的技术领域数明显更少。由于合作对象侧的份额平方和是距离展开式中的主导正项,本指标会系统性高于双方均按集团口径时的水平,偏高幅度取决于该合作对象的单一法人占其真实集团的比重这一与研究问题无关的量;归一化不能消除该差异,因为它源于聚合层级而非量纲。故本指标的绝对水平不宜作实质解释,也不宜与按其他口径构造的知识距离作数值比较,只适合在同一口径内部作横截面比较。 - 截面变异的主导来源(必须处理):按合作对象的窗口专利件数分箱,本指标的组均值随件数单调下降,最薄一档约为最厚一档的两倍;行业与年度双向去均值后,它与合作对象专利件数对数呈明显负偏相关,而与焦点企业专利件数对数的偏相关很弱,行业间排序亦由此驱动。施加合作伙伴专利数的最小门槛会同时明显降低均值与标准差并损失约三成观测。使用者须报告所用门槛及其敏感性,否则识别到的可能是"合作对象是不是小主体"的效应。 - 测度退化的观测:相当一部分合作对象的专利组合完全由双方的合作专利构成,此时其份额向量是焦点企业份额向量的确定性函数,距离度量的不再是两家企业知识基础的差异,而是本企业自身组合与这次合作专利所属技术领域之间的距离;取值分布两端的极端观测多出自此。输出中的合作伙伴组合共同申请专利占比一列可用于识别并筛除。 - 年度变异不可用于识别:主口径与单归属口径的年度均值序列在近年方向相反,主口径与每件专利平均分类号数的年度序列同向变动而单归属口径与之无关,早期年份的水平则受合作专利收录完整度影响。带年度固定效应必要但不充分,任何以年度变化为识别来源的设计(双重差分、事件研究等)都会随口径选择而翻转结论。 - 缺失与可用变异:无合作对象的企业年,距离列为空值而非零;其中"窗口内无专利"与"有专利但无外部合作专利"两种情形经济含义不同,可由焦点企业专利数一列区分,研究合作行为本身者应把后者视为有信息的零。非缺失率随企业专利规模单调上升、在专利密集行业远高于租赁商务与房地产等行业,且本指标本身也随规模上升——缺失与取值相关,不属可忽略缺失,直接回归会收敛到有合作专利的子样本,以小规模公司为主的设计不适用。面板可用变异亦有限:组内方差约占总方差的一半,相邻年份自相关较高(三年窗口重叠所致),加企业固定效应后可用变异显著减少,标准误应在企业层聚类。 - 合作关系与企业归属:本指标以联合申请专利界定合作对象,捕捉的是已产生专利产出的研发合作;不产出专利的合作形式不在其中,合作起止只能由申请年份间接观测,指标因而更偏技术型合作、双方技术领域天然较近。高校与科研院所不计入。专利与上市公司的对应关系由名称匹配建立并按当前股权结构回溯至全部历史年份,故相当一部分有效观测早于上市年,那些年份的"集团自身"判定在经济上不成立,建议以 keep if Year = 上市年 筛选(退市侧无此问题)。集团主体名单无法穷尽全部关联主体,残留的内部主体会使距离偏低,大型集团尤甚;同一件专利可能同时归属多家上市公司,其中含名称匹配误判。 - 其他局限:份额向量的量纲随专利分类标注深度变动,单归属口径不受此影响。专利自申请到公开有法定滞后,窗口末端的合作关系尚未完全公开,使最近年份的合作对象集合偏小。仅发明专利口径并非同样本稳健性检验——合作只发生在实用新型上的企业年会被整体剔除,系数变化中混有样本变化,须同报样本量;其余稳健口径与主口径同样本。 - 与原文描述统计的对照:本指标在任何口径下都无法同时匹配原文报告的均值与标准差,且分布形状亦不同——原文的标准差与均值之比远高于本数据集,意味着原文中大量观测贴近零而少数极大,本数据集则接近对称。在份额归一的读法下该定义有界于零到二之间,而原文报告的标准差超出了该区间上由均值决定的方差上界,两者不具数值可比性。差异来源包括合作对象界定不同(原文取自已宣告的战略联盟与合资协议数据库)与前述聚合层级不同,前者使本指标偏低、后者使其偏高。原文未公布样本名单,差异无法进一步归因。故本指标的回归系数不可与原文系数作数量级比较,只宜比较符号与显著性;需与原文对标时宜采用单归属口径。 参考文献 本数据集的公式与口径取自 [1] 的正文 1.3.2(2) 节; [2] 是 [1] 在该节标注的方法出处, 列出以便追溯方法源流, 本数据集并未另行套用该篇的原文公式。 [1]于飞,袁胜军,胡泽民.知识基础、知识距离对企业绿色创新影响研究[J].科研管理,2021,42(1):100-112. [2]Nambisan S. Industry technical committees, technological distance, and innovation performance[J]. Research Policy, 2013, 42(4): 928-940.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。