企业知识耦合

「企业知识耦合」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 33 个变量,样本量约 71,565。 参考于飞等(2019,南开管理评论)的方法测度企业知识耦合的动态变化。

时间跨度1990-2025 年
数据频率年度
层级上市公司
变量数33
样本量71,565
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票简称] — 该年度对应的股票简称
  • Year [年份] — 年份
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地所在省份的行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地所在城市的行政区划代码
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地所在区县的行政区划代码
  • IndustryCode [行业代码] — 该年度对应的中国上市公司协会行业分类代码
  • IndustryName [行业名称] — 该年度对应的中国上市公司协会行业分类名称
  • NPatentT1 [前期专利数] — 参考于飞等(2019,南开管理评论)的方法,前一考察期(第t-5至t-3年)企业申请的专利数量(含发明专利与实用新型),用作知识耦合加权计算中各技术领域专利份额的分母
  • NPatentT2 [后期专利数] — 参考于飞等(2019,南开管理评论)的方法,后一考察期(第t-2至t年)企业申请的专利数量(含发明专利与实用新型),用作知识耦合加权计算中各技术领域专利份额的分母
  • NTechFieldT1 [前期技术领域数] — 参考于飞等(2019,南开管理评论)的方法,第t-5至t-3年企业专利涉及的不同技术领域数量,技术领域以国际专利分类号前4位(小类)界定
  • NTechFieldT2 [后期技术领域数] — 参考于飞等(2019,南开管理评论)的方法,第t-2至t年企业专利涉及的不同技术领域数量,技术领域以国际专利分类号前4位(小类)界定
  • NNewTechField [新增技术领域数] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:第t-2至t年出现、且第t-5至t-3年未曾涉及的技术领域数量,技术领域以国际专利分类号前4位(小类)界定
  • NSigCoupling [显著变化耦合对数] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:企业内两两技术领域的加权知识耦合值在前后两个考察期所处分位区间发生改变的技术领域对数量,即知识耦合动态变化求和式中的项数
  • KDNewPair [新领域间耦合变化量] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:两端均为新增技术领域的技术领域对中,发生显著变化者在两个考察期知识耦合值之差的绝对值之和。原文将其单列为一类并出于简化研究的考虑未纳入两个核心自变量,本字段即知识耦合动态变化总量与两个核心自变量之差,单独给出以保持分解的完整性
  • CEKD [原有技术领域间的知识耦合] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:两端均为原有技术领域(前一考察期已涉及)的技术领域对中,发生显著变化者在两个考察期知识耦合值之差的绝对值之和;单项耦合按两两技术领域的杰卡德系数计算,即同时包含两个技术领域的专利数除以包含其中任一技术领域的专利数,仅对加权耦合值跨越分位区间者计入求和。两个考察期均无专利的企业年取0而非缺失,实证建议限定两期专利数均为正的样本;该指标为未归一化求和,与企业技术领域数量正相关,回归时建议一并控制知识基础规模并加入年度固定效应。用作研究变量,越大代表企业围绕既有知识版图进行的知识重组幅度越大
  • CNEKD [新旧技术领域间的知识耦合] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:一端为新增技术领域、另一端为原有技术领域的技术领域对中,发生显著变化者在两个考察期知识耦合值之差的绝对值之和。两个考察期均无专利的企业年取0而非缺失,仅前期有专利的企业年因新增技术领域集合为空而结构性取0,实证建议限定两期专利数均为正的样本并加入年度固定效应。用作研究变量,越大代表企业将新进入技术领域的知识与原有知识基础整合的程度越高
  • CKD [知识耦合动态变化总量] — 参考于飞等(2019,南开管理评论)的方法,计算公式为:企业内全部发生显著变化的技术领域对在两个考察期知识耦合值之差的绝对值之和。原文先定义该总量,再从中取出原有技术领域间与新旧技术领域间两类作为自变量,故本字段等于两个核心自变量与新领域间耦合变化量三者之和。用作研究变量,越大代表企业知识基础在两个考察期之间的重构幅度越大
  • ICEKD [原有领域间耦合增强量] — 参考于飞等(2019,南开管理评论)的方法稳健性检验的分解口径,计算公式为:计入原有技术领域间知识耦合的技术领域对中,耦合程度上升者的耦合值增量之和;与耦合减弱量相加即为原有技术领域间的知识耦合
  • DCEKD [原有领域间耦合减弱量] — 参考于飞等(2019,南开管理评论)的方法稳健性检验的分解口径,计算公式为:计入原有技术领域间知识耦合的技术领域对中,耦合程度下降者的耦合值减量之和;与耦合增强量相加即为原有技术领域间的知识耦合
  • CEKD_W2 [原有领域间知识耦合_两年期] — 参考于飞等(2019,南开管理评论)的方法的时间窗口稳健性口径,计算方式与原有技术领域间的知识耦合相同,但两个考察期各取2年,即前期为第t-3至t-2年、后期为第t-1至t年
  • CNEKD_W2 [新旧领域间知识耦合_两年期] — 参考于飞等(2019,南开管理评论)的方法的时间窗口稳健性口径,计算方式与新旧技术领域间的知识耦合相同,但两个考察期各取2年,即前期为第t-3至t-2年、后期为第t-1至t年
  • CEKD_W5 [原有领域间知识耦合_五年期] — 参考于飞等(2019,南开管理评论)的方法的时间窗口稳健性口径,计算方式与原有技术领域间的知识耦合相同,但两个考察期各取5年,即前期为第t-9至t-5年、后期为第t-4至t年
  • CNEKD_W5 [新旧领域间知识耦合_五年期] — 参考于飞等(2019,南开管理评论)的方法的时间窗口稳健性口径,计算方式与新旧技术领域间的知识耦合相同,但两个考察期各取5年,即前期为第t-9至t-5年、后期为第t-4至t年
  • CEKD_T3 [原有领域间知识耦合_三分位] — 参考于飞等(2019,南开管理评论)的方法的显著性阈值稳健性口径,计算方式与原有技术领域间的知识耦合相同,但判定耦合是否发生显著变化时把加权耦合值划分为三个分位区间而非四个
  • CNEKD_T3 [新旧领域间知识耦合_三分位] — 参考于飞等(2019,南开管理评论)的方法的显著性阈值稳健性口径,计算方式与新旧技术领域间的知识耦合相同,但判定耦合是否发生显著变化时把加权耦合值划分为三个分位区间而非四个
  • CEKD_Q5 [原有领域间知识耦合_五分位] — 参考于飞等(2019,南开管理评论)的方法的显著性阈值稳健性口径,计算方式与原有技术领域间的知识耦合相同,但判定耦合是否发生显著变化时把加权耦合值划分为五个分位区间而非四个
  • CNEKD_Q5 [新旧领域间知识耦合_五分位] — 参考于飞等(2019,南开管理评论)的方法的显著性阈值稳健性口径,计算方式与新旧技术领域间的知识耦合相同,但判定耦合是否发生显著变化时把加权耦合值划分为五个分位区间而非四个
  • CEKD_Inv [原有领域间知识耦合_仅发明] — 参考于飞等(2019,南开管理评论)的方法的专利类型稳健性口径,计算方式与原有技术领域间的知识耦合相同,但构建知识耦合矩阵时专利池仅保留发明专利、不含实用新型
  • CNEKD_Inv [新旧领域间知识耦合_仅发明] — 参考于飞等(2019,南开管理评论)的方法的专利类型稳健性口径,计算方式与新旧技术领域间的知识耦合相同,但构建知识耦合矩阵时专利池仅保留发明专利、不含实用新型

常见问题

「企业知识耦合」是什么数据集?
企业知识耦合,隶属创新与知识产权。参考于飞等(2019,南开管理评论)的方法测度企业知识耦合的动态变化。
该数据集的时间范围是?
覆盖 1990-2025 年。
包含哪些变量/指标?
共 33 个变量。核心指标包括:前期专利数、后期专利数、前期技术领域数、后期技术领域数、新增技术领域数、显著变化耦合对数、新领域间耦合变化量、原有技术领域间的知识耦合、新旧技术领域间的知识耦合、知识耦合动态变化总量、原有领域间耦合增强量、原有领域间耦合减弱量、原有领域间知识耦合_两年期、新旧领域间知识耦合_两年期、原有领域间知识耦合_五年期、新旧领域间知识耦合_五年期、原有领域间知识耦合_三分位、新旧领域间知识耦合_三分位、原有领域间知识耦合_五分位、新旧领域间知识耦合_五分位、原有领域间知识耦合_仅发明、新旧领域间知识耦合_仅发明。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 71,565 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的知识基础并非静态存量,而是在不同技术领域之间持续发生渗透、联结、组合与重构。知识耦合刻画的正是这一互动过程的强度——两个或两个以上技术领域的知识元素通过不断的、动态的相互作用方式被整合的程度。相比知识宽度、知识深度等静态特征,知识耦合的价值在于它能反映知识基础在时间上的变化:企业究竟是在自己熟悉的技术领域内部反复深化,还是把搜索范围延伸到从未涉足的新领域,并将新知识与既有知识基础加以整合。这两条路径背后是不同的技术搜索策略,对创新绩效的作用机制也不相同,因而需要分别测度。 本数据集参考于飞等(2019,南开管理评论)的方法,以专利分类体系为载体刻画知识耦合及其跨期变化。 技术领域的界定。 以国际专利分类号的前四位(小类,形如 G06N)代表一类技术领域。一件专利通常同时被赋予一个以上的分类号,这些分类号共同出现在同一件专利上,即构成不同技术领域的知识元素在一次发明活动中被整合的直接证据。企业在某一考察期内全部专利的分类号集合,构成该企业在该期的知识基础。 两两技术领域的知识耦合。 对企业在考察期内涉及的任意两个技术领域 $j$ 与 $k$,其知识耦合程度由二者在专利上的共同出现程度度量: $$m{jk}=\frac{n{jk}}{n{j}+n{k}-n{jk}}$$ 其中 $n{j}$ 与 $n{k}$ 分别为该期内分类号集合包含技术领域 $j$、$k$ 的专利数量,$n{jk}$ 为同时包含二者的专利数量。该式取值介于 0 与 1 之间,分母是两个领域所涉专利的并集规模,因而在剔除领域自身规模差异后度量二者的交叠程度。企业全部技术领域两两之间的 $m{jk}$ 组成知识耦合矩阵 $M$,代表该企业当期的知识基础结构。多个技术领域之间的知识耦合可以近似看作两两技术领域之间的耦合。 两个考察期的设定。 为捕捉知识耦合的动态性,设置前后两个考察期,每期各取三年:前期为第 $t-5$ 至 $t-3$ 年,后期为第 $t-2$ 至 $t$ 年。企业在两期分别形成各自的专利池,并据此各算出一个知识耦合矩阵,跨期比较即在这两个矩阵之间进行。 加权与显著变化的判定。 知识耦合的水平与强度同企业知识基础的规模正相关。为避免规模差异干扰跨期比较,对矩阵中每个元素施加权重 $$w{jk}=\frac{p{j}+p{k}}{2}+\frac{q{j}+q{k}}{2}$$ 其中 $p{j}$ 与 $q{j}$ 分别为技术领域 $j$ 上的专利数在前期、后期企业专利总数中所占的比重,$p{k}$、$q{k}$ 同理;专利总数包含该期内的全部专利,含少数未标注分类号者。该权重同时含有两期的份额,是两期共用的单一权重,因而它只改变不同技术领域对之间的相对位置,不改变同一技术领域对在两期之间的变化方向。加权耦合值 $v{jk}=m{jk}\cdot w{jk}$ 在两期分别计算。随后把企业内两期的全部加权耦合值划分为四个分位区间;当某一技术领域对的加权耦合值在两期落入不同的分位区间时,认定该耦合达到了显著变化水平。原文枚举的三种耦合程度增强情形与三种耦合程度减弱情形,恰好穷尽了全部跨区间跃迁,因而这一判定等价于"所处分位区间发生改变"。两个领域从未共同出现时耦合值为零,归入最低的分位区间;分位点由严格为正的加权耦合值确定。 知识耦合的动态变化及其分解。 对全部发生显著变化的技术领域对,将其两期耦合值之差的绝对值加总,即得企业知识耦合的动态变化总量: $$CKD=\sum{n=1}^{S}\left|m{n,T2}-m{n,T1}\right|$$ 其中 $S$ 为发生显著变化的技术领域对数量,求和使用未加权的耦合值 $m$。 进一步按技术领域的新旧属性从 $CKD$ 中取出两个自变量。记前期已涉及的技术领域为原有技术领域,仅在后期出现、前期未曾涉及的为新技术领域。原文据此把发生显著变化的技术领域对穷举为六类:两期共有领域之间耦合的增强与减弱、两个已放弃领域之间耦合的消失、已放弃领域与存续领域之间耦合的消失,这四类的两端都是原有技术领域,合并构成原有技术领域间的知识耦合 $CEKD$;旧领域与新进入领域之间形成的耦合,恰有一端属于新技术领域,构成新旧技术领域间的知识耦合 $CNEKD$;两个新进入领域彼此之间形成的耦合自成一类,原文出于简化研究的考虑未将其纳入上述任何一个自变量。因此 $CEKD$ 与 $CNEKD$ 是 $CKD$ 中被选用的两类,二者之和小于 $CKD$,差额即新技术领域两两之间的耦合变化量,本数据集将其单独给出以保持分解的完整性。 $CEKD$ 度量企业在既有知识版图基础上进行的知识重组,涵盖原有领域间耦合关系的强化、弱化与消失;$CNEKD$ 度量企业把新进入技术领域的知识与原有知识基础加以整合的程度。前者对应在熟悉领域内深度搜索的策略,后者对应跨界搜索并回接既有知识基础的策略,两者的创新后果在文献中被证明存在方向与形态上的差异。 分解与稳健性口径。 原有技术领域间的知识耦合进一步分解为耦合程度上升的部分($ICEKD$)与下降的部分($DCEKD$),二者之和等于 $CEKD$。为考察测度对设定的敏感性,另提供三类替代口径:考察期长度由三年分别改为两年与五年;显著性判定由四分位划分改用三分位与五分位划分;专利池仅保留发明专利。 补充说明 - 推荐样本口径:输出覆盖全部 A 股上市公司的上市年至退市年(或数据末年),不预先施加行业、板块与年份限制。两个考察期均无专利的企业年按求和式的空和取零,而非记为缺失,因此零值混合了"没有专利"与"有专利但耦合未发生显著变化"两种含义,且前者占零值的大部分。实证使用时应限定两个考察期均有专利的样本(前期专利数与后期专利数同时为正),否则估计量会被"有没有专利"这一二值事实驱动。仅前期有专利的企业年其新增技术领域集合为空,新旧技术领域间的知识耦合结构性地恒为零,应按缺失处理。原文另将样本限定为制造业(或高技术产业)上市公司,使用者可按行业代码自行还原。 - 规模相关性:核心变量是未归一化的求和,求和项数随技术领域数近似按平方增长。原文以加权表达了剔除知识基础规模的意图,但加权只决定哪些耦合被判为显著、并不进入求和,因而核心变量与企业技术领域数强相关。横截面回归建议同时控制知识基础规模(如技术领域数或专利数的对数)。 - 跨年可比性:核心变量的绝对水平不宜跨年比较。除专利数量本身的增长外,单件专利携带多个分类号的比例在样本期内存在明显起伏,且这一起伏在发明专利与实用新型内部同向发生,并非专利类型构成变化所致;由于技术领域对只有在同一件专利上共同出现才进入耦合矩阵,该比例直接决定了核心变量的水位。实证必须加入年度固定效应,不宜将本指标用作时间序列趋势变量。 - 零值的规模依赖:显著性阈值是企业内部的相对分位,元素越多越必然存在跨区间的元素。技术领域数很多的企业,核心变量在测量上无法取零;技术领域数很少的企业则有相当比例取零。零值在不同规模企业之间含义不同,跨规模比较"零与非零"没有意义。 - 技术领域的识别口径:原文正文称技术领域取分类号主分类的前四位,但共同出现的计数要求同一件专利同时落在两个技术领域上,而主分类每件专利唯一。本实现采用专利的全部分类号,这是使耦合公式可计算的唯一自洽读法。 - 专利类型:主口径同时纳入发明专利与实用新型,二者均带分类号、共同构成企业的技术知识基础;纳入实用新型会提高专利池规模与领域共现密度。仅含发明专利的口径单独给出。 - 分位点的零元素处理:原文未说明零元素是否参与分位点计算。技术领域对中从未共同出现者占多数,若纳入零元素会使分位点同时落在零上、全部元素归入同一区间,测度退化为常数。故分位点仅由严格为正的加权耦合值确定。 - 考察期与数据覆盖:专利自申请到公开存在制度性滞后,最近的申请年份仍在回补,落入后一考察期时会压低该期的专利数与新增技术领域的识别数量,使后期矩阵相对前期变薄,耦合减弱的判定相应增多,核心变量随之偏高而非偏低;同时最近申请年的专利类型构成也偏向发明专利,而发明专利携带多个分类号的比例高于实用新型,矩阵密度一并受影响。对末年敏感的实证建议把样本止于更早的年份。前一考察期落在专利记录起点之前时,企业的全部技术领域会被判为新增,相应的耦合变化量全部计入新技术领域两两之间。两个考察期的专利数字段可用于识别并排除这两类企业年。 - 专利的企业归属:专利归属涵盖上市公司本身及其子公司、联营企业与合营企业,非上市公司本身的部分占多数;归属关系为当期快照而非逐年股权,企业在后期发生的收购会使其早年考察期一并带入被收购方的历史专利。一件由多家上市公司共同持有的专利在每一家的专利池中各计一次。 - 面板边界:面板起于上市年、止于退市年或数据末年,不含上市前年份,与财务面板按代码与年份直接连接时,未命中主要来自上市前年份。主体名单的既有收录对北京证券交易所公司尚不完整,相应企业年不出现在本数据集中。 - 其他局限:分类号体系随版本修订而调整,跨长时段的技术领域数比较会受此影响;本指标与库内基于同一分类体系的知识多元化类指标存在中等程度相关,同时放入回归时建议检查共线性。 参考文献 - 于飞,刘明霞,王凌峰,等.知识耦合对制造企业绿色创新的影响机理——冗余资源的调节作用[J].南开管理评论,2019,22(3):54-65+76. - 于飞,胡泽民,董亮,等.知识耦合对企业突破式创新的影响机制研究[J].科学学研究,2018,36(12):2292-2304.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。