企业技术相关性(于飞法)
「企业技术相关性(于飞法)」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 77,533。 参考于飞等(2018,科学学研究)式(4)(5)的方法,利用专利国际专利分类号主分类与副分类的共现关系,测度企业内部两两技术领域之间客观存在的知识关联程度并加总
| 时间跨度 | 2006-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 77,533 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 样本年度,专利按申请年份归入所属年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PatentCountWindow [窗口期专利数] — 参考于飞等(2018,科学学研究)的方法,计算公式为:该企业在第t-2年至第t年三年滚动窗口内申请的发明专利件数,为技术相关性计算式中衡量企业专利总量的分母项。由多家上市公司共同申请的专利计入每一家参与公司。因该变量进入计算式分母,专利极少的企业年技术相关性会趋近上界,建议据此施加最小专利数限制。
- TechFieldCount [技术领域数] — 参考于飞等(2018,科学学研究)的方法,计算公式为:三年滚动窗口内企业全部专利的国际专利分类号前四位去重后的个数,主分类号与副分类号合并计算,即技术相关性两两求和所覆盖的技术领域总数。
- RelatedPairCount [技术关联领域对数] — 计算公式为:三年滚动窗口内领域对关联度取值大于零的技术领域两两组合个数,即企业内部存在实际知识关联的技术领域对数量。
- IPCMainFallbackRate [主分类回退率] — 计算公式为:三年滚动窗口内主分类号缺失、改以首位分类号替代的专利件数占窗口内专利总数的比重。取值越高表示该企业年主分类与副分类的区分越依赖替代口径,用作数据质量筛选依据而非研究变量。该比率按三年主窗口计算,用于筛选五年窗口口径时会低估其受替代口径影响的程度。
- TechRelatedness [企业技术相关性] — 参考于飞等(2018,科学学研究)的方法,计算公式为:对任意两个技术领域i与j,先计算领域对关联度等于二分之一倍的p平方与q平方之和再开平方根,其中p等于以i为主分类且副分类含j的专利件数的平方,除以窗口期专利数与以i为主分类的专利件数之积,q按主分类j与副分类i对称定义;再对企业涉及的全部技术领域两两组合求和得到企业技术相关性。专利统计采用第t-2年至第t年三年滚动窗口。该指标刻画企业内部各技术领域之间客观存在的知识关联程度,与企业主动整合知识的耦合行为相区别。取值为零表示窗口内有专利但各专利均未跨越技术领域;窗口内没有专利的企业年不输出记录,二者含义不同。用作研究变量,越大代表企业各技术领域之间的知识关联越紧密。
- TechRelatedness2Y [企业技术相关性(两年窗口)] — 参考于飞等(2018,科学学研究)表4模型8的窗口稳健性检验,计算方法与企业技术相关性完全一致,仅将专利统计窗口由三年改为第t-1年至第t年两年。用于检验结果对时间窗口设定的敏感性。取值为空表示该企业在两年窗口内没有专利,属结构性未定义而非数据缺失,据此做稳健性检验时样本会同时改变。
- TechRelatedness5Y [企业技术相关性(五年窗口)] — 参考于飞等(2018,科学学研究)表4模型9的窗口稳健性检验,计算方法与企业技术相关性完全一致,仅将专利统计窗口由三年改为第t-4年至第t年五年。用于检验结果对时间窗口设定的敏感性。
常见问题
- 「企业技术相关性(于飞法)」是什么数据集?
- 企业技术相关性(于飞法),隶属创新与知识产权。参考于飞等(2018,科学学研究)式(4)(5)的方法,利用专利国际专利分类号主分类与副分类的共现关系,测度企业内部两两技术领域之间客观存在的知识关联程度并加总
- 该数据集的时间范围是?
- 覆盖 2006-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:窗口期专利数、技术领域数、技术关联领域对数、主分类回退率、企业技术相关性、企业技术相关性(两年窗口)、企业技术相关性(五年窗口)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 77,533 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的知识基础由若干技术领域构成,各技术领域中的知识元素并非彼此孤立,而是客观存在着相互关系。这种客观关系被称为技术相关性,它与企业主动将不同技术领域的知识加以关联和组合的行为(即知识耦合)相区别:后者是主观能动的选择结果,具有主观性与动态性;前者则是技术领域本身所固有的联系结构。企业之所以会在某两个技术领域之间开展知识组合,很大程度上正是因为预期这两个领域的技术相关性较高、知识组合后产生有价值创新的概率较大。因此技术相关性构成了理解企业知识基础变革与创新决策的重要背景条件,在相关研究中通常作为控制变量进入模型。 本数据集参考于飞等(2018)的方法,利用专利分类号中主分类与副分类的共现关系来刻画这一客观联系。技术领域以国际专利分类号的前四位(小类)界定。一件专利的主分类号标示其所属的核心技术领域,其余分类号则标示该项发明同时涉及的其他技术领域。若企业在以领域 $i$ 为主分类的专利中频繁地同时标注领域 $j$,说明在该企业的技术实践中,这两个领域的知识元素确实存在实质性的关联。 对任意两个技术领域 $i$ 与 $j$,先分别从两个方向刻画其关联强度。设 $N$ 为企业在考察窗口内的专利总数,$Ni$ 为以 $i$ 为主分类的专利数,$n{ij}$ 为主分类为 $i$ 且副分类中包含 $j$ 的专利数。定义 $a=n{ij}/Ni$ 表示以 $i$ 为主分类的专利中涉及 $j$ 的比例,$ui=n{ij}/N$ 表示这类专利在企业全部专利中所占的比重,二者之积 $p=ui a$ 即为从 $i$ 到 $j$ 方向的关联强度。将主副分类的角色对调,以 $b=n{ji}/Nj$ 与 $vj=n{ji}/N$ 同样构造反方向的关联强度 $q=vj b$。领域对的技术相关度取两个方向的二次平均: $$TR{ij}=\sqrt{\frac{p^{2}+q^{2}}{2}},\qquad p=ui a=\frac{n{ij}^{2}}{N\cdot Ni},\qquad q=vj b=\frac{n{ji}^{2}}{N\cdot Nj}$$ 这一设定包含两重含义:既要求某一方向上的共现在该主分类内部占有相当比例(即 $a$ 或 $b$ 较高),又要求这类共现专利在企业整体知识基础中具有一定分量(即 $ui$ 或 $vj$ 较高)。只有当两个条件同时满足时,该领域对才会被认定为高度相关。取二次平均而非算术平均,使得单一方向上的强关联不会被另一方向的弱关联完全稀释。 企业层面的技术相关性由全部技术领域两两组合的相关度加总得到: $$TR=\sum{i=1}^{K-1}\sum{j=i+1}^{K}TR{ij}$$ 其中 $K$ 为企业在考察窗口内涉及的技术领域总数,主分类号与副分类号合并计算。从未在同一件专利中共现的领域对,其 $n{ij}$ 与 $n{ji}$ 均为零,相应的 $TR{ij}$ 亦为零,因而不对加总产生贡献。需要注意的是,该式为求和而非平均,因此技术领域跨度更广、跨领域专利更多的企业会获得更高的取值,指标同时承载了关联强度与关联广度两方面的信息。 考察窗口采用三年滚动口径,即以当年及此前两年的专利共同构成企业当期的知识基础。原文在稳健性检验中曾将窗口分别调整为两年与五年,并认为三年窗口最为适宜。本数据集据此一并提供两年与五年窗口下的取值,供使用者检验结论对窗口设定的敏感性;三种口径的计算方法完全一致,仅专利统计区间不同。 专利按申请年份归入所属年度,统计范围为发明专利。由多家上市公司共同申请的专利计入每一家参与公司,同一件专利在同一公司只计一次。数据集同时给出窗口期专利数、技术领域数与存在实际关联的领域对数,使用者可据以了解指标背后知识基础的规模与结构。 补充说明 - 样本口径:覆盖全行业、全板块的上市公司,不预先剔除金融业,也不限定于高技术产业;原文以高技术产业公司为样本,使用者可自行按行业代码筛选所需子样本。 - 专利池范围:采用发明专利的全部申请而非仅已授权部分,因授权存在数年滞后,限定为已授权会使临近年份的知识基础被系统性低估。需注意该选择并非中性:专利总数进入计算式的分母,故本指标的水平值低于以授权专利为口径时的取值,与原文报告的均值对照时应计入这一差异。专利归属采用合并口径,涵盖上市公司本身及其子公司、联营与合营企业所申请的专利。 - 与分类标注深度的共线性:本指标在数值上与企业专利平均携带的分类号个数高度相关,这是求和形式与分式结构共同决定的性质。建议在回归中同时控制窗口期专利数与每件专利平均分类号个数,以将技术关联结构与专利分类标注行为区分开,并展示核心结果在加入这两项后的稳健性。 - 时序可比性:全国发明专利每件携带的分类号个数在样本期内呈先降后升的变化,该变化会传导到本指标的年度均值上。因此年度均值的升降不宜解读为企业技术关联程度的演变;回归应包含年度固定效应,若研究设计涉及跨期对比(如双重差分或事件研究),需注意处理时点与这一标注拐点可能重合。 - 知识基础规模的影响:该指标为领域对相关度的加总,当窗口内专利很少时分式趋近其上界,取值呈双峰分布——多数为零,其余被顶到固定倍数;极端情形是窗口内仅有一件横跨多个技术领域的专利。建议施加最小专利数限制(如不少于五件),施加后指标的离散程度与原文报告值高度接近。 - 缺失与零值的区别:窗口内有专利但各专利均未跨技术领域时取值为零;窗口内没有专利则不输出该企业年。二者含义不同,构建平衡面板时既不宜按随机缺失处理,也不宜直接填零。 - 指标方向:计算式为无归一化的加总,与技术领域数量呈弱负相关(领域数多的企业通常专利也多,而专利数在分母),因此不宜作为技术组合广度的正向代理。 - 分类口径的时间一致性:主分类与副分类的区分依赖分类号字段的完整标注,该标注在早期年份存在大面积缺失,缺失时以首位分类号替代。本数据集自标注趋于完整的年份起算,并逐企业年给出主分类回退率;经反事实检验,该替代对取值的影响可以忽略。回退率一列对应三年主窗口,用于筛选五年窗口口径时会低估污染程度。 - 其他局限:面板按专利归属构建、不受上市状态约束,包含部分上市前年份与少量非A股主体,使用者需按上市区间自行过滤;少数北交所企业因新旧证券代码并存而被记为两个主体,各自只获得部分专利组合;地级市代码在省直管县与县级市地区存在缺失,需要城市层面变量时建议改用省级口径。专利公开存在约一年半的滞后,临近当前的申请年度件数尚不完整;技术领域取分类号前四位,同一小类内部的技术差异不予区分。 参考文献 - 于飞,胡泽民,董亮,等.知识耦合对企业突破式创新的影响机制研究[J].科学学研究,2018,36(12):2292-2304.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。