企业创新网络技术多元化(NTD)
「企业创新网络技术多元化(NTD)」,覆盖 1988-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 32,571。 依据企业间联合申请专利以3年移动窗口构建企业合作创新网络,从个体网络视角度量该上市公司所处创新网络中各成员之间的技术差异程度。
| 时间跨度 | 1988-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 15 |
| 样本量 | 32,571 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度,也是3年移动窗口[t-2,t]的末年
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- JointPatentCount [企业间联合申请专利数] — 参考赵炎等(2022,科学学研究)的方法,计算公式为:3年移动窗口[t-2,t]内该公司及其关联主体参与的企业间联合申请专利件数,企业间联合申请指一件专利的申请人中包含两家及以上企业,同一申请号只计一次。单位:件
- PartnerCount [合作伙伴企业数] — 计算公式为:3年移动窗口[t-2,t]内与该公司联合申请过专利的其他企业去重数量,同一家企业在窗口内多次合作只计一次。单位:家
- NetworkSize [个体网络成员数] — 参考赵炎等(2022,科学学研究)的方法,即技术多元化计算公式中的成员数n,计算公式为:核心企业加上其合作伙伴企业中在窗口期内具备可用技术向量的成员数量。个别合作伙伴因窗口期内没有可用的专利分类信息而无法计算技术距离,故该值可能小于合作伙伴企业数加一。单位:个
- NTD [创新网络技术多元化] — 参考赵炎等(2022,科学学研究)基于Jaffe(1986,AER)技术邻近性指标的方法,计算公式为:NTD=2/(n(n-1))乘以网络成员两两技术差异TD_ij之和,其中TD_ij=1-(F_i·F_j')除以[(F_i·F_i')(F_j·F_j')]的二分之一次方,即成员i与j技术向量余弦相似度的补;F_i为企业i在各技术领域(国际专利分类IPC部)的专利数向量,按3年移动窗口[t-2,t]统计;n为个体网络成员数,含核心企业本身,两两组合覆盖核心企业与合作伙伴之间以及合作伙伴相互之间的全部配对。取值范围[0,1],用作研究变量,越大代表创新网络中各成员之间技术背景差异越大、企业可获取的多元化外部技术资源越丰富
常见问题
- 「企业创新网络技术多元化(NTD)」是什么数据集?
- 企业创新网络技术多元化(NTD),隶属创新与知识产权。依据企业间联合申请专利以3年移动窗口构建企业合作创新网络,从个体网络视角度量该上市公司所处创新网络中各成员之间的技术差异程度。
- 该数据集的时间范围是?
- 覆盖 1988-2025 年。
- 包含哪些变量/指标?
- 共 15 个变量。核心指标包括:企业间联合申请专利数、合作伙伴企业数、个体网络成员数、创新网络技术多元化。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 32,571 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在开放式创新的背景下,企业的技术创新越来越依赖外部资源,合作伙伴所携带的多元化技术知识成为企业突破自身创新资源限制的重要来源。企业间的联合专利申请是这种合作关系最直接、也最便于观测的载体:两家及以上企业共同署名一件专利,意味着它们在该项技术上发生了实质性的研发协作。把大量这样的联合申请关系汇聚起来,就构成了一张企业合作创新网络。本数据集从个体网络(ego network)的视角出发,以上市公司为核心节点、与之联合申请过专利的其他企业为成员节点,刻画该公司所处创新网络中各成员之间技术背景的差异程度。差异越大,说明企业能够从合作网络中触达的技术领域越分散、可供借鉴与重组的异质性知识越丰富;差异越小,则说明网络成员技术背景趋同,合作带来的多是同质性资源。 网络的构建以三年为移动窗口。对第 $t$ 年而言,凡在 $[t-2,\ t]$ 三年内发生的企业间联合申请,都计入该年的网络。这里的"企业间联合申请"要求一件专利的申请人中包含两家及以上企业,从而把企业与高校、科研院所、医院之间的产学研合作以及自然人申请排除在外——本指标刻画的是企业之间的技术分布差异。在识别申请人身份时,除通常的公司制企业外,还需注意两类容易被漏掉的情形:一是企业内设的研究机构,其名称虽以"研究院""研究所"结尾,但主体仍是企业;二是以"株式会社"为组织形式的日韩企业,其名称中并不出现"公司"字样。二者若被误判为非企业,会造成对电子、汽车、化工等行业跨国与跨主体合作的定向低估。 核心指标的构造分三步。第一步,把每一个网络成员表示为一个技术向量。对企业 $i$,构造 $$Fi=(F{i1},\ F{i2},\ \ldots,\ F{is})$$ 其中 $F{is}$ 为企业 $i$ 在第 $s$ 个技术领域的专利数。技术领域按国际专利分类的"部"划分,共 A 至 H 八类;每件专利依其主分类号恰好归入一个技术领域,因而向量各分量之和即等于该企业在窗口期内的专利件数。少数专利缺失主分类号,此时取其全部分类号中出现次数最多的部,而不取排在最前的一个——分类号的排列顺序并不反映重要性,取首位会系统性地偏向排序靠前的技术领域。技术向量的统计窗口与网络构建保持一致,同为 $[t-2,\ t]$,以反映成员当期的技术组合。需要说明的是,同一件专利在专利数据中可能同时存在公开与授权两条公布记录,统计时按申请号去重,避免发明专利被重复计入而扭曲向量各分量的相对权重。 第二步,度量任意两个成员之间的技术差异。沿用 Jaffe 提出的技术邻近性思想,以两个技术向量夹角的余弦衡量其技术接近程度,并取其补作为技术差异: $$TD{ij}=1-\frac{FiFj'}{\left[(FiFi')(FjFj')\right]^{1/2}},\qquad i\neq j$$ 由于专利计数非负,余弦相似度取值于 $[0,1]$,故 $TD{ij}$ 亦落在 $[0,1]$ 区间:两个成员的专利完全集中于相同技术领域时取 0,技术领域完全不重叠时取 1。 第三步,对个体网络内全部成员两两之间的技术差异求平均,得到创新网络技术多元化: $$NTD=\frac{2}{n(n-1)}\sumi\sumj TD{ij}$$ 其中 $n$ 为个体网络的成员数量。这里的两两配对既包括核心企业与各合作伙伴之间的配对,也包括各合作伙伴相互之间的配对,因此 $n$ 是含核心企业本身在内的成员总数,而非合作伙伴数量。指标取值于 $[0,1]$,数值越大表示网络成员间技术差异越大、创新网络技术多元化水平越高。 数据集同时给出三个刻画网络规模的中间变量,便于使用者理解指标的构造基础并在实证中加以控制:窗口期内该公司参与的企业间联合申请专利件数、窗口期内合作伙伴企业的去重数量,以及实际进入上式计算的成员数 $n$。其中后两者通常相差一(即核心企业本身),但当个别合作伙伴在窗口期内没有可用的专利分类信息、无法构造技术向量时,该成员不参与两两配对,此时 $n$ 会小于合作伙伴数加一。 补充说明 - 技术领域的层级:原文在界定本指标时仅称"第 $s$ 类",未指明采用国际专利分类的哪一层级。本数据集按"部"(A–H 共八类)实现,该层级下指标在原文样本区间内的均值与原文报告值接近;若改用更细的"大类"层级,指标水平将显著抬高,且与"部"层级的结果并非简单的尺度变换。使用者若关注更细的技术划分,需自行重构。 - 核心节点的主体范围:原文以上市公司本身及其更名历史为核心节点。本数据集的核心节点采用企业集团口径,将同一股票代码下的上市公司本身、子公司、联营与合营企业及历史名称合并为一个节点,因而网络覆盖较原文更完整,核心节点的技术向量与合作关系均按集团口径统计。同一实体可能同时关联多家上市公司(如合资与联营企业),此类归属按主体清单逐一对应展开;由于一个公司全称只可能对应一家上市公司本身,凡与公司档案登记的全称归属不符的此类标注均予剔除,B 股代码亦按权威对照并入其 A 股代码,以免同一家公司被拆成两个独立节点。 - 合作伙伴的主体识别:网络节点直接以专利申请人名称为准。大型企业集团的下属公司、分支机构与名称写法变体会各自成为独立节点,其中部分实际上仍属核心企业所在集团。这一现象在建筑、电力等以大型央企为主的行业中较为明显,会同时抬高网络规模与技术差异。使用者在跨行业比较时,建议将网络规模作为控制变量一并纳入。 - 合作专利的双重计入:界定网络边的那件联合申请专利,同时也进入合作双方的技术向量,这是原文将 $Fi$ 定义为企业全部专利的必然结果。对专利数量很少的合作伙伴,其技术向量会较多地由与核心企业的合作专利构成,从而使技术差异偏低。 - 指标与网络规模的关系:成员数越多,两两配对的平均值越趋近于该时期企业间技术距离的总体水平,指标的横截面方差随之收窄;成员数为二时,指标则完全由唯一一对成员的技术距离决定。建议在回归中同时控制网络规模。 - 缺失的含义:只有在窗口期内存在企业间联合申请、且核心企业与至少一个合作伙伴都具备可用技术向量时,指标才有取值。缺失既可能是企业当期确实没有开展企业间联合创新,也可能是有合作但技术分类信息不足以构造向量,二者不可区分,因此不宜简单地把缺失填为零。由于参与联合申请的多为规模较大、创新活跃的企业,样本相对于全部上市公司存在规模上的选择性,使用者可据此构造是否参与合作创新的虚拟变量或进行样本选择校正。 - 其他局限:专利从申请到公布存在约一年半的滞后,最近若干个申请年份的联合申请与专利分类信息尚未完全进入数据,相应年份的网络规模与样本构成会随数据更新而变化;样本期最早的若干年份上市公司间联合申请极少,指标在这些年份的代表性有限。建议实证研究选取近二十年的窗口,并加入年份固定效应。 参考文献 - 赵炎,叶舟,韩笑.创新网络技术多元化、知识基础与企业创新绩效[J].科学学研究,2022,40(9):1698-1709. - Jaffe A B. Technological opportunity and spillovers of R&D: Evidence from firms' patents, profits and market value[J]. The American Economic Review, 1986, 76(5): 984-1001. - 陈立勇,谢芳,曾德明,等.协作研发网络技术多元化、组织冗余对二元式创新的影响——基于中国汽车企业面板数据[J].软科学,2015(9):9-13.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。