企业专利集聚度(创新决策)
「企业专利集聚度(创新决策)」,覆盖 1993-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 71,485。 基于企业当年授权专利在国际专利分类号四级(部-大类-小类-主组)上的分布集中度,刻画企业创新决策的聚焦与分散程度。
| 时间跨度 | 1993-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 71,485 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利授权年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- GrantedPatentCount [当年授权专利数] — 企业当年获得授权的发明专利与实用新型专利件数(含子公司、联营与合营企业,不含外观设计),为专利集聚度计算公式的分母。参考朱红兵等(2026,南开管理评论)的样本处理,该件数不超过3件的企业年不计算专利集聚度
- IPC4Count [IPC四级技术类别数] — 企业当年授权专利按国际专利分类号四级(部-大类-小类-主组,如A47B9)归类后的技术类别数,即专利集聚度计算公式中的类别数K。用作研究变量,越大代表企业当年创新涉及的技术领域越多
- SharedPatentRatio [关联多家上市公司专利占比] — 计算公式为:当年授权专利中同时关联两家及以上上市公司的件数占当年授权专利总数的比例,取值0至1。此类专利多为同一子公司或联营企业的专利被同时挂靠到多家上市公司名下,而非多方联合申请。用作数据质量标识,越大代表该企业年的专利集聚度越多由关联方而非公司自身的技术分布决定,可据此筛除受关联归属影响较大的观测
- ADT [专利集聚度] — 参考朱红兵等(2026,南开管理评论)的方法,计算公式为:企业当年授权专利按国际专利分类号四级(部-大类-小类-主组)归类后,各技术类别专利数占当年授权专利总数比例的平方和。取值区间为(0,1],当年授权专利不超过3件的企业年不计算。用作研究变量,越大代表企业创新决策越聚焦于少数技术领域、属聚焦型创新决策,越小代表创新投入越分散、属分散型创新决策。该指标与当年授权专利数存在固有的负向关联,作回归变量时建议同时控制专利数量的对数
- LnADT [专利集聚度对数] — 参考朱红兵等(2026,南开管理评论)的方法,计算公式为:专利集聚度的自然对数。原文因该指标取值区间受限于(0,1]而在实证中对其作对数化处理以缓解受限问题。取值不大于0。用作研究变量,越大代表企业创新决策越聚焦
- GrantedPatentCountParent [当年授权专利数(母公司口径)] — 企业当年由上市公司本身获得授权的发明专利与实用新型专利件数,不含子公司、联营与合营企业,为母公司口径专利集聚度的分母
- ADTParent [专利集聚度(母公司口径)] — 参考朱红兵等(2026,南开管理评论)方法的稳健性替代口径,计算公式与专利集聚度一致,但仅计入上市公司本身获得授权的专利。用于检验核心指标对专利申请主体范围的敏感性。母公司当年授权专利不超过3件时不计算,因此缺失比例较高且可得样本偏向专利规模较大的企业年
常见问题
- 「企业专利集聚度(创新决策)」是什么数据集?
- 企业专利集聚度(创新决策),隶属创新与知识产权。基于企业当年授权专利在国际专利分类号四级(部-大类-小类-主组)上的分布集中度,刻画企业创新决策的聚焦与分散程度。
- 该数据集的时间范围是?
- 覆盖 1993-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:当年授权专利数、IPC四级技术类别数、关联多家上市公司专利占比、专利集聚度、专利集聚度对数、当年授权专利数(母公司口径)、专利集聚度(母公司口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,485 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的创新决策是一项配置研发资源的长期战略选择:一部分企业把有限的研发投入持续压在少数技术领域,力图在特定方向上形成深厚的专业积累与核心技术,属于聚焦型创新决策;另一部分企业则在多个互不相关的领域分散布局,以提高市场适应性、降低单一技术路线失败的风险,属于分散型创新决策。这一决策发生在企业内部,通常无法直接观测,但它会在企业的创新产出上留下痕迹——聚焦型策略使专利在技术空间中高度集聚,分散型策略则使专利分布呈现较低的关联集聚性。本指标即从企业专利分布的集聚特征出发,反向刻画其创新决策的聚焦程度。 刻画集聚程度需要先确定"技术领域"的划分标准。国际专利分类号是通用的专利技术分类体系,其展现形式为部(1 个字母)、大类(2 个数字)、小类(1 个字母)、主组(1 到 3 个数字)、分组(最多 4 个数字)。按照分类准则,技术类型或使用方向相近的专利会共享相似的分类号:例如 A47B9/04 与 A47B9/20 均反映用于可换算桌面高度的相关技术,前者代表垂直心轴技术,后者代表可伸缩导轨技术,两个分类号除末段的分组信息不同以外其余完全一致。可见,分类号中"部—大类—小类—主组"这前四段信息足以反映相关联专利的集聚程度,本指标即以这一四级口径作为技术类别的划分依据,记为 IPC 四级类别(如 A47B9)。 在此基础上,先确定进入计算的专利范围。计算只采用已获授权的专利,并按授权年度归入相应的企业年,因为授权意味着技术方案通过了实质审查,比申请更能反映企业真实的技术积累方向。专利类型上不含外观设计,一方面外观设计不列入上述分类体系,纳入会引入测度偏差,另一方面外观设计技术含量较低、授权率高,难以反映聚焦型创新能力。 一件专利往往同时标注多个分类号,因此还需确定归类规则。本指标依据每件专利的主分类号将其唯一归入一个 IPC 四级类别,使各类别专利件数之和恰好等于该企业年的授权专利总数。这一处理与原文的表述自洽:原文举例说明,若企业有 100 项专利而按四级分类号划分的类别只有 1 类则指标取值为 1,类别数达到 100 类时取值为 0.01——只有当每件专利唯一归类时,各类别份额之和才为 1,上述示例与份额平方和的定义才同时成立。若改按专利的全部分类号多归属计数,份额之和将大于 1,指标会系统性偏低。 设 $IPC4(k){i,t}$ 为公司 $i$ 在第 $t$ 年以 IPC 四级分类号划分的第 $k$ 类专利数量,$PatentNumber{i,t}$ 为该公司当年的授权专利总数,$Ki$ 为当年涉及的四级类别数,则专利集聚度定义为各类别专利份额的平方和: $$ADT{i,t}=\sum{k=1}^{Ki}\left(\frac{IPC4(k){i,t}}{PatentNumber{i,t}}\right)^{2}$$ 这一构造沿用赫芬达尔指数度量分散化的思想。取值区间为 $(0,1]$:当企业全部专利集聚于某一类别时取值为 1,若专利平均分布于 $K$ 个类别则取值为 $1/K$,因此数值越大代表创新决策越聚焦,越小代表创新投入越分散。专利数量过少时指标会机械地趋近于 1 而失去区分力,故当年授权专利不超过 3 件的企业年不计算该指标。由于取值区间受限,实证中通常对其作对数化处理,即 $LnADT=\ln(ADT)$,取值不大于 0,方向与原指标一致。 计算过程中一并给出两个构件变量:$GrantedPatentCount$ 为上式的分母,即企业当年的授权专利总数;$IPC4Count$ 为上式中的类别数 $K$,反映企业当年创新所涉技术领域的广度。此外还提供仅计入上市公司本身获得授权的专利(不含子公司、联营与合营企业)所计算的 $ADTParent$,用于检验核心指标对专利申请主体范围的敏感性,其计算方式与核心指标完全一致,并同样施加不超过 3 件的剔除规则。 补充说明 - 样本口径:全行业保留,不预先剔除金融业与特别处理公司,也不作缩尾(指标有 $(0,1]$ 的天然值域)。当年授权专利不超过 3 件的企业年保留在数据中并照常给出专利件数与类别数,仅集聚度取缺失,便于自行放宽该门槛。在专利件数仅为个位数的企业年,指标的可能取值只有少数几个离散点且相当比例落在 $1/K$ 的下界上,关注连续变异时可改用更高的件数门槛。 - 与专利规模的固有关联:作为份额平方和,本指标在各类别专利数相近时约等于类别数的倒数,因而与当年授权专利数存在明显的负向关联。这是该指数形式的固有性质而非实现引入。其后果是指标的时间变化主要反映专利数量的增长而非创新决策的分散化——在固定专利件数的切片内,指标的中位数在样本期内基本保持不变。因此建议将专利数量的对数作为必须控制的变量,并避免直接对指标的时间趋势作构念解读;仅加入年份固定效应不足以处理这一问题。 - 主体范围与关联归属:原文未明确申请主体是否包含子公司,核心口径采用含子公司、联营与合营企业的全口径,以反映上市公司整体的创新决策。上游记录中一部分专利同时关联两家及以上上市公司,这类记录多数只有一个申请人,即同一申请实体被同时挂靠到多家上市公司名下,而非多方联合申请;其中既有真实的共同参股关联方,也有同一法律实体的历史代码与现代码,以及名称高度相似导致的匹配重合。此类专利会在各关联方重复计入并使其技术分布相互趋同,为此给出 $SharedPatentRatio$ 列,该比例越高说明集聚度越多由关联方而非公司自身的技术分布决定,可据此筛除受影响较大的观测。 - 稳健口径的可得性:母公司口径的缺失并非随机——相当一部分企业年的专利全部来自子公司或联营企业,母体自身当年没有授权专利,加之同样施加不超过 3 件的门槛,可得样本偏向专利规模较大的企业年,且在上述关联归属占比高的观测上往往同时缺失。母公司口径的专利件数在母体当年没有任何授权专利时记为 0 而非缺失,以便与"有专利但未达门槛"的情形相区分,两种情形下集聚度均取缺失。该列适合用作口径敏感性的参考。 - 与原文描述统计的差异:原文报告的对数集聚度均值为 -0.878,三个四分位数分别为 -1.386、-0.693 与 0.000,本数据集的水平系统性低于该组数值。原文的分位数恰为 $\ln(1/4)$、$\ln(1/2)$ 与 $\ln(1)$,隐含有效技术类别数的中位数仅约 2 个、四分之一以上的企业年全部专利落在单一类别,而原文同时声明剔除了年度授权专利不超过 3 项的企业。经检验,无论采用四级主组、小类、大类还是最粗的部粒度,亦无论全口径还是仅母公司口径,均无法同时匹配原文的均值与标准差——放粗粒度可抬高均值,但标准差随之坍缩至原文报告值的一半以下。本数据集据此忠实实现原文所定义的四级口径,不为贴合原文数值而改动粒度。差异主要源于专利覆盖密度:本数据每个企业年可观测到的授权专利更多,技术类别相应更多,读数因而更低;这表现为整体的水平平移(对数值的标准差与原文报告值相当接近),消化它需按上文所述控制专利规模。 - 授权年度上限:授权年度上限取当前自然年的前一年,与本数据库其余专利类数据集保持统一口径。上游专利库按公开日增量更新,当年授权只覆盖年初至最近一次刷新的若干个月,授权件数远少于完整年份,受上文所述的负向关联影响会使读数明显偏高,故当年不予输出。即便如此,末年授权量仍会随后续数据回补而小幅上修,对末年读数敏感的研究可再留出一年缓冲。 - 其他局限:专利按企业名称回溯匹配,相当一部分企业年早于其上市年份,与财务数据合并时会自然剔除。少量新三板、B 股与已退市的历史代码亦进入数据,且同一法律实体可能同时以历史代码与现代码成行,做企业层面统计前建议按研究总体过滤代码段并对同一实体去重。主分类号缺失的少量专利回退取其分类号列表中的首个分类号,仍无法归类者不进入计算;拆分后仅保留形如六位数字的企业代码,极少数不符合该格式的记录同样不进入计算。 参考文献 - 朱红兵,许长新,张兵.创新决策如何影响企业产品市场竞争力——基于专利研发集聚度的研究[J].南开管理评论,2026,29(1):89-100. - Garcia-Vega M. Does Technological Diversification Promote Innovation: An Empirical Analysis for European Firms[J]. Research Policy, 2006, 35(2): 230-246. - Toh P K, Kim T. Why Put All Your Eggs in One Basket? A Competition-based View of How Technological Uncertainty Affects a Firm's Technological Specialization[J]. Organization Science, 2013, 24(4): 1214-1236.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。