知识宽度(HHI)

「知识宽度(HHI)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 71,817。 参考戴一鑫、王译潇(2023)的方法,用赫芬达尔指数在IPC大类维度上测度企业累计发明专利分布的多样性,衡量企业知识储备的宽度(论文变量know,式6)。

时间跨度1990-2025 年
数据频率年度
层级上市公司
变量数15
样本量71,817
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年份(知识宽度为存量指标,反映截至该年的累计发明专利分布)
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • CumInventionPatent [累计发明专利申请数] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))的方法,为知识宽度公式的分母Z,计算公式为:截至当年(含)企业累计申请的发明专利件数,按专利申请年累计,剔除实用新型与外观设计。无发明专利企业取0。用作控制变量,越大代表企业发明专利存量越多;因知识宽度与专利规模存在机械正相关,作回归时建议以本列控制规模效应。单位:件
  • IPCClassCount [累计IPC大类数] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))的方法,为知识宽度公式中求和项的技术大类个数,计算公式为:截至当年企业累计发明专利按主分类号所属IPC大类(国际专利分类号前3位,如H01、G06)统计的去重个数。无发明专利企业取0。越大代表企业知识基础覆盖的技术大类越多。单位:个
  • KnowledgeBreadthHHI [知识宽度(HHI)] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))的方法,计算公式为:知识宽度=1-Σ(Z_m/Z)²,其中Z_m为企业截至当年在IPC大类m(国际专利分类号前3位,如H01)下按主分类号归类的发明专利累计申请件数,Z为企业截至当年发明专利累计申请总件数。取值范围[0,1),无发明专利企业(分母为0,公式未定义)为缺失值。用作研究变量,越大代表企业知识储备的多样性越高、知识宽度越大。
  • KnowledgeBreadthHHIAll [知识宽度(全部IPC大类口径)] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))知识宽度公式的稳健性替代口径,计算公式为:1-Σ(Z_m/Z)²,其中Z_m为企业截至当年发明专利中涉及IPC大类m的件数,改按专利的全部IPC分类号归类,同一专利在同一大类内只计一次,故一件专利可计入多个大类,Z为各大类件数之和。用于检验知识宽度不依赖每件专利归入唯一大类这一读法,与核心口径的秩相关极高、结论高度一致。无发明专利企业为缺失值。

常见问题

「知识宽度(HHI)」是什么数据集?
知识宽度(HHI),隶属创新与知识产权。参考戴一鑫、王译潇(2023)的方法,用赫芬达尔指数在IPC大类维度上测度企业累计发明专利分布的多样性,衡量企业知识储备的宽度(论文变量know,式6)。
该数据集的时间范围是?
覆盖 1990-2025 年。
包含哪些变量/指标?
共 15 个变量。核心指标包括:累计发明专利申请数、累计IPC大类数、知识宽度(HHI)、知识宽度(全部IPC大类口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 71,817 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业创新的核心动力在于具备独特且多样化的知识容量,即知识储备的"宽度"。企业知识构成的多样性越高,不同技术领域之间发生知识组合与重构的概率就越大,从而越有利于提升创新能力。参考戴一鑫、王译潇(2023)的方法,本数据集利用赫芬达尔指数,在技术大类维度上测度企业知识储备的多样性程度(论文变量 $know$,式(6))。 技术领域的划分依据国际专利分类号(IPC)的层级结构。IPC 分类号自上而下依次包含部、大类、小类、大组与小组五个层级,本指标取其中的大类层级,即分类号的前三位(一位字母的部代号加两位数字,如 $H01$、$G06$、$A61$)。专利类型方面,考虑到实用新型与外观设计专利存在较为严重的"专利泡沫"问题,原文在构建创新变量时明确剔除外观专利与实用新型专利,只使用发明专利,本指标因此同样仅以发明专利为基础,并按专利申请年累计。 对企业 $i$ 在第 $t$ 年,取该企业截至第 $t$ 年(含)已申请的全部发明专利,按各专利的主分类号将其归入唯一的 IPC 大类。记 $Z{imt}$ 为第 $t$ 年企业 $i$ 在大类 $m$ 下发明专利的累计件数,$Z{it}$ 为企业 $i$ 在第 $t$ 年发明专利的累计总件数,则知识宽度定义为一减各大类份额的平方和: $$know{it}=1-\sum{m}\left(\frac{Z{imt}}{Z{it}}\right)^{2}$$ 按主分类号归类是上式的内在数学要求:只有当每件专利被归入唯一大类时,$\sum{m} Z{imt}=Z{it}$ 才成立,各大类份额之和恰为 $1$,$know$ 才落在 $[0,1)$ 区间内。该指标本质上是技术分布集中度的反向度量,取值越大说明企业知识储备的多样性越高、知识宽度越大;当企业全部发明专利集中于单一大类时取值为 $0$。作为计算链上的构件,累计发明专利申请件数(即上式分母 $Z{it}$)与累计涉及的 IPC 大类去重个数(即上式求和项的项数)一并输出。 由于原文对"企业在 $m$ 大类下发明专利的累计数量"未进一步说明一件带有多个分类号的专利应如何归类,本数据集另提供一个稳健性口径:将归类方式由主分类号改为专利的全部 IPC 分类号,即一件专利可同时计入其涉及的多个大类(同一专利在同一大类内只计一次),相应地将分母改为各大类件数之和 $Z^{All}{it}=\sum{m} Z^{All}{imt}$,以保证份额之和仍为 $1$,其余步骤与核心口径完全一致。该口径用于检验知识宽度的度量不依赖"每件专利归入唯一大类"这一读法,两口径的秩相关极高、结论高度一致。需要说明的是,该稳健口径为本数据集提供,并非原文明确给出的指标。 补充说明 - 样本为个体—年度面板,主键为公司代码与年份,覆盖全部 A 股上市公司自上市年至退市年(或数据期末)的区间;不剔除金融行业(原文亦未声明剔除金融行业);年份范围由数据自动确定,不设固定区间;指标按原始值输出,不作缩尾处理。知识宽度是存量概念,企业某年若无新增专利申请,累计值由上一年结转;企业上市前已申请的专利计入其上市后各年的累计。面板上界取数据中最大专利申请年的前一年,即整年剔除最新的那个申请年——因发明专利自申请至公开约有 18 个月滞后,最新申请年在库内必然严重不完整。 - 与原文样本范围的差异:原文的回归样本限定为 2000—2016 年、且限定于设立子公司并通过其筛选条件(剔除样本期内母公司所在城市发生变化者、剔除子公司注册地不在中国者)的上市公司,样本量为 15,946。本数据集不施加上述样本限制,输出全部 A 股上市公司—年度的完整面板,由使用者按研究需要自行截取。因此本数据集的横截面构成比原文更宽(包含从不设立子公司的企业),其描述性统计不与原文回归样本严格可比。 - 无发明专利企业的处理:累计发明专利件数为 $0$ 时,上式分母为零、指标在数学上未定义,故两个知识宽度字段取缺失值而非 $0$;同时输出的累计发明专利件数在该情形下取 $0$,使用者可据此自行决定是否补零。 - 主分类号缺失时,回退取该专利分类号列表中的第一个作为主分类号;两者皆缺失的极少数记录被剔除。该回退可能与专利实际主分类号不完全一致,但涉及的专利占比很低。 - 专利归属口径:本数据集沿用平台既有的专利归属关系,即同时包含上市公司本身及其子公司、联营企业等关联主体申请的专利。相较"仅母公司本身申请"的窄口径,本口径纳入的专利数量明显更多、覆盖的技术大类更广,因而知识宽度水平系统性更高;且有相当一部分公司—年完全依赖子公司或联营企业的专利才有取值。就原文报告的水平而言,本口径明显更为贴合。使用提示:若将本指标用于以"设立子公司/异地扩张"为处理变量的中介检验,新并入子公司的存量专利会机械地计入母公司,该渠道部分源自归属规则而非知识获取机制,宜同时以母公司口径做稳健性检验。 - 与专利规模的机械相关(重要):$1-HHI$ 形式的指标在专利件数较少时被数学上限所压低——仅有 1 件专利时必为 $0$,2 件时上限为 $0.5$,3 件时上限为 $0.667$。因此本指标与企业累计专利件数、累计大类数均呈明显正相关。若按累计专利件数分箱后再看各箱内的年度均值,会发现各箱内的时间趋势相当平坦,这表明全样本知识宽度随时间上升的现象,很大程度上由企业专利存量的增长所驱动,而非同等规模的企业变得更加多元。作回归分析时务必同时控制累计发明专利件数(或其对数),否则本指标在很大程度上是在测量专利规模。 - 缺失的非随机性:指标缺失(即累计发明专利为零)的比例在样本期早期很高,随专利活动普及而逐年下降;分行业看,住宿餐饮、综合、房地产、批发零售等行业的缺失率显著偏高,而科学研究和技术服务业、制造业则很低。由于"是否拥有专利"本身即创新产出的体现,以本指标为中介变量的分析实质是在"已有发明专利的企业"子样本内进行,存在样本选择问题,必要时应做选择性偏差校正。 - 累计存量的棘轮效应:由于建立在只增不减的累计计数之上,成熟企业每年新增专利相对于存量是小量,本指标的企业内变异偏小,相当比例的相邻年份观测几乎不发生变化,在高维企业固定效应模型下可识别的组内变异有限。需要说明的是,本指标并非单调不减——新增专利若集中于既有优势大类会抬高集中度,从而使知识宽度下降,故指标本身仍含有效信息。 - 低专利数区间的取值离散:当累计专利件数很少时,指标的可能取值是有限的离散点(1 件时只能为 $0$,2 件时只能取 $0$ 或 $0.5$,3 件时只能取 $0$、$0.444$ 或 $0.667$),因而在 $0$、$0.5$、$0.444$、$0.667$ 等处出现明显的质点堆积。对连续性较为敏感的估计(如中介效应的 Sobel 检验)建议限定在累计专利达到一定规模(如不少于 10 件)的子样本内。 - 近年的轻度右截断:发明专利自申请至公开约有 18 个月滞后,故最近一至两个申请年的专利在库内尚未收录完全。在累计存量口径下,该截断表现为知识宽度"停止上升"而非缺失,从数据表面不易察觉,使用最近年份数据(尤其是做一阶差分或事件研究)时应予注意。 - 与原文报告水平的对照:原文表 1 未列出本指标的描述性统计,唯一可对照的是其展示 2001—2016 年上市企业平均知识宽度变化趋势的图示。该图起点 2001 年约为 $0.27$,本数据集对应年份与之近乎精确吻合;2010 年(图示约 $0.49$)与 2013 年(图示约 $0.64$)亦相当贴合,整体取值区间一致。原文该图另有两处特征与本数据集不同,均源自原文一侧:其一,该图在 2005—2014 年间于 $0.49\sim0.66$ 之间反复震荡,而知识宽度作为累计存量指标,其横截面均值不应逐年大幅回落,该震荡应来自其逐年样本构成的变动;其二,该图在 2015—2016 年骤降至 $0.19$ 与 $0.22$,既与原文同段正文"在样本期间内企业的知识宽度不断提高"的表述直接矛盾,也与累计存量指标的性质不相容,极可能是其构建数据时发明专利尚未公开所致的右截断。本数据集这两年保持单调上升,与原文正文的文字结论一致。 参考文献 - 戴一鑫,王译潇.企业异地扩张、技术获取与企业创新——基于上市公司设立子公司的经验证据[J].中国地质大学学报(社会科学版),2023,23(1):102-115.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。