专利知识多元化(Teachman熵与HHI)
「专利知识多元化(Teachman熵与HHI)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 71,817。 基于专利主分类号(IPC)分布测度企业知识基础的技术多元化程度。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 14 |
| 样本量 | 71,817 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称(当年,按年匹配更名记录)
- Year [年份] — 年份(专利申请年)
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- TechCategoryCount [技术类别数] — 参考田丹等(2025,中国工业经济)的方法,计算公式为:企业截至当年累计专利按主分类号所属IPC小类(前4位,如A61K)统计的去重技术类别数,即知识多元化熵公式中的技术类别数n。无专利企业设为0。越大代表企业涉足的技术领域越多。单位:个
- KnowledgeDiversification [知识多元化(Teachman熵)] — 参考田丹等(2025,中国工业经济)、李玉花等(2024,中国工业经济)的方法,基于专利主分类号采用Teachman熵指数法测度企业知识多元化,计算公式为:TD=-SUM(pj*ln(pj)),其中pj为企业截至当年累计专利中主分类号属于技术类别j(IPC 4位小类)的专利占比。值非负,无专利企业设为0。用作研究变量,越大代表企业知识基础越多元化。
- KnowledgeDiversificationHHI [知识多元化(大组异度)] — 参考田丹等(2025,中国工业经济)替换调节变量的方法,计算公式为:TD2=1-SUM(αm^2),其中αm为企业截至当年累计专利中主分类号属于IPC大组m的专利占比。范围[0,1),无专利企业设为0。用作知识多元化的稳健性替代度量,越大代表知识基础越多元化。单位:比例
常见问题
- 「专利知识多元化(Teachman熵与HHI)」是什么数据集?
- 专利知识多元化(Teachman熵与HHI),隶属创新与知识产权。基于专利主分类号(IPC)分布测度企业知识基础的技术多元化程度。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:技术类别数、知识多元化(Teachman熵)、知识多元化(大组异度)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,817 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识多元化刻画企业知识基础在不同技术领域上的分布广度与均衡程度。一家企业若仅在单一技术领域持续申请专利,其知识结构高度集中;若专利广泛覆盖多个技术领域且分布相对均衡,则知识基础更为多元。多元化的知识基础往往意味着企业具备更强的跨领域整合与重组能力,是研究企业创新模式、探索式与利用式创新选择以及外部资本赋能效应时常用的解释变量或调节变量。 度量的基础是企业的专利组合及其技术领域归属。对每一项专利,取其主分类号(International Patent Classification 的首要分类)确定该专利的核心技术归属,并据此划归到对应的技术类别。考虑到知识基础是随时间累积的存量概念,统计采用截至当年的累计口径:对企业 $i$ 在第 $t$ 年,汇总其自首次申请以来累计申请的全部专利(含发明专利与实用新型),按技术类别归集。设企业在技术类别 $j$ 上的累计专利数为 $Pj$,专利总数为 $P=\sumj Pj$,则该技术类别的专利占比为 $pj = Pj / P$。 核心指标采用 Teachman 熵指数法度量知识多元化(记为 $TD$): $$ TD = -\sum{j=1}^{n} pj \ln pj $$ 其中 $n$ 为企业累计专利所涉及的技术类别总数。该指数同时反映技术领域的丰富度($n$ 越大潜在上限越高)与分布的均衡度(占比越分散熵值越大),取值非负,越大代表企业知识基础越多元;当全部专利集中于单一技术类别时 $pj=1$,熵值为零。需要说明的是,标准 Teachman(Shannon)熵以负号保证非负,部分文献排版省略负号,此处统一采用非负形式 $-\sum pj \ln pj = \sum pj \ln(1/pj)$,使数值随多元化程度单调递增。技术类别的划分以 IPC 小类(分类号前四位,如 A61K)为粒度,对应通行的“技术领域”层级。 为检验主口径的稳健性,进一步以技术领域占比的内部差异度作为替代度量(记为 $TD2$),即以赫芬达尔思想反向刻画的多元化指数: $$ TD2 = 1 - \sum{m} \alpham^2 $$ 其中 $\alpham$ 为企业累计专利中主分类号归属于 IPC 大组 $m$(分类号斜杠前的完整段,如 A61K36)的占比。$TD2$ 取值于 $[0,1)$ 区间,越接近 1 代表知识分布越分散、多元化程度越高。该替代度量在更细的大组层级上以不同函数形式刻画同一构念,与核心熵指标互为印证。 为便于机制分析,同时报告累计技术类别数 $n$,即企业截至当年主分类号所覆盖的去重 IPC 小类数量,作为多元化的丰富度构件。 补充说明 - 统计口径为按申请年的累计存量,覆盖发明专利与实用新型;技术归属以每项专利的主分类号确定,主分类号缺失时以该专利首个分类号回退近似。 - 指标在全部上市公司—年度面板上构建,对当年尚无累计专利的企业,三项指标均置为零;仅拥有单一技术类别的企业熵值与差异度同样为零。研究中如需聚焦有专利企业,可借助累计技术类别数筛选。 参考文献 - 田丹, 丁宝, 刘芙蓉. “耐心资本”赋能新创企业韧性:企业风险投资和独立风险投资的差异化作用[J]. 中国工业经济, 2025(7): 156-173. - 李玉花, 林雨昕, 李丹丹. 人工智能技术应用如何影响企业创新[J]. 中国工业经济, 2024(10): 155-173. - Teachman J D. Analysis of population diversity: measures of qualitative variation[J]. Sociological Methods & Research, 1980, 8(3): 341-362.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。