企业知识多元化(多归属Teachman熵)
「企业知识多元化(多归属Teachman熵)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 71,817。 参考徐露允等(2017,管理学报)的方法,采用Teachman熵指数测度企业知识多元化,即企业专利知识基础所涉技术领域(IPC小类)的分散程度。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 15 |
| 样本量 | 71,817 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称(当年,按年匹配更名记录)
- Year [年份] — 年份(专利申请年)
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- PatentStock [累计专利总数] — 参考徐露允等(2017,管理学报)的方法,为知识多元化Teachman熵公式的分母P,计算公式为:截至当年企业拥有的发明专利与实用新型专利累计数量(按专利申请年累计的存量)。用作控制变量,越大代表企业专利规模越大;因知识多元化与专利规模机械相关,作回归时建议以本列控制规模效应。单位:件
- TechClassCount [技术类别数] — 参考徐露允等(2017,管理学报)的方法,为知识多元化Teachman熵公式中的技术类别数n,计算公式为:截至当年企业全部发明与实用新型专利涉及的不同IPC小类(国际专利分类号前4位,如A61K)的去重数量。无专利企业为0。用作研究/控制变量,越大代表企业知识基础覆盖的技术领域越广。单位:个
- KnowledgeDiversification [知识多元化] — 参考徐露允等(2017,管理学报)采用Teachman熵指数测度企业知识多元化,计算公式为:知识多元化=-Σ(p_i×ln(p_i)),其中p_i=P_i/P,P_i为企业截至当年所有专利中包含技术类别i(IPC小类,国际专利分类号前4位)的专利数量(一条专利的多个IPC小类各计一次,多归属计数),P为企业累计专利总数(发明与实用新型,按申请年)。无专利或单一技术类别企业取0。用作研究变量,越大代表企业知识基础越多元、涉及技术领域越分散;因与专利规模机械相关,作回归变量时建议同时控制累计专利数。
- KnowledgeDiversification_IPC3 [知识多元化(大类粒度)] — 参考徐露允等(2017,管理学报)的方法构造的知识多元化稳健性度量,将核心指标的技术类别由IPC小类(前4位)替换为IPC大类(前3位,如A61),计算公式为:-Σ(p_i×ln(p_i)),p_i=P_i/P,P_i为截至当年包含IPC大类i的专利数量(多归属计数),P为累计专利总数。用于检验技术类别粒度对知识多元化测度的稳健性,数值随粒度变粗而系统性低于核心指标。
常见问题
- 「企业知识多元化(多归属Teachman熵)」是什么数据集?
- 企业知识多元化(多归属Teachman熵),隶属创新与知识产权。参考徐露允等(2017,管理学报)的方法,采用Teachman熵指数测度企业知识多元化,即企业专利知识基础所涉技术领域(IPC小类)的分散程度。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 15 个变量。核心指标包括:累计专利总数、技术类别数、知识多元化、知识多元化(大类粒度)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,817 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识多元化刻画企业知识基础所涉技术领域的分散程度。企业的专利组合可视为一张知识网络,每一项专利所标注的国际专利分类号(IPC)代表一类知识元素;企业专利覆盖的技术类别越多、且在各类别上的分布越均衡,其知识基础越多元,越有利于跨领域组合不同技术元素、为利用式与探索式创新提供更丰富的可能性。 本数据集参考徐露允等(2017)的方法,采用 Teachman 熵指数测度企业年度知识多元化。以 IPC 分类号前 4 位(小类,如 $A61K$)界定技术类别,对企业截至当年的专利存量计算: $$ \text{KnowledgeDiversification} = -\sum{i=1}^{n} pi \ln pi, \qquad pi = \frac{Pi}{P} $$ 其中 $Pi$ 为企业所有专利中"包含"技术类别 $i$ 的专利数量——由于一项专利往往同时标注多个 IPC 小类,凡包含该类别的专利均计入 $Pi$(一项专利的多个小类各计一次,即多归属计数);$P$ 为企业拥有的专利总数;$n$ 为企业专利涉及的全部技术类别数。该多归属口径下各类别占比之和 $\sumi pi \ge 1$,使熵值可超过标准香农熵的归一化上界 $\ln n$,是对企业以同一专利横跨多个技术领域这一事实的直接刻画。指标取值非负,越大代表企业知识基础越多元、涉足的技术领域越分散。 技术广度 $n$ 与累计专利总数 $P$ 作为计算链上的构件一并输出:前者(技术类别数)为企业专利涉及的不同 IPC 小类去重数量,后者(累计专利总数)即公式分母。为检验技术类别粒度对测度的影响,另以 IPC 前 3 位(大类,如 $A61$)重复上述熵计算,得到粒度更粗的稳健性度量,其数值随类别合并而系统性低于核心指标。 补充说明 - 专利范围限定为发明专利与实用新型,按专利申请年累计形成截至当年的知识存量;存量口径与原始文献一致,能够反映企业长期积累的知识基础。 - 样本覆盖全部上市公司年度面板。无专利企业,以及专利全部集中于单一技术类别的企业,知识多元化取 0;可借助同时输出的累计专利总数与技术类别数将"无专利(类别数为 0)"与"单一技术类别(类别数为 1)"两种零值情形加以区分。 - 累计存量口径下,知识多元化与企业专利规模存在固有的正向关联(技术类别随专利积累而增加)。将本指标用作回归中的解释变量或调节变量时,建议同时控制累计专利数(或其对数),以剥离纯规模效应、识别多元化本身的边际作用。 参考文献 - 徐露允, 曾德明, 李健. 知识网络中心势、知识多元化对企业二元式创新绩效的影响[J]. 管理学报, 2017, 14(2): 221-228. - Teachman J D. Analysis of population diversity: measures of qualitative variation[J]. Sociological Methods & Research, 1980, 8(3): 341-362.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。