企业多样化与专业化知识基础(IPC大类熵)

「企业多样化与专业化知识基础(IPC大类熵)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 96,328。 复现于飞等(2021,科研管理)一文的自变量企业知识基础(KB)。

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数23
样本量96,328
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentCount [专利申请数] — 企业当年申请且带有合法国际专利分类号的专利件数,即知识基础熵值计算公式中的分母。计算公式为:对企业当年申请且带有合法国际专利分类号的专利按申请号去重后计数。用作研究变量,建议与知识基础同时进入回归以剥离创新产出规模的机械影响。
  • TechClassCount [技术大类数] — 企业当年专利所涉及的国际专利分类三位大类的数量,即知识基础熵值计算公式中的技术类别总数。计算公式为:对企业当年全部专利的分类号取三位大类后去重计数。可用于区分熵值为零的两种情形:仅涉足单一技术领域,或各技术领域均覆盖全部专利。
  • AvgClassPerPatent [每件专利平均技术大类数] — 参考于飞等(2021,科研管理)的方法,计算公式为:各技术大类份额之和,等于企业当年每件专利平均涉及的技术大类数量。该值反映专利分类号的标注深度,用作研究变量,建议在回归中一并控制以剥离分类标注实践变化带来的机械波动。
  • PatentCount3Y [专利申请数_三年窗口] — 企业当年及此前两年合计申请且带有合法国际专利分类号的专利件数,即知识基础_三年窗口熵值计算公式中的分母。计算公式为:对当年及此前两年申请且带有合法国际专利分类号的专利按申请号去重后计数。用作研究变量,使用知识基础_三年窗口时应以本字段而非当年专利申请数控制创新产出规模。
  • TechClassCount3Y [技术大类数_三年窗口] — 企业当年及此前两年专利所涉及的国际专利分类三位大类的数量,即知识基础_三年窗口熵值计算公式中的技术类别总数。计算公式为:对当年及此前两年全部专利的分类号取三位大类后去重计数。
  • AvgClassPerPatent3Y [每件专利平均技术大类数_三年窗口] — 参考于飞等(2021,科研管理)的方法,计算公式为:三年窗口内各技术大类份额之和,等于当年及此前两年每件专利平均涉及的技术大类数量。与知识基础_三年窗口严格同口径,用作研究变量,使用该窗口口径指标时建议以本字段控制分类标注深度。
  • SharedPatentShare [共享专利占比] — 企业当年专利中同时被归属到其他上市公司的件数所占比例。计算公式为:当年归属主体不唯一的专利件数除以专利申请数,取值介于0与1之间,分子分母均与专利申请数同口径,即只计带有合法国际专利分类号的专利。该字段用于识别企业归属存疑的观测:专利与上市公司的对应关系由企业名称匹配建立,占比越高的观测其技术领域分布越可能反映的是其他公司,用作研究变量,建议在稳健性检验中筛除高占比观测。
  • KnowledgeBase [知识基础] — 参考于飞等(2021,科研管理)的方法,计算公式为:对企业当年每一个国际专利分类三位大类,以涉及该大类的专利件数占当年专利总件数的比例p,求各大类p×ln(1/p)之和;一件专利的分类号涉及多个大类时各大类各计一次。用作研究变量,越大代表企业知识基础的技术领域分布越分散、知识多样化程度越高,越小代表知识越聚焦于少数特定技术领域、知识专业化程度越高。
  • KnowledgeBaseSubclass [知识基础_小类粒度] — 参考于飞等(2021,科研管理)的方法,计算公式为:与知识基础同公式,但技术类别粒度由三位大类改为四位小类。用作稳健性检验变量,越大代表企业知识基础的技术领域分布越分散、知识多样化程度越高。
  • KnowledgeBaseUnique [知识基础_单归属] — 参考于飞等(2021,科研管理)的方法,计算公式为:与知识基础同公式,但一件专利只归入其主分类号所属的单一技术大类,使各技术大类的份额之和恒等于1;主分类号缺失或非法时回退到该专利全部分类号中出现次数最多的合法编码。用作稳健性检验变量,越大代表企业知识基础的技术领域分布越分散、知识多样化程度越高。
  • KnowledgeBaseInvention [知识基础_仅发明专利] — 参考于飞等(2021,科研管理)的方法,计算公式为:与知识基础同公式同粒度,但计算样本限定为发明专利。用作稳健性检验变量,越大代表企业知识基础的技术领域分布越分散、知识多样化程度越高。
  • KnowledgeBase3Y [知识基础_三年窗口] — 参考于飞等(2021,科研管理)的方法,计算公式为:与知识基础同公式同粒度,但计算窗口由当年改为当年及此前两年的三年滚动窗口,窗口内的专利件数与各技术大类件数均累加。用作稳健性检验变量,越大代表企业知识基础的技术领域分布越分散、知识多样化程度越高。

常见问题

「企业多样化与专业化知识基础(IPC大类熵)」是什么数据集?
企业多样化与专业化知识基础(IPC大类熵),隶属创新与知识产权。复现于飞等(2021,科研管理)一文的自变量企业知识基础(KB)。
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 23 个变量。核心指标包括:专利申请数、技术大类数、每件专利平均技术大类数、专利申请数_三年窗口、技术大类数_三年窗口、每件专利平均技术大类数_三年窗口、共享专利占比、知识基础、知识基础_小类粒度、知识基础_单归属、知识基础_仅发明专利、知识基础_三年窗口。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,328 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的知识基础指企业通过既往创新活动所积累的技术知识总和。按知识的横向范围与垂直深度,可以把知识基础划分为多样化与专业化两类:前者指知识元素广泛分布于多个技术领域,后者指知识聚焦于少数特定领域并在其中形成深度积累。两类知识基础对企业创新的作用方向长期存在争论——多样化拓展了企业的技术选择空间、增加了跨领域重组与试错的机会,但也可能分散研发资源、抬高异质性知识的整合成本;专业化有助于企业在特定领域获得前沿与系统的知识、深化技术的理解与应用,但也可能导致路径依赖,使企业陷入既有技术轨道的能力陷阱。由于这两者恰好是同一个分布的两端,本数据集以单一连续指标同时刻画:取值越大表示知识越分散、多样化程度越高,取值越小表示知识越聚焦、专业化程度越高,而不是构造两个彼此独立的变量。 测度以专利的国际专利分类号作为技术领域的代理。每一件专利按其申请年归入相应年度,其分类号被解析为合法的技术类别编码;主口径把编码的前三位视为一个技术大类,即一个独立的技术领域。一件专利的分类号可能同时落在多个技术大类上,此时该专利在每个涉及的大类中各计一次,同一个大类在同一件专利内不重复计数。 设企业 $i$ 在 $t$ 年申请且带有合法技术分类号的专利共 $N{it}$ 件,其中分类号涉及技术大类 $k$ 的专利有 $n{ikt}$ 件,则该大类的份额为 $p{ikt}=n{ikt}/N{it}$。知识基础定义为各技术大类份额的熵: $$KB{it}=\sum{k=1}^{M}p{ikt}\ln\frac{1}{p{ikt}}$$ 其中 $M$ 为企业当年专利所涉及的技术大类数量。份额在各大类之间分布得越均匀、所涉及的大类越多,熵值越大,对应多样化的知识基础;份额集中于少数几个大类时熵值趋近于零,对应专业化的知识基础。 这一定义有一个须知的性质:份额的分母是专利件数而非分类号次数,而一件专利可以同时计入多个大类,因此各大类份额之和并不等于一,而等于每件专利平均涉及的技术大类数,熵值也因此可以超过以类别数为底的对数上界。为使该性质可观测、可控制,数据集同时给出专利申请数、技术大类数与每件专利平均技术大类数三个中间量。三者中的第一个是上式的分母,第二个是上式的类别数,第三个即各份额之和。 围绕主口径提供四个替代度量,用于检验结论对测度选择的稳健性:把技术类别的粒度由三位大类改为四位小类;把一件专利只归入其主分类号所属的单一技术大类,使份额之和恒等于一、熵退化为标准形式(主分类号在早年大面积缺失,此时回退到该专利全部分类号中出现次数最多的合法编码,同次数时取排序在前者;回退结果与真实主分类号的一致率有限,因此该替代度量在早期年份存在口径过渡带,跨这几年的水平比较不成立。主口径与其余三个替代度量均不使用主分类号,不受此影响);把计算样本限定为发明专利;把计算窗口由当年改为当年及此前两年的三年滚动窗口。三年窗口口径另附同窗口的专利申请数、技术大类数与每件专利平均技术大类数,以便与该口径的熵值配套使用——窗口口径熵值的规模驱动量是窗口内的专利数而非当年专利数,用当年专利数去控制它并不充分。 补充说明 - 样本口径:覆盖全部板块与行业的上市公司,不预先施加原文的行业、规模或特别处理状态限制,使用者可自行按行业代码与年份截取子样本。当年没有带合法技术分类号的专利时份额分布无定义,熵值留缺失而不置零,计数类中间字段则置零。缺失在非专利密集行业更集中,建议加入行业与年份固定效应。 - 技术类别粒度:原文称技术类别为"IPC 大类",按国际专利分类的中文标准术语即三位编码,主口径据此实现。与原文报告的描述统计对照,水平值与离散程度无法在同一子样本上同时对上:四位小类口径在专利规模与原文样本相当的大型制造企业上接近原文均值,但离散程度偏低;全样本的离散程度与原文接近而均值明显更低;三位大类在任何子样本上均值都更低;把窗口读作专利存量亦无法复现原文标准差。原文未公布样本名单与专利规模分布,差异无法进一步归因,故两个粒度并列提供,不宜宣称其中之一复现了原文;两者秩相关很高,结论通常对粒度选择不敏感。 - 与专利规模的机械关联:熵度量份额分布的均匀程度,专利件数越多其取值上界与期望值越高。实测本指标与专利数对数高度相关,且在企业与年度双向去均值后仍占相当比例的方差;这是熵类指标的共有性质,原文亦未做规模调整。极端情形是当年仅一件专利时各份额均为一、熵恒为零,与该专利实际跨几个领域无关。因此作解释变量时应同时控制专利申请数与每件专利平均技术大类数,并建议以专利申请数不低于五件的子样本做主回归、全样本做稳健性检验。技术大类数可区分熵值为零的两种情形:只涉足单一领域,或所涉及的每个领域都覆盖了全部专利。 - 企业归属:专利与上市公司的对应关系由企业名称匹配建立,除上市公司本身与子公司外还含联营与合营企业,略宽于原文的母子公司合并口径;该关系按当前股权结构回溯至全部历史年份,面板也覆盖上市之前的年份,故早年观测反映的是当前集团口径下的历史专利。同一件专利可能同时归属多家上市公司,其中既有真实合资研发主体也有名称匹配误判,后者会把其他公司的技术组合整体计入本企业且偏向取值顶端,共享专利占比字段可据以筛除。以并购或上市为识别策略者应限定年份不早于上市年。 - 其他局限:专利自申请到公开有法定滞后,越晚的申请年收录越不完整,且实用新型的滞后长于发明专利,使末年专利类型构成发生结构性变化;其幅度随企业的实用新型倾向而不同,年度固定效应无法完全吸收,建议把样本窗口上端限定在数据截止年的前一至两年。专利分类号的标注深度存在全国性时间趋势,多归属口径的年度均值随之变动,年度变化不宜解读为技术结构的真实演变。部分公司存在新旧证券代码并存,可能被拆为两条记录且各自只携带部分专利。 参考文献 本数据集的公式与口径取自 [1] 的正文 1.3.2(1) 节; [2] 是 [1] 在该节标注的方法出处, 列出以便追溯方法源流, 本数据集并未另行套用该篇的原文公式。 [1]于飞,袁胜军,胡泽民.知识基础、知识距离对企业绿色创新影响研究[J].科研管理,2021,42(1):100-112. [2]刘岩,蔡虹,向希尧.企业技术知识基础多元度对技术合作的影响——技术创新能力的中介作用[J].系统管理学报,2016,25(2):203-210.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。