企业技术专业化与多样化

「企业技术专业化与多样化」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 96,731。 复现王慧扬等(2026, 科学学研究)一文的两个中介变量。

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数19
样本量96,731
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • PatentCount [专利申请总数] — 企业当年申请且具有合法国际专利分类号的专利件数,含发明专利与实用新型,为技术专业化指标的技术分布基数。单位:件
  • SubclassCount [技术小类数] — 企业当年申请专利所覆盖的国际专利分类四位小类(如G06F)的数量,即技术专业化计算公式中的类别个数n。因技术专业化指标随技术广度递增,跨企业比较时建议同时控制本字段或据此设定最小门槛。单位:个
  • InventionPatentCount [发明专利申请数] — 企业当年申请且具有合法国际专利分类号的发明专利件数,为技术多样化指标中各技术大类专利数比重的分母。单位:件
  • TechClassCount [技术大类数] — 企业当年申请发明专利所覆盖的国际专利分类三位大类(如G06)的数量,即技术多样化计算公式中的类别个数m,同时构成技术多样化取值的自然上界。单位:个
  • TSP [技术专业化] — 参考王慧扬等(2026, 科学学研究)的方法,以技术集中度表征技术专业化,计算公式为:企业当年各技术小类专利数占专利申请总数比值的变异系数,即这n个比值的总体标准差除以其算术平均值,技术小类为国际专利分类四位小类,一件专利按其主分类号归入唯一技术小类。该指标度量各技术小类份额偏离均匀分布的程度,在给定技术小类数时随技术分布的集中程度递增,但其取值上界随技术小类数抬升,因而跨企业比较时应同时控制技术小类数或专利规模;企业当年仅覆盖一个技术小类时取值为0。用作研究变量,越大代表企业专利在各技术小类之间的分布越不均衡。单位:无量纲
  • TDI [技术多样化] — 参考王慧扬等(2026, 科学学研究)的方法,计算公式为:各技术大类专利数比重与其倒数对数之积的求和,即sum(p_a乘以ln(1/p_a)),其中p_a为企业当年申请的发明专利中隶属技术大类a的专利数占发明专利申请总数的比重,技术大类为国际专利分类三位大类,一件专利按其主分类号归入唯一技术大类。取值范围为0至技术大类数的自然对数。用作研究变量,越大代表企业当年的技术布局越分散于多个技术领域。单位:无量纲(熵值)
  • TSPClass [技术专业化_大类粒度] — 技术专业化的稳健性口径,与核心口径同公式同样本,仅将技术类别粒度由国际专利分类四位小类改为三位大类,计算公式为:企业当年各技术大类专利数占专利申请总数比值的变异系数。用于检验核心指标对技术类别粒度的敏感性。单位:无量纲
  • TDISubclass [技术多样化_小类粒度] — 技术多样化的稳健性口径,与核心口径同公式同样本,仅将技术类别粒度由国际专利分类三位大类改为四位小类,计算公式为:sum(p_j乘以ln(1/p_j)),其中p_j为企业当年申请的发明专利中隶属技术小类j的专利数比重。因小类是大类的细分,本字段取值不低于核心口径。用于检验核心指标对技术类别粒度的敏感性。单位:无量纲(熵值)

常见问题

「企业技术专业化与多样化」是什么数据集?
企业技术专业化与多样化,隶属创新与知识产权。复现王慧扬等(2026, 科学学研究)一文的两个中介变量。
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:专利申请总数、技术小类数、发明专利申请数、技术大类数、技术专业化、技术多样化、技术专业化_大类粒度、技术多样化_小类粒度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,731 条观测。
数据是如何测算/获取的?
指标定义与计算方法 科技领军企业把知识搜索转化为关键核心技术突破,往往沿着两条方向相反却并行不悖的路径展开:一条是把研发资源持续压向少数优势技术方向,在特定领域积累难以模仿的深度,形成技术壁垒;另一条是在多个技术领域同时布局,用不同技术路线之间的交叉验证与风险分散来支撑技术瓶颈的攻克。本数据集把这两条路径分别操作化为技术专业化与技术多样化两个指标,二者共用同一份专利技术分类分布,前者刻画该分布的不均衡程度,后者刻画其广度。 计算的起点是把每一件专利归入唯一的技术类别。专利的国际专利分类号常有多个,本数据集统一以主分类号所属类别为准:主分类号可用时直接采用其四位小类(形如部首字母加两位数字再加一位字母,例如 G06F),三位大类取其前三位(例如 G06);主分类号缺失或格式非法时,回退到该专利全部分类号中出现次数最多的合法四位小类,同次数时取字典序在前者以保证结果确定。这一单一归属的处理使各技术类别的份额之和恰为一,是熵指标成立的前提。专利按申请年归入年度,与原文"当年申请"的口径一致。 技术专业化以技术集中度表征。设企业 $i$ 在第 $t$ 年申请的专利中,归入技术小类 $j$ 的有 $N{itj}$ 件,当年专利申请总数为 $N{it}$,该企业当年共覆盖 $n$ 个技术小类,则各小类的份额为 $p{itj}=N{itj}/N{it}$,技术专业化即这 $n$ 个份额的变异系数: $$TSP{it}=\frac{\sqrt{\frac{1}{n}\sum{j=1}^{n}\left(p{itj}-\bar{p}{it}\right)^{2}}}{\bar{p}{it}},\qquad \bar{p}{it}=\frac{1}{n}\sum{j=1}^{n}p{itj}$$ 其中标准差取总体口径(除以 $n$)。变异系数对分母为尺度不变,因此用各小类的份额计算与直接用各小类的专利件数计算完全等价。该指标的分母口径覆盖企业当年申请的全部专利,含发明专利与实用新型。 技术多样化则在发明专利上计算。设企业 $i$ 在第 $t$ 年申请的发明专利中隶属技术大类 $a$ 的有 $N{ita}$ 件,当年发明专利申请总数为 $N{it}$,共覆盖 $m$ 个技术大类,则 $$TDI{it}=\sum{a=1}^{m}p{ita}\ln\!\left(\frac{1}{p{ita}}\right),\qquad p{ita}=\frac{N{ita}}{N{it}}$$ 这是各技术大类份额的香农熵,取值下界为零(全部发明专利落在同一技术大类),上界为 $\ln m$,越大表示企业当年的技术布局越分散于多个技术领域。 原文对两个指标使用了不同的技术类别粒度——专业化用四位小类、多样化用三位大类,本数据集据此各给出一个互换粒度的稳健性口径:技术专业化的大类粒度版本把变异系数改在三位大类上计算,技术多样化的小类粒度版本把香农熵改在四位小类上计算,两者的样本与公式均与对应的核心口径完全一致。由于小类是大类的细分,小类粒度的熵在任何观测上都不低于大类粒度的熵。数据集同时给出参与计算的四个中间量:专利申请总数、技术小类数 $n$、发明专利申请数与技术大类数 $m$,供使用者按技术广度筛选样本或在回归中加以控制。 补充说明 - 样本口径:面板覆盖全部 A 股上市公司的企业-年,不预先施加行业剔除、缩尾或规模筛选。当年没有专利的企业年无法定义份额分布,两个指标留缺失而非置零(四个计数中间字段仍置零,零专利是可观测事实);缺失集中在金融、房地产、批发零售等非专利密集行业,直接回归会静默收敛为"有专利企业"的选择性子样,建议使用者显式声明样本范围。 - 技术专业化必须与技术广度同时使用:变异系数度量的是各技术小类份额偏离均匀分布的程度,而非份额有多集中。由恒等式 $TSP=\sqrt{n\cdot HHI-1}$ 可见,给定技术小类数 $n$ 时该指标严格随份额的赫芬达尔指数递增、方向正确,但其上界 $\sqrt{n-1}$ 随 $n$ 抬升,使跨企业比较主要由技术广度驱动;两端还会重合——只覆盖一个技术小类(最专业化)与各小类完全均匀(最分散)时取值同为零。原文样本为一百余家大型科技领军企业,技术小类数普遍很大且同质,该性质基本不显现;在全 A 股面板上则十分明显。建议在回归中同时控制技术小类数或专利规模,或设定最小技术小类数门槛后再估计;原文的控制变量组不含专利规模,直接照搬会把技术广度的效应记到技术专业化头上。 - 技术类别单归属:原文的份额定义要求各类别份额之和为一,即一件专利只能归入一个技术类别,但未说明多分类号专利如何归属,本数据集统一按主分类号处理,代价是丢弃副分类号信息。改用全部分类号多归属重算的结果与本口径高度一致,因为多数专利本就只有一个四位小类。主分类号缺失时的回退规则经反事实检验选定,其技术领域分布偏差小于按字典序取最小的做法。 - 与原文样本的可比性:原文以有效期内高新技术企业、营业规模与增速、研发强度和 ESG 评级等条件筛出一百余家科技领军企业,且未报告这两个中介变量的描述统计,因此不存在可对标的水平值;本数据集为全 A 股面板,量级与原文回归表中相应方程的常数项一致。 - 其他局限:专利自申请到公开有法定滞后,越晚的申请年收录越不完整,且实用新型的滞后长于发明专利,建议把样本窗口上端限定在数据截止年的前一至两年;一件专利若同时关联多家上市公司则按项目惯例向各主体分别计入,少数企业年的技术分布因此同时反映了多家企业,其两个指标均系统性偏高;面板包含企业上市之前的年份,且专利归属按当前母子公司与参股关系回溯至全部历史年份,研究上市前后变化或以并购为识别策略者应自行限定年份下界;本数据集与既有的技术多元化、技术网络结构类指标共用专利技术分类分布这一底层信息,彼此高度相关,不宜同时进入同一回归。 参考文献 本数据集两个指标的公式与口径全部取自第一篇文献的正文;后两篇是该文在相应段落标注的方法出处,列出以便追溯方法源流,本数据集并未另行套用这两篇的原文公式。 - 王慧扬,刘建华,赵玉冰.知识搜索与科技领军企业关键核心技术突破[J].科学学研究,2026,44(6):1264-1275. - 王海花,孙倩如,刘黎,等.专精特新企业技术专业化与关键核心技术突破[J].科学学研究,2026,44(1):141-153. - 贺建风,吴慧.市场化进程、技术多元化与企业创新绩效[J].经济经纬,2025,42(1):106-119.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。