数字知识领域异质性
「数字知识领域异质性」,覆盖 1987-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 75,215。 参考黄先海、高亚兴(2025, 经济学动态)的方法,按国家知识产权局《数字经济核心产业分类与国际专利分类参照关系表(2023)》的四个大类,分别测度企业在数字产
| 时间跨度 | 1987-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 23 |
| 样本量 | 75,215 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- DigiPatentApp01 [当年数字产品制造业数字技术发明专利申请数] — 企业当年申请且国际专利分类主分类号归属数字经济核心产业分类数字产品制造业大类的发明专利件数。一项专利由多家企业共同申请时,在各申请企业分别计入1件。
- DigiPatentApp02 [当年数字产品服务业数字技术发明专利申请数] — 企业当年申请且国际专利分类主分类号归属数字经济核心产业分类数字产品服务业大类的发明专利件数。一项专利由多家企业共同申请时,在各申请企业分别计入1件。
- DigiPatentApp03 [当年数字技术应用业数字技术发明专利申请数] — 企业当年申请且国际专利分类主分类号归属数字经济核心产业分类数字技术应用业大类的发明专利件数。一项专利由多家企业共同申请时,在各申请企业分别计入1件。
- DigiPatentApp04 [当年数字要素驱动业数字技术发明专利申请数] — 企业当年申请且国际专利分类主分类号归属数字经济核心产业分类数字要素驱动业大类的发明专利件数。一项专利由多家企业共同申请时,在各申请企业分别计入1件。
- DigiPatentStock01 [数字产品制造业三年数字技术发明专利存量] — 参考黄先海、高亚兴(2025, 经济学动态)的方法,计算公式为:第t-3年至第t-1年企业申请的数字产品制造业数字技术发明专利件数之和。
- DigiPatentStock02 [数字产品服务业三年数字技术发明专利存量] — 参考黄先海、高亚兴(2025, 经济学动态)的方法,计算公式为:第t-3年至第t-1年企业申请的数字产品服务业数字技术发明专利件数之和。
- DigiPatentStock03 [数字技术应用业三年数字技术发明专利存量] — 参考黄先海、高亚兴(2025, 经济学动态)的方法,计算公式为:第t-3年至第t-1年企业申请的数字技术应用业数字技术发明专利件数之和。
- DigiPatentStock04 [数字要素驱动业三年数字技术发明专利存量] — 参考黄先海、高亚兴(2025, 经济学动态)的方法,计算公式为:第t-3年至第t-1年企业申请的数字要素驱动业数字技术发明专利件数之和。
- DigiStock01 [数字知识存量(数字产品制造业)] — 参考黄先海、高亚兴(2025, 经济学动态)与Wu & Shanley (2009, JBR)的方法,计算公式为:ln(1+第t-3年至第t-1年企业申请的数字产品制造业数字技术发明专利件数之和)。用作研究变量,越大代表企业在数字产品制造业领域积累的数字知识要素规模越大。
- DigiStock02 [数字知识存量(数字产品服务业)] — 参考黄先海、高亚兴(2025, 经济学动态)与Wu & Shanley (2009, JBR)的方法,计算公式为:ln(1+第t-3年至第t-1年企业申请的数字产品服务业数字技术发明专利件数之和)。用作研究变量,越大代表企业在数字产品服务业领域积累的数字知识要素规模越大。
- DigiStock03 [数字知识存量(数字技术应用业)] — 参考黄先海、高亚兴(2025, 经济学动态)与Wu & Shanley (2009, JBR)的方法,计算公式为:ln(1+第t-3年至第t-1年企业申请的数字技术应用业数字技术发明专利件数之和)。用作研究变量,越大代表企业在数字技术应用业领域积累的数字知识要素规模越大。
- DigiStock04 [数字知识存量(数字要素驱动业)] — 参考黄先海、高亚兴(2025, 经济学动态)与Wu & Shanley (2009, JBR)的方法,计算公式为:ln(1+第t-3年至第t-1年企业申请的数字要素驱动业数字技术发明专利件数之和)。用作研究变量,越大代表企业在数字要素驱动业领域积累的数字知识要素规模越大。
常见问题
- 「数字知识领域异质性」是什么数据集?
- 数字知识领域异质性,隶属数字化转型与人工智能。参考黄先海、高亚兴(2025, 经济学动态)的方法,按国家知识产权局《数字经济核心产业分类与国际专利分类参照关系表(2023)》的四个大类,分别测度企业在数字产
- 该数据集的时间范围是?
- 覆盖 1987-2025 年。
- 包含哪些变量/指标?
- 共 23 个变量。核心指标包括:当年数字产品制造业数字技术发明专利申请数、当年数字产品服务业数字技术发明专利申请数、当年数字技术应用业数字技术发明专利申请数、当年数字要素驱动业数字技术发明专利申请数、数字产品制造业三年数字技术发明专利存量、数字产品服务业三年数字技术发明专利存量、数字技术应用业三年数字技术发明专利存量、数字要素驱动业三年数字技术发明专利存量、数字知识存量(数字产品制造业)、数字知识存量(数字产品服务业)、数字知识存量(数字技术应用业)、数字知识存量(数字要素驱动业)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 75,215 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识存量是企业内部技术知识水平的静态表现,反映企业在特定时点的知识创造情况与潜在创新能力。随着数字化转型的持续推进,企业由数字技术创新成果积累形成的数字知识,已成为其知识结构中的重要组成部分。数字知识存量刻画的正是企业在长期数字技术创新过程中积累的数字知识要素规模,也在一定程度上体现企业整合内外部数字知识、并将其转化应用于技术创新活动的能力。 与总量意义上的数字知识存量不同,本数据集关注的是数字知识所涉领域的结构差异。企业的数字知识可能集中于硬件制造环节,也可能集中于技术应用或数据要素开发环节,不同领域的数字知识在参与知识重组、推动实体技术创新时所发挥的作用未必相同。因此,本数据集在识别专利是否属于数字技术的基础上,依据国际专利分类与数字经济核心产业大类之间的对照关系,分别测度企业在数字产品制造业、数字产品服务业、数字技术应用业、数字要素驱动业四个大类领域内的数字知识存量水平,供研究者作为并列的解释变量分别纳入模型,考察数字知识领域差异带来的异质性影响。 测度的第一步是识别数字技术专利及其所属领域。对企业申请的每一件发明专利,取其国际专利分类主分类号(即该专利的首要技术归属,而非其全部分类号),与国家知识产权局发布的《数字经济核心产业分类与国际专利分类参照关系表(2023)》所提供的对照关系进行匹配。匹配严格遵循该对照表的层级注解:分类号后标有星号的,表示包括该层级及其以下的全部分类号,据此分为子类级匹配(如 H05K 星号条目涵盖整个 H05K 子类)与主组级匹配(如 G06F1 星号条目涵盖 G06F1 主组下的全部小组,但不涉及 G06F15 等其他主组);未标星号的,则仅匹配该条目指定的精确小组。主组级匹配要求主组号精确相等,以避免前缀相同的不同主组被误纳。对照表中的每一条目均带有其所属的数字经济核心产业大类编号,据此为四个大类各自建立独立的三级匹配表,逐一判定每件专利在各大类上的归属。 在此基础上,令 $DigiPat{k,i\tau}$ 表示企业 $i$ 在第 $\tau$ 年申请的、主分类号归属大类 $k$ 的发明专利件数,其中 $k$ 取数字产品制造业、数字产品服务业、数字技术应用业、数字要素驱动业四个大类之一。同一件专利由多家企业共同申请时,在各申请企业处分别计入一件。企业在第 $t$ 年的分领域数字知识存量定义为其在过去三年内该领域专利申请数量的加总,加一后取自然对数: $$DigiStock{k,it}=\ln\left(1+\sum{\tau=t-3}^{t-1} DigiPat{k,i\tau}\right)$$ 采用第 $t-3$ 年至第 $t-1$ 年的滞后窗口,一方面使知识存量刻画的是企业在当期决策之前已经积累的知识基础,避免与当期创新产出同期决定;另一方面,三年窗口既能反映近期的知识积累强度,又不至于让久远年份的陈旧技术知识过度影响当期水平。加一取对数则用于处理零值观测并压缩专利数量的右偏分布。滚动窗口在企业专利申请的完整历史上推进,不受输出面板起始年份的限制,因此面板首年的存量同样使用其真实的前三年申请记录计算。 数据集同时提供计算链上的两组中间量:各领域当年的数字技术发明专利申请数,以及各领域三年窗口内的专利存量计数。前者是上式求和号内的被加项,研究者可据此自行改用其他窗口期(如五年)构造稳健性检验;后者是取对数之前的原始计数,可用于核对或改用其他函数形式。 补充说明 - 四个领域为可重叠归属,不可相加还原总量:官方对照表中部分国际专利分类号同时归属两个及以上的数字经济核心产业大类(如 G06F1 相关条目同时出现在三个大类之下),因此同一件专利可以同时计入多个领域,四个领域的存量之和大于企业数字技术专利总量。这是对照表本身的结构使然,也与原文将四个变量分别纳入模型独立回归的用法一致,但四列不构成对总量的一次分解。 - 数字产品制造业一列与总量口径高度接近:官方对照表将 G06F 整个子类划入数字产品制造业大类之下,使该大类覆盖的分类号范围远广于其余三类,其存量与数字技术专利总量高度接近。原文表 7 中该列的回归系数、标准误与拟合优度同基准回归结果几乎完全一致,亦印证了这一点。研究者应将四列视为高度共线的重叠口径,而非四个相互独立的维度;以该列所作的估计不宜解读为对总量口径基准结论的独立检验。 - 数字产品服务业一列的构念边界:该大类在官方对照表中对应的分类号条目数量最少,且绝大部分集中于商业方法类分类号,因而该列实质刻画的是商业方法类专利的积累,与"数字产品批发零售租赁维修"的产业含义存在距离,其非零观测的比例也是四列中最低的。原文表 7 中该列亦是标准误最大、显著性最弱的一列,与此方向一致。使用时建议关注其组内变异是否足以支撑固定效应估计。 - 样本口径:数据集不预先剔除金融业、ST 类、成立年限或资不抵债的企业样本,也不做缩尾处理——这些属于回归样本的构造环节,由使用者按研究设计自行施加。样本收录企业进入发明专利活动之后的年度,即当测度窗口内该企业已有专利申请记录时方才进入;据此被排除的年度按构造四个领域的存量均为零,若与使用完整面板骨架的被解释变量匹配,未匹配的年度应按零补齐而非按缺失丢弃。面板自企业首个专利申请年起算,因而包含部分企业上市之前的年度,若研究设计要求严格的上市公司样本,应按上市日期另行过滤。 - 其他局限:专利数据经企业名称匹配构建,覆盖上市公司本身及其子公司,亦包含不并表的联营与合营企业,相对直接检索专利公报的口径更为稠密,存量水平相应略偏高;少数发明专利因缺失主分类号而无法判定领域归属,一律不计入任何领域,且这类缺失在早期年份更为普遍,会使早期年度的存量偏低估;由于专利自申请至公开存在约十八个月的间隔,最近年度的申请量尚未完全公开,末期年度的存量相应偏低,建议研究样本终止于倒数第二个年度。 参考文献 - 黄先海,高亚兴.数字知识存量、数实技术融合与企业实体技术创新边界[J].经济学动态,2025,(3):36-53. - Wu J, Shanley M T. Knowledge stock, exploration, and innovation: Research on the United States electromedical device industry[J]. Journal of Business Research, 2009, 62(4): 474-483. - 黄先海,高亚兴.数实产业技术融合与企业全要素生产率——基于中国企业专利信息的研究[J].中国工业经济,2023,(11):118-136.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。