企业数字知识存量(三年滚动窗口)
「企业数字知识存量(三年滚动窗口)」,覆盖 1987-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 75,215。 复现黄先海和高亚兴(2025, 经济学动态)的核心解释变量DigiStock。
| 时间跨度 | 1987-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 75,215 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 指标测度所对应的年度(第t年)
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- DigiPatentApp [当年数字技术发明专利申请数] — 参考黄先海和高亚兴 (2025, 经济学动态)的方法,计算公式为:企业当年申请的数字技术发明专利件数。数字技术发明专利指国际专利分类主分类号命中《数字经济核心产业分类与国际专利分类参照关系表(2023)》所列分类号的发明专利。同一件专利在同一企业年度内只计1次;由多家上市公司联合申请的专利在各申请企业分别计1次,故按行业或地区跨企业加总时存在重复计数。因专利自申请至公开存在时滞,最近两个申请年度的件数尚未收录完全。
- DigiPatentStock3 [三年数字技术发明专利存量] — 参考黄先海和高亚兴 (2025, 经济学动态)的方法,计算公式为:企业在第t-3年、第t-2年、第t-1年三个年度内申请的数字技术发明专利件数合计。窗口在企业专利申请全历史上滚动,不受本数据集面板起始年度限制。
- DigiPatentStockCum [累计数字技术发明专利存量] — 参考黄先海和高亚兴 (2025, 经济学动态)调整测度窗口期的稳健性检验口径,计算公式为:企业自设立至第t-1年历年申请的数字技术发明专利件数累计合计。该指标按定义逐年不减。
- DigiStock [数字知识存量] — 参考黄先海和高亚兴 (2025, 经济学动态)与Wu和Shanley (2009, Journal of Business Research)的方法,计算公式为:ln(1+第t-3年至第t-1年申请的数字技术发明专利件数合计)。用作研究变量,越大代表企业在长期数字技术创新过程中积累的数字知识要素规模越大、整合内外部数字知识并将其转化应用于技术创新活动的能力越强。
- DigiStockCum [数字知识存量(累计口径)] — 参考黄先海和高亚兴 (2025, 经济学动态)表4调整数字知识存量测度窗口期的稳健性检验口径,计算公式为:ln(1+企业自设立至第t-1年累计申请的数字技术发明专利件数)。用作稳健性检验变量,越大代表企业累计积累的数字知识要素规模越大;该指标与三年窗口口径高度相关,且按定义逐年不减,在企业固定效应模型中接近企业特定趋势。
常见问题
- 「企业数字知识存量(三年滚动窗口)」是什么数据集?
- 企业数字知识存量(三年滚动窗口),隶属数字化转型与人工智能。复现黄先海和高亚兴(2025, 经济学动态)的核心解释变量DigiStock。
- 该数据集的时间范围是?
- 覆盖 1987-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:当年数字技术发明专利申请数、三年数字技术发明专利存量、累计数字技术发明专利存量、数字知识存量、数字知识存量(累计口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 75,215 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 知识基础理论认为,创新实质上是将现有知识获取、积累并重新整合,从而实现知识与技术不断迭代发展的过程。随着数字化转型的持续推进,数字知识成为企业知识结构中的重要组成部分:它不仅作用于数字技术自身的创新过程,还能渗透进传统实体技术的研发环节,优化创新流程或直接作为知识要素投入参与知识重组。企业的数字知识存量反映其在长期数字技术创新过程中积累的数字知识要素规模,也在一定程度上体现了企业整合内外部数字知识并将其转化应用于技术创新活动的能力。本数据集复现黄先海和高亚兴 (2025) 的核心解释变量,衡量企业层面的数字知识存量水平。 指标构建分为两步:先判定单件专利是否属于数字技术,再在企业—年度层面按时间窗口累积。 第一步是数字技术专利的识别。以企业申请的发明专利为总体,取每件专利的国际专利分类主分类号,与《数字经济核心产业分类与国际专利分类参照关系表(2023)》所提供的数字产业分类与国际专利分类对照关系进行匹配,命中者判定为数字技术专利,未命中者为实体技术专利。该对照表将数字经济核心产业划分为数字产品制造业、数字产品服务业、数字技术应用业、数字要素驱动业四个大类,并以三种粒度给出对照分类号:分类号后加星号表示包含该层级及以下的全部分类号,其中既有子类级的层级匹配(如 $H05K^{}$),也有主组级的层级匹配(如 $G06F1^{}$,此时要求主组号精确相等,故不会误匹配 $G06F15$ 之类的其他主组);不加星号者则表示该精确小组(如 $G05B19/418$)。识别时严格遵循上述星号语义。需要强调的是,判定依据是主分类号这一个分类号,而非专利著录的全部国际专利分类号集合——主分类号代表专利的核心技术归属,据此判定的口径较之"任一分类号命中即算"更为收敛。 第二步是知识存量的累积。计数以专利申请年度为准,同一件专利在同一企业年度内只计一次;若一项专利由多家上市公司共同申请,则在各申请企业分别计入一次。记企业 $i$ 在第 $\tau$ 年申请的数字技术发明专利件数为 $DigiPat{i\tau}$,核心指标取企业过去三年的数字技术专利数量加总后加一取自然对数: $$DigiStock{it}=\ln\left(1+\sum{\tau=t-3}^{t-1} DigiPat{i\tau}\right)$$ 窗口为第 $t-3$ 年至第 $t-1$ 年,不含当年,因而在时间维度上能够一定程度规避与后续创新产出之间的反向因果问题。窗口在企业专利申请的全部历史上滚动,不受本数据集面板起始年度的限制:即使某企业—年度未进入输出面板,其当年的专利申请仍会计入相邻年度的窗口。数据集同时给出该对数变换前的三年专利件数合计,以及作为被加项的当年数字技术发明专利申请数,便于使用者核对分子或自行改用其他窗口长度。 由于不同类别的数字知识对企业创新活动的影响期限可能存在异质性,原文在稳健性检验中调整了测度窗口期,将企业从设立到第 $t-1$ 年的所有数字技术专利数量加总作为替代测度指标。本数据集据此给出累计口径 $DigiStockCum{it}=\ln\left(1+\sum{\tau\le t-1} DigiPat{i\tau}\right)$ 及其对数变换前的累计件数。该累计以专利库可得的全部申请历史实现——专利申请不可能早于企业设立,故与原文定义等价。 数据集的观测单元为企业—年度。样本门设定为第 $t-1$ 年该企业已有发明专利申请记录,即样本条件与测度窗口的末端严格对齐;在此口径下,指标取零意味着企业已进入发明专利活动但三年窗口内没有数字技术专利,零值含义单一。 补充说明 - 样本口径:本数据集不预先施加原文回归样本所用的筛选(剔除金融业、ST 类、年龄小于一年、总资产小于总负债的企业)与连续变量的双边缩尾,也不限定年份区间,使用者可按研究设计自行施加。样本门要求企业在第 $t-1$ 年已有发明专利申请记录,从未申请过发明专利的企业不进入样本,早期年度对在市公司整体的覆盖率明显低于后期;面板同时包含企业上市之前的企业—年度,这部分观测的数字知识存量水平系统性低于上市后观测,与财务、市值类变量匹配时会有相当比例无法匹配。 - 分类号可得性:主分类号缺失的发明专利无法判定技术归属,一律计为非数字技术。该缺失强烈时变,在样本期早段比例很高而后期趋近于零,会使早期年度的存量被系统性低估,并使早期到中期的水平上升中包含一部分由分类号可得性改善造成的成分。建议将样本起点设在分类号缺失已降至低位的年份,并加入年份固定效应。 - 识别口径的宽度:官方对照表包含多条子类级通配条目,涵盖电池、合金、材料分析、激光焊接等子类,因此被判定为数字技术的发明专利占比较高,相当比例落在非信息通信技术小类。这是原文所引官方对照表的固有性质,本数据集忠实沿用。由此,本指标与企业专利总规模存在明显共线性,在回归中建议同时控制专利总量或改用数字专利占比作为稳健性检验。 - 专利归属:专利与上市公司的关联通过企业名称匹配建立,涵盖母公司、子公司以及参股与合营公司的申请,较之直接检索单一上市主体的口径更为稠密,存量水平相应偏高。名称归属名录为当前时点的快照而无年份维度,后期并购进入的主体其早年专利会被计入母公司的早年存量,对存量类指标构成前视性质的影响。联合申请在各上市主体分别计入,企业层面口径正确,但按行业或地区跨企业加总时存在重复计数。 - 方法性质:三年重叠窗口使指标存在机械的序列相关,自相关在滞后三期处归零,且组间方差占比明显高于组内方差,回归时须采用企业层面聚类标准误。累计口径与三年窗口口径高度相关且按定义逐年不减,在企业固定效应模型中接近企业特定趋势,它复现的是原文对测度窗口期的稳健性检验,不宜据此推断结论对测度方式整体稳健。 - 其他局限:专利自申请至公开存在约一年半的时滞,最近两个申请年度的专利尚未收录完全,当年数字技术发明专利申请数在这两年明确下偏,三年窗口指标受影响较小;面板沿用的专利年度骨架本身对少数企业存在中间年度缺行,滚动窗口在企业内连续年度网格上计算不受影响,但输出面板并非严格平衡。 参考文献 - 黄先海,高亚兴.数字知识存量、数实技术融合与企业实体技术创新边界[J].经济学动态,2025,(3):36-53. - Wu J, Shanley M T. Knowledge stock, exploration, and innovation: Research on the United States electromedical device industry[J]. Journal of Business Research, 2009, 62(4): 474-483. - 黄先海,高亚兴.数实产业技术融合与企业全要素生产率——基于中国企业专利信息的研究[J].中国工业经济,2023,(11):118-136.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。