数字技术创新(专利文本机器学习法)
「数字技术创新(专利文本机器学习法)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 96,335。 参考黄先海等(2023,数量经济技术经济研究)的专利文本机器学习方法测度的上市公司数字技术创新年度面板。
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 15 |
| 样本量 | 96,335 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- DigiInventCount [数字发明专利申请数] — 参考黄先海等(2023, 数量经济技术经济研究)的方法,计算公式为:该公司当年申请的数字技术领域发明专利去重件数。其中数字专利指依据《战略性新兴产业分类与国际专利分类参照关系表(2021)》中新一代信息技术产业五个中类所对应国际专利分类号识别出的发明专利,一件专利的任一分类号命中即计入。多主体联合申请的专利在各参与上市公司分别计入一次,同一公司同一申请号只计一次。
- SumInnovativeness [数字专利创新度之和] — 参考黄先海等(2023, 数量经济技术经济研究)的方法,计算公式为:该公司当年申请的数字发明专利中全部可计算创新度者的创新度之和,当年无此类专利时取0。专利创新度指该专利文本向量与前五年内全部数字专利文本向量平均余弦相似度的倒数取自然对数,取值越大表示对已有专利重复越少、原创内容越多。用于在数字专利件数相同的公司之间进一步区分数字技术水平高低。该加总值的量纲随参照专利池规模逐年变动,其水平不宜跨年比较。
- Digital [数字技术] — 参考黄先海等(2023, 数量经济技术经济研究)的方法,计算公式为:对该公司当年申请的数字技术领域发明专利件数作反双曲正弦变换,反双曲正弦变换的计算公式为:asinh(x)=ln(x+根号下(x的平方加1))。该变换用于缓解专利数据的偏态分布,且在取值为零时仍有定义。用作研究变量,越大代表企业数字技术应用与创新程度越高。
- IsDigitalUser [是否应用数字技术] — 参考黄先海等(2023, 数量经济技术经济研究)的方法,是否应用数字技术(0=否,1=是),当年申请过数字技术领域发明专利记为1,否则记为0。
常见问题
- 「数字技术创新(专利文本机器学习法)」是什么数据集?
- 数字技术创新(专利文本机器学习法),隶属创新与知识产权。参考黄先海等(2023,数量经济技术经济研究)的专利文本机器学习方法测度的上市公司数字技术创新年度面板。
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 15 个变量。核心指标包括:数字发明专利申请数、数字专利创新度之和、数字技术、是否应用数字技术。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,335 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的数字技术应用程度并不是一个具有客观衡量标准的概念。国内既有研究多以上市公司年度报告中数字技术关键词的出现次数来刻画企业数字化水平,但年报文本存在被企业主观操纵与自我包装的可能,其中的数字技术关键词可能源自企业为迎合市场、吸引投资而采取的策略性披露,未必反映真实的数字技术水平;而专利成果普遍被视为企业创新能力的真实反映。本数据集因此转向专利端,以企业当年申请的数字技术相关领域的发明专利衡量其数字技术创新程度,并进一步借助专利摘要文本的机器学习分析,给出企业所掌握数字专利的创新度水平。 第一步是识别数字专利。依据《战略性新兴产业分类与国际专利分类参照关系表(2021)》,把属于新一代信息技术产业之下的下一代信息网络产业、电子核心产业、新兴软件和新型信息技术服务、互联网与云计算及大数据服务、人工智能五个中类所对应国际专利分类号的专利识别为数字专利。参照关系表以单元格为单位给出纳入与排除两组分类号模式,排除项仅在其所属单元格内生效;每个模式按大类、小类、大组、小组四个层级逐级匹配,一件专利只要其任一国际专利分类号命中任一单元格的纳入模式且未被同单元格排除,即判定为数字专利。这里只考虑发明专利,原因在于发明专利需要经过严格的实质审查,相较于实用新型与外观设计专利而言其创新度更高,更能反映企业的数字技术成果;同时采用申请量而非授权量,因为申请量更接近企业当年的数字技术创新水平。 第二步是构造核心研究变量。把企业当年申请的数字发明专利件数汇总到企业—年层面;多主体联合申请的专利在各参与上市公司分别计入一次,同一公司同一申请号只计一次。为缓解专利数据的偏态分布对估计系数的影响,对件数作反双曲正弦变换,$\mathrm{asinh}(x)=\ln\left(x+\sqrt{x^2+1}\right)$,得到核心变量数字技术 $Digital$。相较于对数变换,反双曲正弦变换在取值为零时仍有定义,因而无须对未申请数字专利的企业—年作额外处理,也无须人为加一。同时给出反映企业当年是否申请过数字专利的二元变量,供需要以是否应用数字技术作分组依据的研究使用。 第三步是测算企业所掌握数字专利的创新度水平。以全部中国数字技术领域发明专利的中文摘要为语料,先做中文分词,再用词向量模型对分词后的语料作无监督训练。该模型通过上下文词语的位置关系分析语义,将原本高维稀疏的词语表示降维到一个低维稠密的向量空间。训练完成后,把每件专利的摘要文本表示为其所含词语向量的算术均值并作单位化处理,两件专利之间的语义相似度即为对应文本向量的余弦相似度 $\rho{ij}$。一项专利 $i$ 在年份 $t$ 的创新度定义为其与前五年内所有数字专利的平均语义相似度取倒数后的自然对数值: $$Innovativenessi^t=\ln\frac{N{Bt}}{\sum{j\in Bt}\rho{ij}}$$ 其中 $Bt$ 为第 $t-5$ 年至第 $t-1$ 年间申请的全部数字专利集合,$N{Bt}$ 为该集合的专利数量。该指标取值越大,反映一项专利技术的文本表达中对已有专利的重复越少、原创性的创新内容越多,即创新度越高。由于文本向量已作单位化处理,$\sum{j\in Bt}\rho{ij}$ 恒等于该专利向量与集合 $Bt$ 内全部专利向量之和的内积,因此分母可由逐年累加的向量一次内积精确求得,与逐对计算相似度再求和在数值上等价。把企业当年申请的各件数字专利的创新度加总,即得到企业—年层面的数字专利创新度之和,可在数字专利件数相同的企业之间进一步区分其数字技术水平的高低。 补充说明 - 数据集范围:本数据集刻画数字技术创新这一构念本身,即企业数字技术的应用程度与创新度水平。按创新度把数字专利进一步划分为颠覆性与渐进性两类的异质性测度不在本数据集范围内。 - 样本口径:以企业—专利申请年为观测单位,覆盖全部行业,未剔除金融业、未作缩尾、未施加任何回归样本限制;当年未申请数字专利的企业—年,件数与反双曲正弦变换值均为零。骨架仅包含企业实际发生专利活动的年份,并非平衡面板,"整行缺失"与"在表内且计数为零"含义不同;需要完整面板的使用者宜以自有企业—年全样本左连本表,再按各公司上市区间自行补零。建议加入行业与年份固定效应。 - 创新度的构念边界:创新度度量的是专利文本与前五年既有数字专利之间的不相似程度。文本距离大既可能来自真正的技术突破,也可能来自跨领域或位于数字技术边缘的专利——这类专利因某一分类号命中数字类目而进入语料,其文本自然远离语料中心。相应地,该指标与专利前向被引之间的关联很弱。关注技术影响力的研究宜将其与被引类指标并用。核心变量数字技术由件数变换而来,不受此影响。 - 分词与模型设定:原方法在通用词典之外补充了数字技术关键词库以及电子、机械、数学、物理、计算机和软件等领域的术语词库,其中术语词库无可稳定逐年获取的电子版,本数据集改以通用中文词典叠加数字化转型关键词库作为分词依据,部分专业复合术语因此被切分得更细;分词后剔除纯数字词元(摘要中的附图标记与序号),不另作停用词剔除,以减少原方法未规定的人为选择。词向量的维度、窗口宽度、训练轮数与文本池化方式原方法未披露,此处固定为一百维、窗口五、最低词频五、连续词袋结构、五轮训练并设定随机种子,文本向量取词向量算术均值后单位化。多线程训练不保证逐位复现,模型已按数据版本缓存,同一数据版本内结果稳定。 - 创新度无定义的专利:原方法以词向量替代了更早文献所用的非负词频向量,使文本向量之间的余弦可以取负值;当一件专利与参照集的相似度合计不为正,或其前五年参照集为空时,创新度的对数形式无定义;无中文摘要的数字专利不进入语料,同样没有创新度。此类专利不计入创新度之和,但仍计入数字发明专利申请数,因而不影响核心变量。此类情形在数字专利较少的企业、非数字核心行业与近年样本中相对更常见,方向上使创新度之和偏保守。 - 其他局限:发明专利自申请至公开存在法定滞后期,最近一至两个申请年可见的主要是请求提前公开的那部分,件数与核心变量在这两年偏低,作水平或跨年趋势解读时建议留出缓冲;专利与企业的对应沿用母子公司及联营关系口径,未按并表范围过滤,多主体联合申请的专利在各参与公司分别计入一次;创新度水平随参照专利池规模逐年变动,创新度之和的水平不宜跨年比较;分类号参照关系表按发布时点的产业口径编制,跨越较长历史区间使用时其产业边界与当时的技术形态存在差异。 参考文献 - 黄先海,王瀚迪,孙涌铭,等.数字技术与企业出口质量升级——来自专利文本机器学习的证据[J].数量经济技术经济研究,2023,40(12):69-89. - Kelly B, Papanikolaou D, Seru A, et al. Measuring technological innovation over the long run[J]. American Economic Review: Insights, 2021, 3(3): 303-320. - 吴非,胡慧芷,林慧妍,等.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。