企业颠覆性与渐进性数字技术(Word2Vec专利创新度)

「企业颠覆性与渐进性数字技术(Word2Vec专利创新度)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 27 个变量,样本量约 96,335。 基于专利文本机器学习测度上市公司数字技术创新的创新度异质性。

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数27
样本量96,335
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • DigitalPatentCount [数字发明专利申请数] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的发明专利中,国际专利分类号属于新一代信息技术产业(下一代信息网络产业、电子核心产业、新兴软件和新型信息技术服务、互联网与云计算及大数据服务、人工智能)的发明专利的件数。企业自身及其母公司、子公司、联营企业与合营企业的申请合并计入。
  • ScoredDigitalPatentCount [可评定创新度的数字专利申请数] — 上述数字发明专利中成功算得专利创新度的件数。摘要有效词全部不在词向量词表内、或所处年份的前五年基准专利集过小时,该件专利无法评定创新度,既不计入颠覆性也不计入渐进性,故本字段可能小于数字发明专利申请数。
  • DisruptiveDigitalPatentCount [颠覆性数字专利申请数] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的数字发明专利中,专利创新度达到全部数字专利创新度第90百分位的件数。专利创新度的计算公式为:ln(前五年数字专利件数/该专利与前五年全部数字专利的语义相似度之和),语义相似度取两件专利摘要文档向量的余弦值,文档向量由中国全量数字技术领域发明专利摘要训练的词向量按词平均得到。
  • IncrementalDigitalPatentCount [渐进性数字专利申请数] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的数字发明专利中,专利创新度未达到全部数字专利创新度第90百分位的件数。专利创新度的计算公式为:ln(前五年数字专利件数/该专利与前五年全部数字专利的语义相似度之和),语义相似度取两件专利摘要文档向量的余弦值,文档向量由中国全量数字技术领域发明专利摘要训练的词向量按词平均得到。
  • SumInnovativeness [数字专利创新度之和] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:企业当年申请的全部可评定创新度的数字专利,其创新度的加总。专利创新度的计算公式为:ln(前五年数字专利件数/该专利与前五年全部数字专利的语义相似度之和),语义相似度取两件专利摘要文档向量的余弦值,文档向量由中国全量数字技术领域发明专利摘要训练的词向量按词平均得到。用于在数字技术水平取值相同时进一步比较企业间高低。
  • Digital [数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(数字发明专利申请数+根号(数字发明专利申请数的平方+1)),即对申请件数作反双曲正弦变换以缓解取值的右偏分布。用作研究变量,越大代表企业当年的数字技术创新水平越高。
  • DigitalR [颠覆性数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(颠覆性数字专利申请数+根号(颠覆性数字专利申请数的平方+1)),即对颠覆性数字专利件数作反双曲正弦变换。企业当年数字专利全部无法评定创新度时取空值。用作研究变量,越大代表企业当年取得的高创新度数字技术成果越多。
  • DigitalI [渐进性数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(渐进性数字专利申请数+根号(渐进性数字专利申请数的平方+1)),即对渐进性数字专利件数作反双曲正弦变换。企业当年数字专利全部无法评定创新度时取空值。用作研究变量,越大代表企业当年在既有技术基础上作边际改进的数字技术成果越多。
  • RatioR [颠覆性数字专利占比] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:颠覆性数字专利申请数除以数字发明专利申请数。企业当年未申请数字专利、或数字专利全部无法评定创新度时取空值。用作研究变量,越大代表企业数字技术成果中高创新度成分的比重越高。
  • IsDigitalUser [是否应用数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,判定企业当年是否应用数字技术(0=否,1=是),计算公式为:数字发明专利申请数大于零时取1,否则取0。
  • IsHighDigital [是否数字技术水平高组] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,判定企业当年是否属于数字技术水平高组(0=否,1=是),计算公式为:在应用数字技术的企业年样本内按数字技术取值由高到低排序,取值相同时进一步按数字专利创新度之和由高到低排序,位次居前一半时取1,否则取0。未应用数字技术的企业年取0。
  • IsLowDigital [是否数字技术水平低组] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,判定企业当年是否属于数字技术水平低组(0=否,1=是),计算公式为:在应用数字技术的企业年样本内按数字技术取值由高到低排序,取值相同时进一步按数字专利创新度之和由高到低排序,位次居后一半时取1,否则取0。未应用数字技术的企业年取0。
  • DigitalSolo [独立申请数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(独立申请数字专利件数+根号(独立申请数字专利件数的平方+1))。独立申请指该件专利的全部申请人均为该上市公司自身或其母公司、子公司、联营企业与合营企业。用作研究变量,越大代表企业自主完成的数字技术创新越多。
  • DigitalJoint [联合申请数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(联合申请数字专利件数+根号(联合申请数字专利件数的平方+1))。联合申请指该件专利的申请人中存在不属于该上市公司关联体系的主体。用作研究变量,越大代表企业与外部主体合作完成的数字技术创新越多。
  • DigitalFusion [融合领域数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(融合领域数字专利件数+根号(融合领域数字专利件数的平方+1))。融合领域指该件专利的国际专利分类号既包含新一代信息技术产业类目,又包含其他产业类目。用作研究变量,越大代表企业跨产业结合的数字技术创新越多。
  • DigitalSingle [单一领域数字技术] — 参考黄先海等 (2023, 数量经济技术经济研究)的方法,计算公式为:ln(单一领域数字专利件数+根号(单一领域数字专利件数的平方+1))。单一领域指该件专利的国际专利分类号全部属于新一代信息技术产业类目。用作研究变量,越大代表企业聚焦于数字技术本身的创新越多。

常见问题

「企业颠覆性与渐进性数字技术(Word2Vec专利创新度)」是什么数据集?
企业颠覆性与渐进性数字技术(Word2Vec专利创新度),隶属创新与知识产权。基于专利文本机器学习测度上市公司数字技术创新的创新度异质性。
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 27 个变量。核心指标包括:数字发明专利申请数、可评定创新度的数字专利申请数、颠覆性数字专利申请数、渐进性数字专利申请数、数字专利创新度之和、数字技术、颠覆性数字技术、渐进性数字技术、颠覆性数字专利占比、是否应用数字技术、是否数字技术水平高组、是否数字技术水平低组、独立申请数字技术、联合申请数字技术、融合领域数字技术、单一领域数字技术。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,335 条观测。
数据是如何测算/获取的?
指标定义与计算方法 数字技术的经济后果不仅取决于企业是否应用了数字技术,还取决于所掌握数字技术的创新程度。在现有技术轨道上作边际改进的渐进性技术,与开辟全新技术领域、能够重塑原有技术形态的颠覆性技术,对企业生产经营效率、服务化转型与创造性破坏的推动作用存在实质差异。本数据集参考黄先海等 (2023, 数量经济技术经济研究) 的做法,以企业申请的数字技术专利为载体,运用自然语言处理与机器学习方法测算每一件专利的创新度,据此把企业的数字技术创新拆分为颠覆性与渐进性两个部分,为区分数字技术异质性效应的研究提供企业—年度层面的核心解释变量。 指标构建的第一步是识别数字技术专利。依据国家知识产权局《战略性新兴产业分类与国际专利分类参照关系表 (2021)(试行)》,把归属于新一代信息技术产业的国际专利分类号界定为数字技术类目,具体涵盖下一代信息网络产业、电子核心产业、新兴软件和新型信息技术服务、互联网与云计算及大数据服务、人工智能五个产业门类,云计算、大数据、工业互联网、区块链、人工智能、虚拟现实与增强现实等技术均落在该范围之内。该对照表以产业类目为单元给出纳入模式与排除模式,排除模式仅在其所属类目内生效。一件专利的任一国际专利分类号命中上述类目,即识别为数字专利。之所以只考察发明专利,是因为发明专利须经过严格的实质审查,相对于实用新型与外观设计而言创新程度更高,更能反映企业在数字领域取得的真实技术成果;之所以采用申请量而非授权量,是因为申请时点更接近企业当年的数字技术创新活动本身。 第二步是测算专利创新度。以中国全部数字技术领域发明专利的摘要文本为语料,先行分词,再以无监督方式训练词向量模型,将高维的文本空间压缩到低维向量空间。与新闻、博客等一般语料不同,专利文本包含大量特定技术领域的专业名词,通用中文分词词库对这类词汇覆盖不足,会显著影响分词准确度,因此在通用词典之外补充了数字技术关键词库,以及与之相关度较高的电子、机械、数学、物理、计算机与软件等领域的术语词库。训练完成后,把每件专利摘要中全部落入词表的词的词向量取算术平均,得到该专利的文档向量,两件专利文档向量的余弦值即为二者的语义相似度 $\rho{ij}$。 在此基础上,一项专利的创新度被定义为其与前五年内全部数字专利的平均语义相似度取倒数后的自然对数值: $$Innovativenessi^t = \ln \frac{N{Bt}}{\sum{j \in Bt} \rho{ij}}$$ 其中 $i$、$j$ 代表专利,$t$ 代表年份,$Bt$ 为第 $t$ 年前五年(即 $t-5$ 至 $t-1$ 年)内的全部数字专利集合,$N{Bt}$ 为该集合的专利件数。取值越大,意味着该专利的文本表达中对已有专利的重复越少、原创性的内容越多,即创新度越高。由于文档向量经过 L2 归一化,相似度之和 $\sum{j \in Bt} \rho{ij}$ 恒等于该专利向量与基准集向量和的内积,因此无需两两比对即可精确求得,计算复杂度随专利数量线性增长。 第三步是划分技术类型并汇总到企业层面。借鉴 Kelly 等 (2021, American Economic Review: Insights) 的做法,把全部数字专利中创新度位于前百分之十的专利识别为颠覆性数字专利,其余识别为渐进性数字专利,判定采用全样本统一的分位点阈值。企业当年申请的全部数字专利数、颠覆性数字专利数与渐进性数字专利数,分别经反双曲正弦变换得到数字技术、颠覆性数字技术与渐进性数字技术三个核心变量: $$IHS(n) = \ln\left(n + \sqrt{n^2 + 1}\right)$$ 该变换在数值接近零时近似线性、在数值较大时近似对数,既能缓解专利计数的右偏分布,又保留了零值观测,因而无需像对数变换那样人为加一。专利归属以企业自身及其母公司、子公司、联营企业与合营企业的申请合并计入,一件专利同时归属多家上市公司主体时在各主体分别计入。 除三个核心变量外,数据集另提供四组研究常用的衍生口径。颠覆性数字专利占比刻画企业数字技术成果中高创新度成分的比重。是否应用数字技术的虚拟变量在企业当年数字专利数为零时取零、否则取一;在应用数字技术的企业年样本内,再按数字技术取值高低对半划分出水平高组与水平低组,取值相同者进一步依据当年数字专利创新度之和排序。按申请主体结构,一件数字专利的全部申请人均属于该上市公司自身或其母公司、子公司、联营与合营企业的记为独立申请,只要存在任一申请人不属于该关联体系即记为联合申请。按技术领域跨度,国际专利分类号既含新一代信息技术产业类目又含其他产业类目的记为融合领域专利,全部分类号均属数字技术类目的记为单一领域专利。上述四组口径同样以反双曲正弦变换或比率形式给出。 企业—年度面板以上市公司专利活动可见的全部年份为骨架,当年未申请数字专利的企业其各项计数取零,因此数据集可直接与财务面板按证券代码与年份合并,不会因缺行造成样本损失。 补充说明 - 指标性质:创新度按构造等价于专利摘要与既有数字专利语义质心距离的度量,刻画的是文本层面的技术非典型程度。由此带来两点使用者需要知悉的性质。其一,判定结果沿行业存在系统性差异:语料由通信、软件、电子等核心数字领域主导,这些行业的数字专利更贴近语义质心而较多被划入渐进性,采矿、建筑等非数字主业行业的数字专利则较多被划入颠覆性。其二,本测算所得创新度与专利此后获得的引用次数基本不相关、与是否获得授权呈弱负向关系。就方法本身而言这一结果可以预期:Kelly 等 (2021) 的原始质量指标同时使用后向相似度与前向相似度之比,本文所复现的公式只保留了后向维度,缺少前向维度的纯新颖度指标不承载技术影响力信息。因此颠覆性与渐进性两个变量宜理解为专利文本相对既有数字技术的语义差异程度,作为技术影响力或专利价值代理变量使用缺乏支持;以其为核心解释变量时建议同时控制行业固定效应,否则识别到的效应中将包含相当部分的行业构成。 - 跨年可比性:三方面因素共同影响变量的跨年水平比较。发明专利自申请至公开需经历一段时滞、授权记录产生更晚,故样本期最后两个申请年只能观测到已公开的部分且偏向请求提前公开的子样本,全部计数类变量在这两年系统性偏低,颠覆性相关变量因当年创新度分布整体左移而遭遇统一阈值,偏低幅度更大。专利著录的国际专利分类号条数在样本期内持续上升,仅著录一条分类号的发明专利占比大幅下降,这会自动推高融合领域专利的比重;在固定分类号条数后,融合比重的上升趋势即消失。创新度公式中还含有一个仅随年份变化、与专利内容无关的成分:基准集规模扩大会压低其质心向量的范数,使创新度水平逐年机械上移,在统一阈值下表现为颠覆性专利占比随年份上升。上述三点均建议通过加入年份固定效应吸收;涉及融合与单一领域变量的跨年趋势解读,以及最后两个申请年的水平解读,应予回避。 - 样本口径:本数据集不预先施加任何回归样本限制,不剔除金融业,年份下限由创新度所需的前五年基准集决定,年份上限为当前自然年减一年。面板骨架覆盖各公司专利活动可见的全部年份而非上市区间,故含有早于公司上市年的行,其中少数带有正的专利计数,系按当前集团关联结构回溯归属所致;以财务面板左连接的常规用法不受影响,但不宜直接以本数据集为主表计算覆盖率类描述统计,亦不宜用于上市前后的事件研究。 - 实现口径的替代:原文所用专业术语词库来自全国科学技术名词审定委员会的分领域名词表,该系列仅提供在线逐条查询,本实现改用公开可得的自然科学分类术语词典作等价替代,覆盖领域相同。原文未指明由词向量得到文档向量的聚合方式与词向量模型的超参数,本实现采用词向量算术平均这一标准做法,并固定了向量维度、窗口、最低词频与迭代轮数等参数;不同聚合方式与超参数主要影响相似度的绝对水平,而颠覆性判定只依赖创新度的排序位置。原文语料截至其样本期末年,本实现延长至当前自然年减一年,故创新度的绝对水平不宜与原文报告值直接比较。联合申请的判定依赖上市公司关联企业名称库逐个申请人回溯匹配,未收录于该名称库的关联方会被归入联合申请,方向上高估联合申请、低估独立申请。 - 其他局限:语料构建过程中剔除了摘要过短、分词后有效词过少的专利,这类文本不足以支撑可靠的文档向量;上市公司侧剔除了国际专利分类号著录为空的记录,这类专利无从判定是否属于数字技术领域;三项过滤命中的记录数量都很小。少数数字专利因摘要有效词全部不在词表内、或所处年份的前五年基准集过小而无法评定创新度,这部分专利既不计入颠覆性也不计入渐进性;数据集为此单独提供可评定创新度的数字专利件数,企业当年数字专利全部无法评定时颠覆性与渐进性相关变量取缺失值而非零。颠覆性数字专利占比的分母按原文口径取全部数字专利,存在未评分专利时该比率偏低,需要可评分口径者可用颠覆性件数与可评定件数自行构造。相当比例的企业年仅申请少量数字专利,此时占比类变量的取值集中于端点,作为连续变量使用时需注意其离散特征。数字技术与渐进性数字技术两个变量高度相关,不宜同时进入同一回归方程。 参考文献 - 黄先海,王瀚迪,孙涌铭,等.数字技术与企业出口质量升级——来自专利文本机器学习的证据[J].数量经济技术经济研究,2023,40(12):69-89. - Kelly B, Papanikolaou D, Seru A, et al. Measuring technological innovation over the long run[J]. American Economic Review: Insights, 2021, 3(3): 303-320. - 吴非,胡慧芷,林慧妍,等.企业数字化转型与资本市场表现——来自股票流动性的经验证据[J].管理世界,2021,37(7):130-144+10.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。