数据要素知识积累(基于专利)
「数据要素知识积累(基于专利)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 96,335。 刻画上市公司将数据要素转化为创新知识的能力。
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 96,335 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- TotalPatentApp [专利申请总数] — 当年该上市公司及其子公司、联营与合营公司提交的专利申请总数,按股票代码与专利申请号去重后统计
- CloudDataPatent [数据要素知识积累专利数] — 参考田利辉等 (2025, 世界经济)的方法,计算公式为:当年企业申请的专利中,专利标题与摘要文本同时包含至少1个云计算关键词(词典共70词)与至少1个数据资源关键词(词典共90词)的专利数量。该类专利反映企业运用云计算技术利用数字资源开展研发所形成的成果
- DataElementKnowledgeAccum [数据要素知识积累] — 参考田利辉等 (2025, 世界经济)的方法,计算公式为:ln(1+当年数据要素知识积累专利数)。用作研究变量,越大代表企业将数据要素转化为创新知识的能力越强
- CloudDataPatentInv [数据要素知识积累专利数(发明专利)] — 参考田利辉等 (2025, 世界经济)的方法的方法并按其区分实质性创新与策略性创新的做法,仅统计发明专利,计算公式为:当年企业申请的发明专利中,标题与摘要文本同时包含至少1个云计算关键词与至少1个数据资源关键词的专利数量
- DataElementKnowledgeAccumInv [数据要素知识积累(发明专利口径)] — 参考田利辉等 (2025, 世界经济)的方法,计算公式为:ln(1+当年发明专利口径的数据要素知识积累专利数)。用作稳健性检验变量,越大代表企业以发明专利形式将数据要素转化为创新知识的能力越强
常见问题
- 「数据要素知识积累(基于专利)」是什么数据集?
- 数据要素知识积累(基于专利),隶属创新与知识产权。刻画上市公司将数据要素转化为创新知识的能力。
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:专利申请总数、数据要素知识积累专利数、数据要素知识积累、数据要素知识积累专利数(发明专利)、数据要素知识积累(发明专利口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,335 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 数据要素化是推动知识积累的关键环节,而知识积累是技术创新的根本来源。企业在经营与研发过程中持续沉淀的数据,只有经由充分的算力与数据处理能力被挖掘、清洗与分析,才能从潜在的生产要素转化为可供研发利用的创新知识。本数据集刻画的正是这一转化能力:企业在创新活动中对归属于云计算范畴的数字资源的利用程度越高,说明其将数据要素转化为创新知识的能力越强。与依靠年报措辞构建的数字化综合指数不同,本指标以专利这一实际研发产出为载体,测度的是已经落到技术方案上的数据要素应用,而非战略表述层面的意图。 测度遵循田利辉等的三步法。第一步是构建两部关键词词典。云计算关键词词典收录 70 个词条,涵盖云计算的基本概念与服务模式(如云计算、云平台、云原生、公有云、私有云、混合云,以及基础设施即服务、平台即服务、软件即服务及其英文缩写)、技术架构与资源调度机制(如虚拟化、容器技术、资源池、资源调度、弹性伸缩、自动伸缩、云边协同、边缘计算、边缘节点)、以及各类云端应用形态(如云存储、云安全、云管理、云制造、物联网、信息物理系统)。数据资源关键词词典收录 90 个词条,覆盖数据的要素属性与载体(如数据资产、数据资源、数据要素、大数据、数据中心、数据平台、数据中台、数据湖、数据仓库)、数据处理的全流程环节(如数据采集、数据清洗、数据脱敏、数据预处理、数据挖掘、数据分析、数据可视化、数据集成、数据融合),以及数据的流通与治理(如数据共享、数据交易、数据流通、数据治理、数据产权、数据合规、数据安全)。两部词典的词条无重合。 第二步是基于"云计算关键词 + 数据资源关键词"的组合,从企业申请的专利中挖掘出既涉及数据资源利用、又归属于云计算范畴的专利。具体判定为:逐件读取专利的文本,若其中同时出现至少一个云计算关键词与至少一个数据资源关键词,则认定该专利是企业运用云计算技术利用数字资源开展研发所产生的成果。记企业 $i$ 在第 $t$ 年申请的专利集合为 $P{i,t}$,专利 $p$ 的文本为 $Tp$,云计算词典与数据资源词典分别为 $W^{C}$ 与 $W^{D}$,则 $$\text{CloudDataPatent}{i,t}=\sum{p\in P{i,t}}\mathbb{1}\Big[\big(\exists\, w\in W^{C}:\, w\subseteq T{p}\big)\ \wedge\ \big(\exists\, w\in W^{D}:\, w\subseteq T{p}\big)\Big]$$ 其中 $\mathbb{1}[\cdot]$ 为示性函数,$w\subseteq Tp$ 表示词条 $w$ 在文本 $Tp$ 中出现。判定采用布尔规则而非词频加权:一件专利无论命中多少个词条,都只计一次,因此该计数反映的是"有多少件专利属于此类",而非"关键词被提及的密度"。企业口径涵盖上市公司本身及其子公司、联营企业与合营企业,与专利产出类文献的通行口径一致;同一专利在同一家公司名下只计一次。 第三步是将识别出的专利按企业—年度汇总,加 1 后取自然对数,得到核心指标 $$\text{DataElementKnowledgeAccum}{i,t}=\ln\!\big(1+\text{CloudDataPatent}{i,t}\big)$$ 取对数前加 1 使当年没有此类专利的企业年取值为零而非缺失,指标值越大表示企业的知识积累能力越强。年度归属采用申请年而非授权年,因为申请时点更接近研发活动实际发生的时间。 数据集同时提供三个配套字段。专利申请总数是当年企业申请的全部专利件数,既是识别过程的分母基础,也便于使用者自行构造强度型指标或将本指标与企业整体创新规模区分开。发明专利口径的两个字段(计数与其对数)只统计发明专利,对应原文稳健性检验中区分实质性创新与策略性创新的做法;实用新型在本共现规则下的命中率远低于发明专利,因此该口径与主口径高度接近,可用于检验结论是否由专利类型结构驱动。 补充说明 - 样本口径:输出为企业—年度全面板,当年没有专利申请的企业年,本指标按定义取零而非缺失。数据集不预先剔除金融业、ST 公司或其他回归样本限制,此类筛选交由使用者按研究设计施加。 - 文本域:原文使用专利的摘要与权利要求文本,本数据集使用专利标题与摘要。权利要求全文在可获得的专利文献库中对中国专利不予提供,补入标题以部分弥补文本量的损失。该差异使识别结果偏保守,仅在权利要求中出现相关词汇的专利会被漏计。 - 自动化判定:原文在关键词匹配后另有人工抽样复核环节,用以确认专利所涉数据资源确属云计算应用的结果,本数据集为纯自动化的字面匹配,无人工复核。由此产生两类可预期的偏差:一是中文构词的字面重合会带来少量误纳,例如三维视觉领域的专用术语与云计算词典中某一词条存在字面包含关系;二是云计算词典收录了"物联网""分布式"等在信息技术领域广泛使用的通用词,命中其中之一即满足云侧条件,会把部分并非依托云平台的技术方案纳入。这两类偏差与文本域缺失造成的漏计方向相反,部分相互抵消。此外,词典中含拉丁字母的词条(如三种服务模式的英文缩写)在匹配时一并登记了全小写与全大写写法,以免因书写习惯差异而漏匹配,原文未说明这一处理。 - 词典敏感性:若改用仅含"云"类严格词条的云侧词表,命中规模会明显收缩,正值样本内企业的强度排序变化较大,而企业"是否拥有此类专利"这一有无边际则相对稳健。建议以有无边际为主的设定优先,或将词典范围作为稳健性检验的一个维度。 - 变量性质与建模:该指标在相当比例的企业年取值为零,本质上是零膨胀的计数变量取对数,其取值集中在若干离散点上。使用连续变量设定加企业固定效应时,全期从未取正的企业不提供组内识别信息,有效样本小于总行数。建议直接使用计数字段配合泊松或负二项模型,或将"是否拥有此类专利"的二元设定作为并行检验。 - 加总口径:由多家上市公司共同申请的专利会分别计入各家企业,这与企业层面的口径定义一致;但将本字段跨企业加总到行业、地区或全市场时会重复计算此类专利,需先按专利去重。 - 最近可得年度:专利自申请至公开存在约一年半的滞后,且不同专利类型的公开节奏不同——实用新型公开较慢,使最新申请年度可见专利的类型结构明显偏向发明专利,而本指标识别出的专利又几乎全部是发明专利。其后果是该年度的专利申请总数被截断的程度远重于本指标的计数,二者相除会得到偏高的比值。建议不将最近可得年度与历史年度直接比较,尤其避免用两个计数字段构造跨年可比的强度比率。 - 其他局限:云计算作为商业服务在本世纪初才出现,样本早期年份该类专利在定义上不可能为正,这些年份的零值反映的是技术尚未出现而非企业缺乏相关活动,建议研究窗口从云计算进入规模化应用阶段起算;专利类型中不含外观设计,此类专利无技术摘要文本,在本规则下本就不会命中;企业—专利的归属依据申请人名称匹配,已退市代码上的历史归属不进入本面板。 参考文献 - 田利辉,李政,施炳展.企业上云对其创新的影响:数据要素化的视角[J].世界经济,2025,48(1):178-210.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。