企业数据技术创新(Qwen大模型标注)
「企业数据技术创新(Qwen大模型标注)」,覆盖 1990-2026 年,频率 年度,上市公司层级,含 14 个变量,样本量约 77,047。 复现杨靖等(2026,外国经济与管理)的被解释变量。
| 时间跨度 | 1990-2026 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 14 |
| 样本量 | 77,047 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- DataPatentCount [数据技术专利申请数] — 参考杨靖等 (2026, 外国经济与管理)的方法,计算公式为:企业当年申请的专利中,经生成式大语言模型逐篇语义判定为数据技术专利的件数。数据技术专利指以提升数据要素价值为目标,围绕数据采集、存储、治理、分析、交易、应用或安全等数据全生命周期环节实现实质性技术创新的专利,仅涉及常规流程优化而未实现技术原理突破的不计入。用作研究变量,越大代表企业当年在数据要素领域的技术产出越多
- DataInvo [企业数据技术创新] — 参考杨靖等 (2026, 外国经济与管理)的方法,计算公式为:当年数据技术专利申请数量加1的自然对数值。用作研究变量,越大代表企业数据技术创新水平越高
- IsDataInvo [是否开展数据技术创新] — 是否开展数据技术创新(0=否,1=是),计算公式为:当年数据技术专利申请数大于0则取1,否则取0。参考杨靖等 (2026, 外国经济与管理)以申请数据技术专利的上市公司占比衡量创新广度的做法,用作研究变量,越大代表企业参与数据技术创新的可能性越高
常见问题
- 「企业数据技术创新(Qwen大模型标注)」是什么数据集?
- 企业数据技术创新(Qwen大模型标注),隶属创新与知识产权。复现杨靖等(2026,外国经济与管理)的被解释变量。
- 该数据集的时间范围是?
- 覆盖 1990-2026 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:数据技术专利申请数、企业数据技术创新、是否开展数据技术创新。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 77,047 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 数据作为新型生产要素,其潜在价值能否转化为现实生产力,关键在于企业是否具备以大数据分析为核心的数据技术能力。本数据集刻画企业在数据要素全生命周期各环节上的技术突破强度,复现杨靖、陈志斌、封思贤(2026)的被解释变量"企业数据技术创新"。 指标的概念边界依据国家发展改革委等部门《关于促进数据产业高质量发展的指导意见》及其附件《数据技术和产业重点发展方向》确定。据此,企业数据技术创新被界定为:企业通过引入新技术、新方法或改进现有技术,在数据采集、存储、治理、分析、交易、应用及安全等全生命周期环节中,提升数据处理效率、优化数据质量、增强数据安全与合规保障能力,最终实现数据要素价值跃升的创造性活动。这一界定刻意将数据技术从广义的数字创新或数字化转型中剥离出来,以区分围绕数据要素本身的技术攻关与一般性数字化应用行为。 测度的载体是企业专利申请。专利是企业保护创新成果、获取市场竞争优势的重要制度工具,申请行为能够表征企业的创新意愿与实际创新能力,且基于专利数据测度特定领域技术创新已在学术界形成广泛共识。 识别数据技术专利是本指标的核心难点。传统做法依赖国际专利分类(IPC)或关键词检索,二者在此均存在系统性不足:IPC 分类体系按技术主体(物理、电学等)设立标准,与数据技术按功能或目的分类的内在逻辑存在错配,数据资产化的估值定价、可信流通场景下的隐私计算等前沿主题在 IPC 体系内缺乏精准对应类目,往往只能归入"电数字数据处理"这类宽泛条目,技术独特性被掩盖,而该宽泛条目下又混杂大量与数据技术无关的常规软件应用与硬件维护专利;关键词检索则停留在文本表层,既因表述多样性而漏判(同一概念可表述为"隐私计算""多方安全计算""联邦学习"或"差分隐私"),又因语义复杂性而误判(含"数据"字样的专利可能仅是常规流程改进)。 为此,本指标改用生成式大语言模型对专利文本进行深度语义理解,逐篇输出二元判定。判定遵循三层指令体系。基础判断标准将"数据技术专利"明确为以提升数据要素价值为目标、涉及数据采集、存储、治理、分析、交易或安全等环节的实质性技术创新;引导示例给出正负两类样例,"提出基于联邦学习的跨机构数据协同分析方法,解决数据隐私保护与共享矛盾"判定为数据技术专利,"改进计算机硬件散热结构,仅在数据中心场景应用"判定为非数据技术专利;排除规则约束模型剔除仅涉及常规流程优化、未实现技术原理突破的专利,以及仅在描述中出现"数据"字样但技术实质属于机械、化工、材料、电路器件、通信硬件、医疗器械等领域的专利,同时扩展"隐私计算""数据确权"等术语的语义覆盖范围。模型解码温度设为零以抑制生成随机性;受批处理下浮点累加顺序的影响,同一文本在不同批次中的判定仍存在极小比例的不一致,重复判定的一致率接近但不等于百分之百。 在专利级判定的基础上,按专利申请年将判定为数据技术专利的件数汇总至企业,得到中间变量数据技术专利申请数 $DataPatentCount{i,t}$,即企业 $i$ 在第 $t$ 年申请且经模型判定为数据技术专利的专利件数。核心指标为该计数加一后取自然对数: $$DataInvo{i,t}=\ln\left(1+DataPatentCount{i,t}\right)$$ 取对数既缓解专利计数的右偏分布,也使不申请任何数据技术专利的企业年取值为零而不被舍弃。该指标数值越大,表示企业当年在数据要素全生命周期环节上的技术突破强度越高,用作研究变量时可直接作为被解释变量刻画企业数据技术创新水平。 原文在检验识别有效性时,另以各年度申请数据技术专利的上市公司占比衡量创新广度。与之对应,本数据集提供企业层面的二元指标 $IsDataInvo{i,t}=\mathbf{1}\{DataPatentCount{i,t}0\}$,标识企业当年是否开展数据技术创新,可用于区分创新广度(是否参与)与创新强度(参与深度)两个维度。 补充说明 - 样本口径:本数据集交付未施加回归样本限制的完整公司—年度面板,覆盖专利数据可得的全部年份,未剔除金融业与特别处理企业,亦未做缩尾处理。原文的样本区间为 2015—2024 年,并剔除金融类、ST/ST 及关键变量缺失样本;使用时建议按研究设计自行筛选,并加入行业与年份固定效应。 - 候选预筛与计算规模:逐篇判定数百万件专利的算力开销很高,因此在送入模型之前先以宽口径规则(分类号白名单与数据技术词表的并集)划出候选集合,未进入候选集合的专利记为非数据技术专利。预筛只负责排除明显不可能属于数据技术的专利,不参与任何判定,候选集合内的每一条仍由模型逐篇独立判断。该设计会带来少量漏判,影响方向单一,只可能使计数偏低而不会偏高;为使这一代价可度量,计算流程会从未进入候选集合的专利中随机抽样并交由同一模型判定,据此估计漏判比例及其置信区间。 - 判定文本:送入模型的文本为专利标题与摘要的拼接,并设有字符长度上限,原文表述为专利摘要文本。加入标题是因为标题常包含最直接的技术主题信息;长度上限覆盖绝大多数摘要全文。此外,原文要求模型在输出分类结果的同时附带判定依据以便人工复核,该依据不进入任何变量,本实现只保留二元结果。 - 专利归属口径:本平台的专利数据将专利归属到上市公司的母公司、子公司与合营企业,归属范围较原文采用的来源更宽,因而计数水位系统性高于原文报告值。这一差异是口径性的,不影响指标的时序趋势与横截面排序;跨研究比较绝对水平时需注意这一点。 - 地区异质性的使用提示:由于专利按上市公司主体归集而研发实体可能位于异地,注册地在中西部而研发子公司在东部的企业同样被记为创新者,这会压平指标的地区梯度。做分地区异质性分析时,本指标反映的地区差异弱于按研发实际发生地度量的口径。 - 近年数据完整性:专利从申请到公开存在法定滞后期,且两种专利类型的滞后期不同——实用新型经授权公告后入库,发明专利多在申请满十八个月或申请人请求提前公开后入库。因此最近一至两个申请年度不仅计数偏低,其类型结构也显著偏向发明专利,而数据技术专利几乎全部为发明专利,两者叠加会使最末年份的指标出现结构性抬升。建议在样本尾部保留一至两年缓冲,不要直接使用最新申请年度。 - 其他局限:企业层面的计数按申请人代码归集,同一专利若由多家上市公司联合申请,则计入每一家申请人;地理与行业标识来自公司基本信息的历史匹配,少数企业年缺少城市或区县标识,这部分企业的指标取值系统性偏低,做地区分组时需注意。 参考文献 - 杨靖,陈志斌,封思贤.数据知识产权保护与企业数据技术创新——来自生成式大语言模型的经验证据[J/OL].外国经济与管理,2026.https://doi.org/10.16538/j.cnki.fem.20260420.401. - 刘青,肖柏高.劳动力成本与劳动节约型技术创新——来自AI语言模型和专利文本的证据[J].经济研究,2023,58(2):74-90. - 陈楠,蔡跃洲,马文君.企业数据技术能力对市值和利润的影响——基于大数据专利的机制检验和互补性投入分析[J].财贸经济,2024,45(1):106-123.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。