企业劳动节约型创新(RoBERTa模型)
「企业劳动节约型创新(RoBERTa模型)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 71,817。 参考皮淑雯等(2026,南开管理评论),用有监督预训练语言模型从专利摘要识别劳动节约型(自动化替代人工)专利,汇总企业当年劳动节约型专利数取对数,并构造发明质量
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 71,817 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [股票简称] — 公司当年股票简称
- Year [年份] — 专利申请年份
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 当年中国上市公司协会行业分类代码
- IndustryName [行业名称] — 当年中国上市公司协会行业分类名称
- LabsavPatentCount [劳动节约型专利数] — 参考皮淑雯等(2026,南开管理评论)的方法,企业当年申请的、经有监督预训练语言模型(RoBERTa)判定为具有劳动节约功效的创新专利(发明+实用新型)数量;判定标准为专利直接涉及节约人工/减少工时/代替人工等表述,或间接描述具有自动化功效、能代替或减少人工的装备与系统。用作Labsav_innov的底数。
- TotalPatentCount [专利申请总数] — 企业当年申请的创新专利(发明+实用新型)总数,用作Total_innov的底数。
- Labsav_innov [劳动节约型创新] — 参考皮淑雯等(2026,南开管理评论)的方法,计算公式为:ln(企业当年劳动节约型专利数+1),为企业劳动节约型创新的核心代理变量。用作研究变量,越大代表企业越倾向于用自动化替代人工的创新。
- Total_innov [整体创新] — 参考皮淑雯等(2026,南开管理评论)的方法,计算公式为:ln(企业当年创新专利总数+1),作为整体创新水平的对照度量。用作研究变量。
- Ln_faming [劳动节约型发明专利质量] — 参考张杰、郑文平(2018,经济研究)与龙小宁等(2023,中国工业经济)的方法,计算公式为:ln(企业当年申请且最终获得授权的劳动节约型发明专利数+1),衡量劳动节约型创新的质量。用作研究变量,越大代表高质量原创性劳动节约型创新越多。
- Ln_Citenonself [劳动节约型专利单均被引(剔除自引)] — 参考张杰、郑文平(2018,经济研究)的方法,计算公式为:ln(企业当年劳动节约型专利剔除自引用后的前向总被引次数 / 劳动节约型专利数 + 1),衡量劳动节约型创新的技术影响力。用作研究变量。
- Know_Width [劳动节约型创新知识宽度] — 参考张杰、郑文平(2018,经济研究)的方法,对每件劳动节约型专利在IPC分类号大组层面计算1减赫芬达尔-赫希曼指数(1-sum(各大组分类号占比的平方)),企业当年取其全部劳动节约型专利该值的中位数,衡量创新跨越的技术领域宽度。无劳动节约型专利的企业-年度该值为空。用作研究变量,越大代表创新知识面越宽。
- Labsav_dummy [是否进行劳动节约型创新] — 参考皮淑雯等(2026,南开管理评论)的方法,企业当年劳动节约型专利数大于0记为1,否则记为0(0=否,1=是),作为是否进行劳动节约型创新的稳健性度量。
常见问题
- 「企业劳动节约型创新(RoBERTa模型)」是什么数据集?
- 企业劳动节约型创新(RoBERTa模型),隶属创新与知识产权。参考皮淑雯等(2026,南开管理评论),用有监督预训练语言模型从专利摘要识别劳动节约型(自动化替代人工)专利,汇总企业当年劳动节约型专利数取对数,并构造发明质量
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:劳动节约型专利数、专利申请总数、劳动节约型创新、整体创新、劳动节约型发明专利质量、劳动节约型专利单均被引(剔除自引)、劳动节约型创新知识宽度、是否进行劳动节约型创新。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,817 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业劳动节约型创新刻画企业通过引入自动化、智能化的装备与系统来替代或减少人工的技术创新强度。与强调"人机协作"的劳动互补型技术不同,劳动节约型技术强调由机器、算法、自动控制等独立完成原本依赖人工的作业,从而降低企业对人力的依赖。识别一项专利是否具有"劳动节约"功效,需要同时考虑两个维度:其一为直接维度,即专利摘要明确出现"节约人工""减少工时""代替人工""减少用工""无人化"等表述;其二为间接维度,即专利所描述的是一种具有自动化或智能化功效的装备、机器、生产线或工艺系统,能够自动完成检测、控制、加工、装卸搬运、分拣等原需人工的作业。间接维度无法由固定关键词穷举,必须依赖对专利文本的语义判断。 为在百万级专利上实现上述语义判断,本指标采用"生成式大模型自动标注 + 有监督预训练语言模型分类"的两阶段流程。第一阶段,设定"专利审核者"角色,给出上述判定规则,由生成式大语言模型对随机抽取的一万条专利摘要逐条判断是否具有劳动节约功效,得到高质量的标注样本(正类占比约 $26\%$)。第二阶段,将标注样本按 $8:1:1$ 划分为训练集、验证集与测试集,在中文 RoBERTa 预训练语言模型上微调一个二分类器,以验证集准确率选取最优分类器(验证集与测试集准确率分别约为 $90.1\%$ 与 $89.3\%$),并据此对全部专利的用途进行预测。 在专利层面识别完成后,按企业与申请年度汇总,得到企业当年劳动节约型专利数量 $LabsavCount{i,t}$,核心被解释变量为其加一取自然对数: $$Labsav\innov{i,t} = \ln\left(LabsavCount{i,t} + 1\right)$$ 作为对照,整体创新水平以企业当年全部创新专利(发明与实用新型)数量 $TotalCount{i,t}$ 同法构造 $Total\innov{i,t} = \ln\left(TotalCount{i,t}+1\right)$。考虑到半数以上企业当年并未进行劳动节约型创新,进一步以是否进行劳动节约型创新的虚拟变量 $Labsav\dummy$(劳动节约型专利数大于零记 $1$,否则记 $0$)作为稳健性度量。 为刻画劳动节约型创新的质量,进一步构造三个维度。其一为劳动节约型发明专利质量 $Ln\faming$,等于企业当年申请且最终获得授权的劳动节约型发明专利数量加一取自然对数,反映高质量、原创性较强的劳动节约型创新产出。其二为剔除自引的单均被引 $Ln\Citenonself$,先计算企业劳动节约型专利剔除自引用后的总被引次数与劳动节约型专利数之比,再加一取自然对数,反映创新的技术影响力。其三为创新知识宽度 $Know\Width$,对每件劳动节约型专利,在其 IPC 分类号大组层面计算 $1$ 减去赫芬达尔-赫希曼指数, $$KW{p} = 1 - \sum{m}\left(\frac{n{p,m}}{n{p}}\right)^{2}$$ 其中 $n{p,m}$ 为专利 $p$ 在 IPC 大组 $m$ 上的分类号计数、$n{p}$ 为该专利分类号总数;企业当年知识宽度取其全部劳动节约型专利 $KW{p}$ 的中位数,反映创新所跨越的技术领域宽度。 补充说明 劳动节约型专利的识别范围覆盖全部创新专利(发明与实用新型),以与"百万级专利"及劳动节约型专利约占全部专利三成的口径相一致;其中发明专利质量维度 $Ln\faming$ 按论文设定仅统计发明专利。专利按申请年度归属企业,企业口径包含上市公司及其子公司、合营企业的专利申请,故劳动节约型与整体专利数量的绝对水位高于以更窄专利来源构造的同名指标;劳动节约型创新的占比、时间趋势与分类精度则与原始方法保持一致。数据以未缩尾的全样本面板形式提供,研究者可按研究窗口与行业筛选样本并对连续变量进行上下 $1\%$ 缩尾处理。无劳动节约型专利的企业-年度,其知识宽度无定义而留空。 参考文献 - 皮淑雯, 丁凤塔, 孟佶贤, 杨晓光. 员工流失风险感知与企业劳动节约型创新[J]. 南开管理评论, 2026, 29(4): 113-124. - 刘青, 肖柏高. 劳动力成本与劳动节约型技术创新——来自AI语言模型和专利文本的证据[J]. 经济研究, 2023, 58(2): 74-90. - Mann K, Puttmann L. Benign effects of automation: New evidence from patent texts[J]. Review of Economics and Statistics, 2023, 105(3): 562-579. - Liu Y, Ott M, Goyal N, et al. RoBERTa: A robustly optimized BERT pretraining approach[J]. arXiv preprint arXiv:1907.11692, 2019. - 张杰, 郑文平. 创新追赶战略抑制了中国专利质量么?[J]. 经济研究, 2018, 53(5): 28-41. - 龙小宁, 刘灵子, 张靖. 企业合作研发模式对创新质量的影响——基于中国专利数据的实证研究[J]. 中国工业经济, 2023(10): 174-192.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。