突破式绿色创新水平(SBERT模型)
「突破式绿色创新水平(SBERT模型)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 96,712。 基于SBERT专利摘要文本相似度测度企业突破式绿色创新水平, 参考王悦颖陈劭锋(2026,科学学研究)
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 15 |
| 样本量 | 96,712 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 申请年份(专利申请年)
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- GreenInventionCount [绿色发明专利数] — 企业当年绿色发明专利申请数量, 为突破式创新排名池的基数。计算公式为: 当年专利类型为发明专利且IPC分类命中WIPO绿色清单(宽口径, 前缀匹配)的专利去重计数。注: 宽口径含G06Q(商业数据处理)等争议码, 金融业绿专因此虚高。
- Inno [突破式绿色创新水平] — 参考王悦颖、陈劭锋(2026, 科学学研究)的方法, 衡量企业突破式(激进型)绿色创新水平。计算公式为: 对企业当年每条绿色发明专利, 用SBERT句向量计算其摘要与该企业上一年全部发明专利摘要的余弦相似度均值mean_sim, 突破性创新度=ln(1/mean_sim)(借鉴黄先海等2024, 中国工业经济); 在同一申请年份、同一行业(中上协大类)内, 创新度位于前20%的绿色发明专利界定为突破式绿色创新专利, 按企业-年计数汇总。用作研究变量, 数值越大代表突破式绿色创新越多。注: 绿色采用WIPO宽口径, 金融业因G06Q码虚高, 建议剔除金融业(J)使用。
- Inno15 [突破式绿色创新水平(前15%口径)] — 突破式绿色创新水平的稳健性口径(前15%阈值), 参考王悦颖、陈劭锋(2026, 科学学研究)的替换被解释变量稳健性检验。计算公式同突破式绿色创新水平, 但将同申请年份、同行业内创新度位于前15%的绿色发明专利界定为突破式并按企业-年计数。用作研究变量, 数值越大代表突破式绿色创新越多。
- Inno25 [突破式绿色创新水平(前25%口径)] — 突破式绿色创新水平的稳健性口径(前25%阈值), 参考王悦颖、陈劭锋(2026, 科学学研究)的替换被解释变量稳健性检验。计算公式同突破式绿色创新水平, 但将同申请年份、同行业内创新度位于前25%的绿色发明专利界定为突破式并按企业-年计数。用作研究变量, 数值越大代表突破式绿色创新越多。
常见问题
- 「突破式绿色创新水平(SBERT模型)」是什么数据集?
- 突破式绿色创新水平(SBERT模型),隶属ESG与绿色发展。基于SBERT专利摘要文本相似度测度企业突破式绿色创新水平, 参考王悦颖陈劭锋(2026,科学学研究)
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 15 个变量。核心指标包括:绿色发明专利数、突破式绿色创新水平、突破式绿色创新水平(前15%口径)、突破式绿色创新水平(前25%口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,712 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业突破式绿色创新刻画的是偏离既有技术轨迹、具有激进(而非渐进)性质的绿色技术突破,区别于对既有绿色技术的渐进式改良。本数据集参考王悦颖、陈劭锋(2026)的做法,基于海量专利摘要文本,用句向量语义模型度量企业绿色发明专利相对其自身既有技术积累的"语义新颖性",据此识别突破式绿色创新,从而以创新质量而非数量刻画企业绿色创新。 基础对象:绿色发明专利。 将企业申请的发明专利中,国际专利分类(IPC)命中世界知识产权组织绿色专利清单(IPC Green Inventory,采用前缀匹配的宽口径)的部分,界定为绿色发明专利。 语义突破性(创新度)。 对企业 $i$ 在第 $t$ 年申请的每一条绿色发明专利 $p$,先用中文句向量模型(基于 MacBERT 预训练、经句子相似度任务微调的 SBERT 类模型)将其摘要文本编码为归一化语义向量;再计算该向量与企业 $i$ 在第 $t-1$ 年全部发明专利摘要向量的余弦相似度,取均值 $\overline{s}p$。相似度越低,表明该专利与企业既有技术积累的语义距离越大、越偏离既有轨迹。借鉴黄先海等(2024)的做法,对相似度均值倒数取对数,构造突破性(创新度)指标: $$ noveltyp = \ln\!\left(\frac{1}{\overline{s}p}\right) $$ $noveltyp$ 越大,该专利越具突破性。若企业 $i$ 在 $t-1$ 年没有任何发明专利(缺乏语义基准),则该专利的创新度无法计算,不参与后续界定。 突破式绿色创新专利的界定与汇总。 在同一申请年份、同一行业(按行业分类大类分组)内,将绿色发明专利按创新度 $novelty$ 由高到低排序,位于前 $20\%$ 者界定为突破式绿色创新专利。将企业-年内的突破式绿色创新专利数量加总,得到核心指标——企业突破式绿色创新水平: $$ Inno{i,t} = \#\{\, p \in (i,t) : p \text{ 为绿色发明专利, 且 } noveltyp \text{ 位居同申请年同行业前 } 20\% \,\} $$ $Inno$ 为计数值,越大代表企业当年实现的突破式绿色创新越多。为检验界定阈值的敏感性,另按前 $15\%$、前 $25\%$ 两个阈值构造 $Inno15$、$Inno25$ 两个稳健性口径,计算方式与核心指标完全一致,仅替换分位阈值。此外保留企业当年绿色发明专利总数 $GreenInventionCount$ 作为前 $n\%$ 排名的池基数与机制分析用中间变量。 补充说明 - 面板以全部 A 股上市公司的企业-年为骨架,当年无突破式绿色创新专利者记为 $0$;计数变量不作缩尾处理。行业分组按申请年动态匹配企业当年实际所属行业。多主体共同申请的专利按参与主体各计一次。 - 口径与构念提示。 绿色识别采用绿色专利清单宽口径,其中含商业数据处理(G06Q)、电学测量(G01R)、石油裂化(C10G)等匹配面较宽的类别,约四成绿色发明专利仅由这三类命中。这对制造业等实体行业影响有限,但会使金融、数据类企业(如金融科技的数据处理专利)的绿色专利数被显著高估,相应地这类企业的本指标存在系统性虚高。使用本数据时建议剔除金融业企业(与相关文献样本口径一致),必要时可改用剔除上述争议类别的更严格绿色口径作稳健性检验。 - 测度的序数性质。 受同一企业相邻年度专利摘要语义高度接近的影响,创新度指标的取值分布较为集中(动态范围较窄),"前 $20\%$"的切分对句向量模型的具体实例较为敏感。因此本指标更适合作为噪声较大的序数(排序)代理,宜结合企业固定效应使用并辅以多模型稳健性检验,不宜对单条观测的绝对取值作过度解读。 - 零值的含义。 $Inno=0$ 同时包含"当年无绿色发明专利"与"有绿色发明专利但均未进入前 $20\%$(或因上一年无发明专利基准致创新度缺失)"两种情形。判断企业是否"零突破"时应结合 $GreenInventionCount$ 加以甄别。 - 年度覆盖。 受专利公开约一年半滞后的影响,最近一两个申请年的绿色专利尚不齐全,且各行业公开进度不均衡,最近年份的计数系统性偏低且跨行业不可直接比较。研究窗口宜截至专利公开较完整的年份。 参考文献 - 王悦颖, 陈劭锋. 人工智能对企业突破式绿色创新的机理研究[J/OL]. 科学学研究, 1-14[2026-07-24]. https://doi.org/10.16192/j.cnki.1003-2053.20260510.002. - 黄先海, 孙猛铭, 陈梦涛. 企业数字化转型与颠覆性技术创新——来自专利网络与sbert模型的微观证据[J]. 中国工业经济, 2024, (10): 137-154. - 张杰, 郑文平. 创新追赶战略抑制了中国专利质量么?[J]. 经济研究, 2018, 53(5): 28-41. - 卢娜, 王为东, 王淼, 等. 突破性低碳技术创新与碳排放:直接影响与空间溢出[J]. 中国人口·资源与环境, 2019, 29(5): 30-39. - Cui Y, Che W, Liu T, et al. Revisiting Pre-trained Models for Chinese Natural Language Processing[C]//Findings of the Association for Computational Linguistics: EMNLP 2020. Stroudsburg: Association for Computational Linguistics, 2020: 657-668.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。