各省绿色专利产出质量
「各省绿色专利产出质量」,覆盖 1985-2025 年,频率 年度,省级层级,含 11 个变量,样本量约 1,271。 参考曾莉、周璇、栗倩(2026)的方法,以绿色专利知识宽度刻画各省级行政区绿色专利产出的质量。
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 11 |
| 样本量 | 1,271 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区的六位行政区划代码,采用GB/T 2260标准
- Year [年份] — 专利申请年份
- GreenPatentCount [绿色专利件数] — 该省当年申请的绿色专利件数,含发明专利与实用新型专利,不含外观设计专利。计算公式为:按申请号去重后,第一申请人归属该省级行政区、申请年为当年的绿色专利件数合计。绿色专利指任一国际专利分类号命中世界知识产权组织2010年颁布的国际专利绿色分类清单的专利。
- GreenInventionCount [绿色发明专利件数] — 该省当年申请的绿色专利中发明专利的件数。计算公式为:绿色专利件数中专利类型为发明专利的部分。
- GreenUtilityCount [绿色实用新型件数] — 该省当年申请的绿色专利中实用新型专利的件数。计算公式为:绿色专利件数中专利类型为实用新型专利的部分。
- GreenPatentQuality [绿色专利产出质量] — 参考曾莉、周璇、栗倩(2026, 科研管理)的方法,计算公式为:先对每件绿色专利计算知识宽度,即1减去该专利各国际专利分类号大组占比的平方和(大组指分类号斜杠之前的部分,占比的分母为该专利分类号总个数);再取该省级行政区当年全部绿色专利知识宽度的算术平均值。用作研究变量,越大代表该地区绿色专利跨越的技术大组越分散、涵盖的技术要点越多,绿色专利产出质量越高。同一年份内本指标与绿色专利件数呈负相关,反映的是技术结构的分散程度而非绿色创新能力的高低;绿色专利件数较少的主体年抽样波动较大,使用时建议控制绿色专利件数并加入年份固定效应。
- GreenInventionQuality [绿色发明专利产出质量] — 参考席强敏、张景乐、张可云(2022, 经济地理)对发明专利与实用新型专利分别测算知识宽度的做法,计算公式为:该省级行政区当年全部绿色发明专利知识宽度的算术平均值,知识宽度为1减去该专利各国际专利分类号大组占比的平方和。用作稳健性检验变量,实用新型的知识宽度系统性低于发明专利,故本口径的水平高于含实用新型的主口径。
- GreenUtilityQuality [绿色实用新型产出质量] — 参考席强敏、张景乐、张可云(2022, 经济地理)对发明专利与实用新型专利分别测算知识宽度的做法,计算公式为:该省级行政区当年全部绿色实用新型专利知识宽度的算术平均值,知识宽度为1减去该专利各国际专利分类号大组占比的平方和。用作稳健性检验变量。
- GreenPatentQualityMedian [绿色专利产出质量(中位数)] — 参考席强敏、张景乐、张可云(2022, 经济地理)以知识宽度中位数替代均值的稳健性做法,计算公式为:该省级行政区当年全部绿色专利知识宽度的中位数。用作稳健性检验变量,相比均值更不易受少数分类号极多的专利影响。该字段取值高度离散,集中在零、二分之一等少数几个数值上,宜作稳健性对照而非主回归变量。
- GreenPatentCitationCount [绿色专利被引用次数] — 参考曾莉、周璇、栗倩(2026, 科研管理)更换变量衡量方式的稳健性口径(原文以绿色专利被引用次数衡量绿色专利质量),计算公式为:该省级行政区当年申请的全部绿色专利截至数据截止日被其他专利引用的次数之和。不设固定引用窗口,也不剔除自引;早年申请的专利累计窗口更长,该字段在年度间不宜直接比较。用作稳健性检验变量,越大代表该地区绿色专利的技术影响力越强。该字段与绿色专利件数高度相关,主要反映规模而非篇均影响力。
常见问题
- 「各省绿色专利产出质量」是什么数据集?
- 各省绿色专利产出质量,隶属科技创新。参考曾莉、周璇、栗倩(2026)的方法,以绿色专利知识宽度刻画各省级行政区绿色专利产出的质量。
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 11 个变量。核心指标包括:绿色专利件数、绿色发明专利件数、绿色实用新型件数、绿色专利产出质量、绿色发明专利产出质量、绿色实用新型产出质量、绿色专利产出质量(中位数)、绿色专利被引用次数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 1,271 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 绿色专利产出是化解环境保护与经济发展冲突的重要途径。衡量一个地区的绿色专利产出,长期以来偏重数量视角,而绿色专利产出数量的增加通常只标志着该地区创新规模的扩大,绿色专利产出质量的提升才真正反映该地区绿色创新水平的提高:前者扩大的是技术规模,后者提高的是技术水平。本数据集从质量视角刻画各省级行政区的绿色专利产出,参考曾莉、周璇、栗倩(2026)的做法,以绿色专利知识宽度作为绿色专利产出质量的度量。 绿色专利的识别依据世界知识产权组织于 2010 年颁布的国际专利绿色分类清单。该清单按替代能源生产、交通运输、能源节约、废弃物管理、农林业以及行政监管与设计六大主题,列出了对应的国际专利分类号。一件专利只要其任一国际专利分类号命中清单所列分类号,即判定为绿色专利。清单中既有子类级的条目,也有大组级与小组级的条目,统一按前缀匹配处理,即专利的分类号以清单中任一分类号为前缀即算命中。 知识宽度的构造思路来自产业集中度的测算方法。国际专利分类号包含"部—大类—小类—大组—小组"五级信息,其中大组指分类号斜杠之前的部分,例如 C02F1/28 的大组为 C02F1。一件专利包含的大组种类越多,表明它跨越的技术领域越多、涵盖的技术要点越多、范围越大,质量越高。据此,对每一件绿色专利 $p$,按其全部分类号在各大组上的分布计算赫芬达尔—赫希曼指数的补数: $$widep = 1 - \sum{g}\alpha{p,g}^{2},\qquad \alpha{p,g}=\frac{n{p,g}}{n{p}}$$ 其中 $n{p,g}$ 为专利 $p$ 落在大组 $g$ 的分类号个数,$np$ 为该专利的分类号总个数,$\alpha{p,g}$ 即该大组分类在这件专利中所占的比重。需要强调的是,占比的分母是分类号个数而非去重后的大组数——同一大组出现两次要计两次,这正是该方法参照产业集中度测算的用法。由此,若一件专利的全部分类号同属一个大组(含只有单个分类号的情形),其知识宽度为零;若分类号均匀分布在若干不同大组上,知识宽度趋近于 1。 在得到每件绿色专利的知识宽度之后,按专利所属地区与申请年取算术平均,得到地区层面的绿色专利产出质量: $$GPQ{r,t}=\frac{1}{\left|G(r,t)\right|}\sum{p\in G(r,t)}wide{p}$$ 其中 $G(r,t)$ 为归属省级行政区 $r$、申请年为 $t$ 的全部绿色专利集合。"先逐件计算每项专利的知识宽度、再按所在地区加总后取平均值"是该方法的既定实施步骤,而非把一个地区全部绿色专利的分类号汇总起来计算单一的集中度指数;两种做法在数值上差异极大,本数据集采用前者。 专利的地区归属取第一申请人的注册地。同一件专利申请通常对应多条公开记录(如发明专利的公开文本与授权公告文本),先按申请号去重合并为一件:分类号取授权公告文本的版本,因其分类号已经过实质审查终审,优于公开文本;地区归属则在省、市两级成对取自同一条记录,以保证同一件专利不会在两个行政层级被归给互不对应的地区。外观设计专利不涉及实质性的功能改良,且采用洛迦诺分类而非国际专利分类,依方法源头的口径予以剔除,进入计算的是发明专利与实用新型专利。 除主口径外,本数据集一并给出四个稳健性度量与三个计数字段。稳健性度量包括:仅按绿色发明专利计算的知识宽度均值、仅按绿色实用新型专利计算的知识宽度均值、以中位数替代均值的知识宽度中位数,以及更换变量衡量方式后以绿色专利被引用次数刻画的绿色专利质量。其中被引用次数反映绿色专利的技术影响力与知识流动,高被引专利往往代表技术上的突破并得到广泛认可;该字段统计的是各地区当年申请的全部绿色专利被其他专利引用的次数之和。三个计数字段分别为绿色专利件数及其发明专利、实用新型专利的分项件数,既是知识宽度求均值时的分母,也便于使用者在回归中控制绿色创新的规模维度。 补充说明 - 样本口径:覆盖全部省级行政区与全部可得年份,不预先施加区域或年段限制。地区当年没有绿色专利时各计数字段取零(真实的零),各质量字段因无可平均的对象而留空。 - 本指标测的是什么:知识宽度刻画的是单件绿色专利跨技术大组的分散程度,与"绿色创新能力的高低"并非同一概念;同一年份内它与绿色专利件数呈负相关,把截面排序直接读作地区绿色创新排名并不恰当。 - 适合什么样的计量设定:年份之间的漂移明显大于同一年份内的地区间差异,加入年份固定效应后省级层剩余的变异相当有限;依赖年份固定效应的研究设计建议优先使用地级市层。 - 专利类型与授权状态:主口径含绿色发明与绿色实用新型、不限授权状态。实用新型的知识宽度系统性低于发明专利,仅按发明计算的水平更高;两个分型字段已给出,可自行收窄口径。 - 标注深度同时决定水平与趋势:知识宽度高度依赖底层数据的分类号标注深度。本数据集依据公开专利数据构建,标注个数少于商业专利库,相当比例的绿色专利仅带单一大组、其值按定义为零,故水平值系统性低于以商业库为源的已发表数值,不宜与外部文献作数值对照;年度趋势也几乎完全由"仅带单一大组的专利所占比重"的升降驱动,应加入年份固定效应,不要当作绿色技术宽度的真实演变。横截面上的地区间区分度不受此影响。 - 绿色专利清单的口径:判定完全依据国际专利绿色分类清单本身,不作额外剔除。该清单以子类级乃至大类级整体纳入了若干范围很宽的技术领域,落入其中的专利即使与环境效益关联相对间接也计为绿色,且这些领域近年增长快于其他领域,使绿色专利的构成随年份变化。保留原状可与采用同一清单的研究横向可比,需要更严口径可自行按分类号筛选。 - 与不分绿色口径的知识宽度高度相关:按同一方法对全部专利计算的知识宽度指标与本指标高度相关,两者不宜同时进入同一个回归。 - 件数较少的主体年:均值受单件专利影响大,抽样波动可能超过地区之间的真实差异,取值最高的若干主体年几乎都只有个位数件专利;建议控制绿色专利件数或设定最低件数门槛。同样的原因使知识宽度中位数取值高度离散、集中在少数几个数值上,宜作稳健性对照而非主回归变量。 - 被引用次数:为截至数据截止日的累计被引,不设固定窗口、不按引用类型过滤、不剔自引;与绿色专利件数高度相关,主要反映规模。年度之间不宜直接比较,可自行除以件数换算为篇均被引。 - 公开滞后与末年构成:最近一至两个申请年的专利尚未全部公开,计数字段偏低;实用新型因公告即授权而滞后更久,末年的类型构成明显偏向发明专利,会机械抬高不分类型的主口径。末年若需与前期可比,建议改用绿色发明专利产出质量。 - 其他局限:地区归属依据申请人名称与工商登记信息匹配,匹配率在早期年份明显偏低并逐年上升,在登记收录较薄的地区系统性偏低;仅能定位到省级而无法定位到地级市的专利会使省级样本大于市级样本;个别以知名品牌名称为前缀的申请人可能被归入同名地区,对这些地区的少量观测有影响。 参考文献 - 曾莉,周璇,栗倩.环境规制对长江经济带绿色专利产出的影响研究——基于知识产权保护的调节效应[J].科研管理,2026,47(3):137-145. - 席强敏,张景乐,张可云.中国城市专利规模与知识宽度的时空演变及影响因素[J].经济地理,2022,42(3):56-65.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。