企业专利一般性与独创性

「企业专利一般性与独创性」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 83,703。 以赫芬达尔-赫希曼指数刻画企业专利在技术类别上的分散度,用于度量突破性创新。

时间跨度2006-2025 年
数据频率年度
层级上市公司
变量数20
样本量83,703
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • GrantedInventionCount [授权发明专利数] — 计算公式为:企业当年申请并最终获得授权的发明专利件数,同一专利由多家上市公司联合申请时各家均计入。用作专利一般性与专利独创性在企业层面取算术平均的分母,当年无授权发明专利时取0
  • ForwardCitation3Y [三年内被引次数] — 计算公式为:企业当年申请并获授权的发明专利在申请当年至申请后第二年共三个年度内收到的引用总次数,仅计入引用方主分类可归入国际专利分类小类的引用
  • ForwardIPCClassCount [引用方技术类别数] — 计算公式为:上述三年内引用这些专利的后续专利,其主分类所属国际专利分类小类的去重个数,即专利一般性公式中的求和上限
  • ForwardCoverage [被引专利占比] — 计算公式为:企业当年授权发明专利中在申请后三年内至少被引用一次的件数除以当年授权发明专利总件数。该比例越低说明当年专利一般性取值中由零值贡献的比重越大,当年无授权发明专利时为空值
  • BackwardCitationCount [后向引用次数] — 计算公式为:企业当年申请并获授权的发明专利所引用的在先专利总件数,仅计入主分类可归入国际专利分类小类的在先专利
  • BackwardIPCClassCount [被引方技术类别数] — 计算公式为:上述在先专利的主分类所属国际专利分类小类的去重个数,即专利独创性公式中的求和上限
  • BackwardCoverage [有引用记录专利占比] — 计算公式为:企业当年授权发明专利中存在在先专利引用记录的件数除以当年授权发明专利总件数。用于识别引文收录不完整的企业年,当年无授权发明专利时为空值
  • PatentGenerality [专利一般性] — 参考王群勇和张慧敏(2026, 世界经济)的方法,计算公式为:先在专利层面计算1减去各国际专利分类小类引用份额的平方和,其中份额为申请后三年内来自该小类的引用次数占被引总次数之比;再对企业当年申请并获授权的发明专利取算术平均,窗口内无被引记录的专利计为0。用作研究变量,越大代表企业专利被越多互不相同的技术领域借鉴、技术外溢面越广零值有三种来源(当年无授权发明专利、有专利但无引用记录、引用全部集中于单一技术小类的真实低多样性),可用授权发明专利数与引用次数两列完全区分,回归前应加以区别。
  • PatentOriginality [专利独创性] — 参考王群勇和张慧敏(2026, 世界经济)的方法,计算公式为:先在专利层面计算1减去各国际专利分类小类被引份额的平方和,其中份额为该专利引用的在先专利中属该小类的件数占引用总数之比;再对企业当年申请并获授权的发明专利取算术平均,无在先引用记录的专利计为0。用作研究变量,越大代表企业专利汲取的知识来源越多元、越可能出自跨领域的知识重组零值有三种来源(当年无授权发明专利、有专利但无引用记录、引用全部集中于单一技术小类的真实低多样性),可用授权发明专利数与引用次数两列完全区分,回归前应加以区别。

常见问题

「企业专利一般性与独创性」是什么数据集?
企业专利一般性与独创性,隶属创新与知识产权。以赫芬达尔-赫希曼指数刻画企业专利在技术类别上的分散度,用于度量突破性创新。
该数据集的时间范围是?
覆盖 2006-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:授权发明专利数、三年内被引次数、引用方技术类别数、被引专利占比、后向引用次数、被引方技术类别数、有引用记录专利占比、专利一般性、专利独创性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 83,703 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的创新产出既可能是沿既有技术轨道的渐进改良,也可能是跨越技术边界的突破性探索。区分二者的一条经典思路,是观察专利在技术类别上的引用结构:一项发明如果被分布广泛的后续技术所借鉴,说明它的适用面超出了原有领域;一项发明如果建立在来源多元的既有知识之上,说明它的构思跨越了既有的技术分工。参考王群勇和张慧敏(2026)对 Hall et al.(2001) 经典测度的操作化,本数据集分别从这两个方向刻画企业专利的突破性,得到专利一般性与专利独创性两个指标。两者共用赫芬达尔-赫希曼指数的补数形式,以国际专利分类号的小类作为技术类别的划分单位,取值介于 0 与 1 之间。 专利一般性从技术的下游着眼,衡量引用该专利的后续专利在技术类别上的分散程度: $$Generality{p}=1-\sum{j=1}^{J}\left(\frac{N{pj}}{N{p}}\right)^{2}$$ 其中 $N{pj}$ 为引用专利 $p$ 且主分类属技术类别 $j$ 的专利件数,$N{p}$ 为专利 $p$ 被引用的总件数,$J$ 为这些引用方所覆盖的技术类别数。取值越接近 1,说明引用来自越多互不相同的技术领域,该专利的技术外溢面越广;若全部引用集中于单一类别,指标取 0。被引的观察窗口取专利申请当年起的三个年度,这一设定依据的是专利申请后的最初几年通常构成引用高峰,同时可使不同申请年份的专利面对等长的观察期。 专利独创性从技术的上游着眼,衡量该专利所引用的在先专利在技术类别上的分散程度: $$Originality{p}=1-\sum{j=1}^{J}\left(\frac{N{pj}}{N{p}}\right)^{2}$$ 其中 $N{pj}$ 为专利 $p$ 所引用的在先专利中主分类属技术类别 $j$ 的件数,$N{p}$ 为其引用的在先专利总件数。取值越高,说明该专利汲取的知识来源越多元,越可能出自跨领域的知识重组。与一般性不同,一项专利所引用的在先文献在申请时即已确定,因而不设观察窗口。 两个指标均先在专利层面逐件计算,再对企业当年申请并最终获得授权的发明专利取算术平均,得到企业-年度的测度。之所以限定于授权发明专利,是因为发明专利在创造性标准、审查程序与保护期限上的要求高于其他专利类型,经实质审查授权后更能反映真实的技术含量。窗口内没有被引记录的专利,其一般性计为 0;没有在先引用记录的专利,其独创性计为 0。主分类缺失或无法归入小类的引用边不进入任何一式的分子与分母。 除两个核心指标外,数据集给出六个构件字段:授权发明专利数、三年内被引次数、后向引用次数、引用方与被引方各自覆盖的技术类别数,以及被引专利占比与有引用记录专利占比。前五者对应上述公式的分母与求和上限,后两者用于判断各企业年引文记录的完整程度。需注意授权发明专利数的口径是"按申请年归属、截至数据快照已获授权"的件数,而非"当年申请且最终会获授权"的件数:发明专利自申请到授权通常需要数年,越靠近数据末端的申请年,已授权的部分越少且越偏向审查周期短的那一类专利。 补充说明 - 零值的三种含义(使用前务必区分):零值并非同一回事。其一是当年没有授权发明专利,指标本不适用;其二是有专利但窗口内没有可归类的引用记录;其三是有专利也有引用,但引用全部落在单一技术小类上——这是真实的低多样性取值,不是缺失。三者可由授权发明专利数与三年内被引次数(独创性对应后向引用次数)两列完全区分,无一遗漏。把三类零值混在同一个回归里,等于把"未从事专利活动"与"技术面狭窄"当作同一件事;建议先筛出有专利的子样本,或加入是否拥有专利的哑变量。 - 样本与专利归属:输出覆盖全部上市公司年度,不预先剔除行业与板块,使用者可自行设定回归样本。指标纳入上市公司本身及其子公司、合营企业与联营企业名下的专利,因为相当比例的研发成果登记在子公司名下,仅取本体会把集团型企业记为零专利;代价是水平值高于仅取本体的口径,独创性尤其明显。跨研究比较水平值时需注意该差异,组内比较与回归结论不受影响。 - 引文数据的年份效应:后向引用的收录在样本期最初几年明显偏低,早期独创性因而被压低,并在收录改善的年份出现一次跳升——这是收录范围变化而非技术演变。末端同样受两重影响:一般性依赖申请后第三个年度的引用,最近若干申请年尚未成熟;后向引用的数据快照亦早于专利明细,最末申请年中较晚公开的专利尚无在先引用记录。这些都可由被引专利占比与有引用记录专利占比两列识别。建议加年份固定效应,避免跨越收录变动点的水平比较,关注水平值时避开两端年份。 - 境外在先专利的分类号缺失:后向引用边中约十二分之一的在先专利没有可用主分类号,且高度集中于境外来源——英、法、德、欧专局与美国的缺失比例远高于国内。这些边不进入独创性计算,因此引用境外在先专利越多的企业被低估越多。这是与国际化程度相关的非随机偏误,年份固定效应无法吸收;研究国际化、海外并购或技术引进时应纳入稳健性讨论。 - 小样本噪声:指标为比值形式,仅有一件专利的企业年其取值即等于该件专利的取值。实测离散程度随专利件数单调收敛,专利极少的组变异系数数倍于专利密集的组,而这类企业年占比不低;一般性最高的那一批几乎全部只有一件专利,右尾不宜解读为创新强度高。建议以授权发明专利数加权,或排除专利过少的观测作稳健性检验。 - 其他局限:登记在上市之前年份、已退市代码、B 股代码或北交所旧证券代码下的专利不进入对应企业年,少数公司因此只统计到现用代码下的那部分专利;一件由多家上市公司联合申请的专利会同时计入各家。行业代码在北交所公司上的缺失比例明显高于其他板块,加行业固定效应时这部分观测会被丢弃。若需口径一致的专利数控制变量,请直接用本数据集的授权发明专利数一列。 参考文献 - 王群勇,张慧敏.产学研合作网络与企业突破性创新[J].世界经济,2026,49(6):163-195. - Hall B H, Jaffe A B, Trajtenberg M. The NBER patent citation data file: Lessons, insights and methodological tools[R]. NBER Working Paper No. 8498, 2001. - Acemoglu D, Akcigit U, Celik M A. Radical and incremental innovation: The roles of firms, managers, and innovators[J]. American Economic Journal: Macroeconomics, 2022, 14(3): 199-249. - Trajtenberg M, Henderson R, Jaffe A. University versus corporate patents: A window on the basicness of invention[J]. Economics of Innovation and New Technology, 1997, 5(1): 19-50.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。