数字经济专利(CNIPA分类识别)
「数字经济专利(CNIPA分类识别)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 94,496。 衡量上市公司的数字技术创新能力。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 94,496 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年份
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- DigiPatCount [数字技术专利数] — 年度数字技术相关专利申请数量,依据CNIPA(2023)关键数字技术专利分类体系的IPC前缀识别,涵盖AI/大数据/云计算/区块链/物联网/工业互联网等数字技术领域。单位:件
- DigiPatRatio [数字专利占比] — 参考CNIPA(2023)数字经济核心产业分类,计算公式为:数字技术专利数/总专利申请数。无专利企业为0。单位:比例
- DigiPatLn [数字专利对数] — 计算公式为:ln(1+数字技术专利数),用于回归分析中缓解右偏分布
- DigitalProximity [数字技术接近度] — 借鉴Jaffe(1986,AER)的技术向量方法,计算公式为:企业IPC子类向量与数字技术参考向量的余弦相似度。参考向量由截至当年所有数字专利的IPC分布构建(避免前视偏差)。范围[0,1],越高表示企业技术组合越接近数字经济,用作研究变量,越大代表数字技术融合程度越高。单位:比例
- DigiAICount [AI专利数] — 人工智能相关专利申请数量,依据CNIPA(2023)关键数字技术分类的人工智能分支IPC前缀(G06N3/G06N20/G06V/G10L15等)识别。单位:件
- DigiBigDataCount [大数据专利数] — 大数据相关专利申请数量,依据CNIPA(2023)数字经济分类的大数据相关IPC前缀(G06F16/H04L67/G16Y40等)识别。注意:与AI专利数非互斥,不可直接加总。单位:件
常见问题
- 「数字经济专利(CNIPA分类识别)」是什么数据集?
- 数字经济专利(CNIPA分类识别),隶属数字化转型与人工智能。衡量上市公司的数字技术创新能力。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:数字技术专利数、数字专利占比、数字专利对数、数字技术接近度、AI专利数、大数据专利数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 94,496 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在衡量中国上市公司的数字技术创新能力。其核心是依据国家知识产权局(CNIPA)于2023年发布的《关键数字技术专利分类体系》和《数字经济核心产业分类》,从上市公司专利申请中识别出与数字技术相关的专利,并在此基础上构建一系列反映企业数字创新活动的指标。数字技术涵盖人工智能、大数据、云计算、区块链、物联网、工业互联网等核心领域。 基础变量为企业的年度专利申请数据。首先,根据CNIPA(2023)分类体系提供的国际专利分类(IPC)前缀,识别出属于数字技术范畴的专利。由此得到核心指标数字技术专利数(DigiPatCount),即企业当年申请的数字技术相关专利数量。为便于在回归分析中使用,同时计算其对数形式数字专利对数(DigiPatLn),计算公式为: $$DigiPatLn = \ln(1 + DigiPatCount)$$ 此外,为衡量数字创新在企业整体创新活动中的相对重要性,计算数字专利占比(DigiPatRatio),即数字技术专利数与企业当年总专利申请数的比值。对于当年无专利申请的企业,该指标取值为0。 为进一步刻画企业在特定数字技术子领域的创新产出,数据集提供了细分指标,包括人工智能专利数(DigiAICount)和大数据专利数(DigiBigDataCount)。这两个指标分别依据CNIPA(2023)分类中对应技术分支的IPC前缀进行识别。需要注意的是,由于一项专利可能同时涉及多个技术领域(例如,一项专利可能同时被归类为人工智能和大数据),因此这两个细分指标之间并非互斥关系,不可直接加总。 最后,借鉴Jaffe(1986)的技术向量方法,构建了数字技术接近度(DigitalProximity)指标。该指标用于衡量企业整体技术组合与数字技术领域的相似程度。具体而言,首先构建一个数字技术参考向量,其元素为截至当年所有数字技术专利在各个IPC子类上的分布比例(此方法避免了使用未来信息的前视偏差)。然后,计算企业当年所有专利(包括非数字专利)的IPC子类分布向量。该指标即为企业技术向量与数字技术参考向量之间的余弦相似度,计算公式为: $$DigitalProximity = \frac{\mathbf{F}f \cdot \mathbf{F}d}{||\mathbf{F}f|| \times ||\mathbf{F}d||}$$ 其中$\mathbf{F}f$为企业$f$的专利技术向量,$\mathbf{F}d$为数字技术参考向量。该指标取值范围为[0, 1],数值越高,表明企业的技术组合与数字经济核心技术的融合程度越高。 补充说明 - 数字技术专利的识别严格依据CNIPA(2023)发布的官方分类体系中的IPC前缀进行。 - 数字技术接近度指标计算中的参考向量,是基于截至当年(不含当年之后)的所有数字技术专利的IPC分布动态构建的,以避免前视偏差。 - 对于当年总专利申请数为0的企业,其数字专利占比(DigiPatRatio)定义为0。 参考文献 - Jaffe A B. Technological opportunity and spillovers of R&D: evidence from firms’ patents, profits, and market value[J]. The American Economic Review, 1986, 76(5): 984-1001.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。