企业算法创新(MacBERT模型)
「企业算法创新(MacBERT模型)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 82,812。 基于MacBERT大语言模型(CoSENT微调+Mean Pooling)对专利摘要文本做深度语义识别, 以余弦相似度阈值0.
| 时间跨度 | 1986-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 82,812 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 公历年份。申请口径列按专利申请年计数, 授权口径列按专利授权年计数。
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PatentTotalApp [当年新申请专利总数] — 企业当年新申请的发明与实用新型专利总数(含本身及子公司/联营/合营, 多主体共有专利各计一次), 作申请窗口算法专利占比的分母与语料基数。用作研究变量, 越大代表企业专利申请活动越活跃。
- AlgoPatentApp [当年新申请算法专利数] — 参考蒋伟杰等(2026,数量经济技术经济研究)的方法, 用MacBERT(CoSENT微调+Mean Pooling)将专利摘要与预定主题'应用在某个领域的数据处理、分析、利用的算法或方法'分别向量化并计算余弦相似度, 相似度>=0.61判定为算法专利; 计算公式为: 企业当年(按申请年)新申请的算法专利数量。用作研究变量, 越大代表企业算法创新活动越活跃。
- LnAlgoPatentApp [新申请算法专利数对数] — 参考蒋伟杰等(2026,数量经济技术经济研究)的方法, 计算公式为: ln(1+当年新申请算法专利数), 对右偏计数与零值作对数化处理。用作研究变量, 越大代表企业算法创新水平越高。
- PatentTotalGrant [当年新授权专利总数] — 企业当年新获授权的发明与实用新型专利总数(按授权年, 含本身及子公司/联营/合营, 多主体共有专利各计一次), 作授权窗口算法专利占比的分母与语料基数, 使无新申请仅有授权的企业年可解读。用作研究变量。
- AlgoPatentGrant [当年新授权算法专利数] — 参考蒋伟杰等(2026,数量经济技术经济研究)的方法(算法专利识别同新申请口径, MacBERT余弦相似度>=0.61), 计算公式为: 企业当年(按授权年)新获授权的算法专利数量, 对应论文头号度量'新授权算法专利'的企业层面口径。用作研究变量, 越大代表企业算法创新产出越多。注: 近3-4年因专利授权滞后而系统性偏低, 慎用于近年截面。
- LnAlgoPatentGrant [新授权算法专利数对数] — 参考蒋伟杰等(2026,数量经济技术经济研究)的方法, 计算公式为: ln(1+当年新授权算法专利数), 对应论文lnalgo的企业层面对数处理。用作研究变量, 越大代表企业算法创新水平越高。
常见问题
- 「企业算法创新(MacBERT模型)」是什么数据集?
- 企业算法创新(MacBERT模型),隶属创新与知识产权。基于MacBERT大语言模型(CoSENT微调+Mean Pooling)对专利摘要文本做深度语义识别, 以余弦相似度阈值0.
- 该数据集的时间范围是?
- 覆盖 1986-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:当年新申请专利总数、当年新申请算法专利数、新申请算法专利数对数、当年新授权专利总数、当年新授权算法专利数、新授权算法专利数对数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 82,812 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 算法是依据特定逻辑规则对输入数据进行处理以生成输出的一组明确计算步骤,是将数据要素潜在价值转化为现实生产力的核心工具。本数据集参考蒋伟杰、齐晨扬、陈琦(2026,数量经济技术经济研究)的方法,从专利文本出发识别"算法专利",并按企业—年度汇总,度量企业层面的算法创新水平。相较于以年报关键词词频衡量数字化的做法(易受管理层策略性披露干扰、反映"怎么说"而非"怎么做"),也相较于以国际专利分类号(IPC)粗略匹配的做法(IPC 重功能分类而轻应用分类、类目过粗,难以精准识别算法主题),基于专利摘要文本的语义识别能更客观地刻画企业在算法驱动数据利用方面的真实水平。 算法专利被界定为"能够对特定领域的数据进行处理、分析或利用的技术",其应同时具备两项语义特征:一是属于数据处理、分析或利用领域的技术创新(通常涉及"数据""处理"),二是核心改进为算法或方法层面的创新(通常涉及"算法""方法")。为让计算机理解复杂的专利语义,本数据集不采用受分词误差累积影响的关键词向量化方法,而是使用在中文语义相似度语料上经 CoSENT 方法微调、并采用 Mean Pooling 池化策略的 MacBERT 大语言模型,将文本映射为覆盖全文的全局语义向量。 识别流程逐层复现原文的"专利主题分析模型"三层结构。首先,用自然语言设定一个预定主题文本:"应用在某个领域的数据处理、分析、利用的算法或方法"(该表述综合了上述两项语义特征)。其次,用微调后的 MacBERT 模型对每条专利摘要文本与该预定主题文本分别编码,并经 Mean Pooling 降维得到等长语义向量。最后,计算专利摘要向量 $A$ 与预定主题向量 $B$ 的余弦相似度: $$\cos(A,B)=\frac{A\cdot B}{\lVert A\rVert\,\lVert B\rVert}$$ 余弦相似度取值于 $[-1,1]$,文本语义越接近则越趋近 1。对每条专利以阈值 0.61 判定其是否为算法专利: $$\mathrm{IsAlgo}p=\mathbb{1}\!\left[\cos(Ap,B)\ge 0.61\right]$$ 该阈值取自原文,经人工标注检验,在此阈值下模型筛选结果与人工标定的匹配率超过 80%。识别对象为发明专利与实用新型专利;一条专利若由多个上市主体(企业本身及其纳入合并范围的子公司、联营、合营方)共同拥有,则归属于每一家参与主体,同一专利在同一主体内只计一次。 在此基础上,本数据集从"申请"与"授权"两个时间口径按企业—年度汇总,两口径并列产出、不分主次,供研究者按需选用。申请口径以专利申请年份 $t$ 计数,反映创新发生的时点,与创新机制研究常用的专利申请量口径一致: $$\mathrm{AlgoPatentApp}{it}=\sum{p}\mathrm{IsAlgo}p\cdot\mathbb{1}\!\left[\text{申请年}p=t,\ \text{主体}p=i\right]$$ 授权口径以专利授权年份计数,对应原文头号度量"新授权算法专利"的企业层面口径。同时提供两个窗口各自的专利总数($\mathrm{PatentTotalApp}$、$\mathrm{PatentTotalGrant}$)作为语料基数与占比分母,其中授权窗口的专利总数使"当年无新申请、仅有专利授权"的企业年份亦可解读。由于企业—年度层面多数取值为 0 且计数分布右偏,对算法专利数作对数化处理: $$\mathrm{LnAlgoPatentApp}{it}=\ln\!\left(1+\mathrm{AlgoPatentApp}{it}\right),\qquad \mathrm{LnAlgoPatentGrant}{it}=\ln\!\left(1+\mathrm{AlgoPatentGrant}{it}\right)$$ 指标数值越大,代表企业算法创新活动越活跃、水平越高。 补充说明 关于计量口径的说明。原文头号变量在城市层面度量(以企业所在城市当年新授权算法专利数刻画地区算法创新水平),以缓解持证与非持证企业间的样本选择偏误及算法专利开发方、使用方的空间错配。本数据集为企业主体面板,忠实复现原文明确讨论并用于稳健性检验的"直接使用企业层面算法创新"口径,产出企业层面的算法专利数量。 关于识别阈值的重要披露。原文的阈值 0.61 是在作者自有的微调模型实例上、按与人工标注的匹配率标定得到的;由于句向量的余弦绝对尺度不在不同模型实例之间可比,本数据集所用公开同管线模型实例的余弦分布相对更为压缩(中位数约 0.52、90 分位约 0.61),阈值 0.61 恰落在其 90 分位附近。因此,即便在与原文完全相同的专利总体上(上市公司体系的发明与实用新型专利,2010—2021 年约 337 万条,与原文约 310 万条为同一总体,并非全国专利池),本数据集在 0.61 阈值下识别出的算法专利占比约为 9.6%,而原文口径约为 1.6%,二者相差约 6 倍。此差异源于阈值在不同模型实例之间的迁移,而非样本选择差异。对原文示例中的三个典型专利,本实现在 0.61 阈值下均正确复现(数据处理算法类专利的余弦约 0.77、判为算法专利;仅满足单一特征的两个反例余弦约 0.55 与 0.59、判为非算法专利),说明清晰案例分离良好,占比偏高主要由阈值附近的边界专利所致。占比的绝对水平偏高,但阈值的平移不改变企业间按算法专利强度的相对排序(高余弦专利更多者恒排在前),因而对含企业固定效应的面板研究,结论稳健性受影响较小。为保持方法一致性,阈值严格沿用原文设定的 0.61,不按目标占比反向标定;使用者若需更严口径,可自行提高判定阈值。 关于变量使用的两点提醒。授权口径受专利授权行政滞后影响,最近三至四个年度(发明专利授权通常滞后申请二至四年)的新授权算法专利数被系统性低估,不宜用于近年截面分析或以近年为主的面板;如使用授权口径,建议将样本截至授权较完整的年份。此外,企业—年度层面约七成观测的算法专利数为 0,其中既包含当年无专利活动的"结构零",也包含有专利但无算法专利的"抽样零";以对数指标做线性回归会损失这一区分,严谨的计数研究可考虑零膨胀或栏栅(Hurdle)模型,并以当年专利总数作为暴露(exposure)变量。年份下限随数据、上限取当前自然年的前一年(丢弃数据严重不齐全的当年),均不作硬编码;即便如此,保留的最近一两个申请年份仍因专利公开约十八个月的滞后而不完整。 参考文献 - 蒋伟杰,齐晨扬,陈琦.算法创新与企业全要素生产率提升——来自专利文本的经验证据[J].数量经济技术经济研究,2026,(5):30-53. - 刘青,肖柏高.劳动力成本与劳动节约型技术创新——来自AI语言模型和专利文本的证据[J].经济研究,2023,(2):74-90. - Cui Y, Che W, Liu T, et al. Revisiting Pre-trained Models for Chinese Natural Language Processing[C]//Findings of the Association for Computational Linguistics: EMNLP 2020. Stroudsburg: Association for Computational Linguistics, 2020: 657-668. - 苏剑林.CoSENT(一):比Sentence-BERT更有效的句向量方案[EB/OL].(2022-01-06)[2026-07-23].https://kexue.fm/archives/8847.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。