企业技术竞争压力(TF-IDF模型)

「企业技术竞争压力(TF-IDF模型)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 55,881。 基于上市公司发明专利摘要文本,用TF-IDF模型测度企业间技术相似度,将某企业与其他全部企业的技术相似度加总后除以100,得到该企业当年面临的技术竞争压力。

时间跨度2010-2025 年
数据频率年度
层级上市公司
变量数17
样本量55,881
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年份
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • InventionPatentStock [已授权发明专利存量] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))的方法,计算公式为:截至当年年末该企业累计已获得授权的发明专利篇数,由多个上市主体共同持有的专利按各持有方分别计数。用作研究变量,越大代表企业积累的核心技术资产越多。
  • PeerFirmCount [技术相似度计算公司数] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))的方法,计算公式为:当年拥有已授权发明专利存量、参与两两技术相似度计算的上市公司总数,即技术竞争压力求和式中的对手池规模。用作研究变量,越大代表当年纳入技术比较的竞争主体越多。
  • TechSimilaritySum [技术相似度之和] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))的方法,计算公式为:该企业与当年其他全部企业技术相似度的加总,其中两企业的技术相似度为双方专利组合文本TF-IDF向量的余弦值。用作研究变量,越大代表企业在技术领域与其他企业的重叠程度越高。
  • TechCompetitionPressure [技术竞争压力] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))的方法,计算公式为:该企业与其他全部企业的技术相似度之和除以100。企业专利组合取截至当年累计已授权的发明专利摘要文本,经分词后用TF-IDF模型构建词向量,两企业技术相似度为其向量的余弦值,逆文档频率与相似度均在当年横截面内计算。用作研究变量,越大代表企业面临的技术竞争压力越大。
  • TechCompetitionPressureTF [技术竞争压力(TF模型)] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))稳健性检验的方法,计算公式为:将专利组合文本向量由TF-IDF模型替换为TF模型(仅按词频构建向量、不做逆文档频率加权)后重新计算的技术相似度之和除以100,其余步骤与核心指标一致。用作研究变量,越大代表企业面临的技术竞争压力越大。
  • TechCompetitionPressureTitle [技术竞争压力(专利名称)] — 参考董礼等(2025,华侨大学学报(哲学社会科学版))稳健性检验的方法,计算公式为:考虑到专利摘要包含较多噪声信息,将文本来源由专利摘要替换为专利名称后重新计算的技术相似度之和除以100,其余步骤与核心指标一致。用作研究变量,越大代表企业面临的技术竞争压力越大。

常见问题

「企业技术竞争压力(TF-IDF模型)」是什么数据集?
企业技术竞争压力(TF-IDF模型),隶属创新与知识产权。基于上市公司发明专利摘要文本,用TF-IDF模型测度企业间技术相似度,将某企业与其他全部企业的技术相似度加总后除以100,得到该企业当年面临的技术竞争压力。
该数据集的时间范围是?
覆盖 2010-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:已授权发明专利存量、技术相似度计算公司数、技术相似度之和、技术竞争压力、技术竞争压力(TF模型)、技术竞争压力(专利名称)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 55,881 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业间的竞争已不再局限于产品市场维度,正加速向技术维度演进。技术具有独占性、跨产品市场边界性、高风险性与长周期性:一项技术知识可能契合多种产品,聚焦不同产品市场的企业也许共享某些技术特征,因而尽管企业间在其他方面差异巨大,在技术领域中的竞争却可能非常激烈。技术竞争压力刻画的正是这一维度的竞争强度——它来自与本企业技术相似的其他企业。对投资者而言,这是一种风险;对企业管理者而言,这是一种压力。本指标参考董礼等(2025)的方法,基于上市公司专利文本测度企业间的技术相似度,进而估计企业面临的技术竞争压力。 指标构造的理论基础在于:从竞争压力视角看,技术竞争的实质表现为企业在技术领域的重叠与可替代性。企业发明专利组合是其核心技术资产的集中体现,若与其他企业技术高度相似,意味着其在未来可能面临更高的知识产权冲突、技术替代压力和研发资源争夺,即技术竞争更为激烈。相对于以专利无效宣告或同行研发强度之比构造的替代测度,基于专利文本的相似度既能捕捉跨行业的技术冲击,又反映了创新投入向产出转化后的实际技术态势;同时,专利文本对财务数据依赖性弱,可以绕开因行业划分、人为标签或财务信息质量参差所造成的测度偏差。 测度沿四个步骤展开。第一步,在企业—年度层面归集发明专利文本。发明专利是企业的核心技术所在,故测度仅采用发明专利;并采用已授权发明专利存量反映企业的技术特征,即企业在某年的专利组合为截至该年年末累计已获授权的全部发明专利。第二步,对发明专利摘要文本分词。为提升专利技术语料的分词效果,将搜狗细胞词库"自然科学"分类下的全部词库导入 jieba 分词词典,并删除标点符号与停用词。第三步,采用 TF-IDF 模型将各企业当年的专利组合表示为词向量,两企业间的技术相似度定义为其向量的余弦值: $$ SIM{i,j,t}=\frac{\mathbf{v}{i,t}\cdot \mathbf{v}{j,t}}{\lVert \mathbf{v}{i,t}\rVert\,\lVert \mathbf{v}{j,t}\rVert} $$ 其中 $\mathbf{v}{i,t}$ 为企业 $i$ 在第 $t$ 年专利组合文本的 TF-IDF 向量。词的逆文档频率与相似度均在同一年度的横截面内计算,对手池为当年拥有已授权发明专利存量的全部上市公司。第四步,将该企业与其他企业之间的技术相似度加总并除以 100,得到该企业当年的技术竞争压力: $$ TPC{i,t}=\frac{1}{100}\sum{j\neq i} SIM{i,j,t} $$ 除核心指标外,本数据集给出计算链上的两个构件:技术相似度之和(即上式未经除以 100 的分子)与当年参与两两相似度计算的公司总数(即求和式的对手池规模),以及已授权发明专利存量本身。 需要强调指标的两个构念特征。其一,由于余弦相似度已按文档长度归一,技术竞争压力衡量的并非专利数量,而是企业技术词汇的宽度与通用性:技术高度专精的企业即便专利存量庞大,与对手池的整体重叠仍可能有限,因而取值不高;反之,技术组合横跨多个领域的企业更容易与大量企业产生文本重叠。其二,上游专利库同时收录上市公司本身、其子公司与联营企业的专利,故指标度量的是上市公司及其关联专利池的技术宽度,而非仅母公司自有技术;以对外投资与企业孵化为主业的公司,其专利池由被投企业构成,技术领域天然分散。 本数据集另按原文稳健性检验提供两个替代口径。其一是将文本向量由 TF-IDF 模型替换为 TF 模型,即仅按词频构建向量而不做逆文档频率加权;其二是考虑到专利摘要包含较多噪声信息,将文本来源由专利摘要替换为专利名称。两个替代口径的其余步骤与核心指标完全一致。 补充说明 - 样本口径:输出为全部上市公司—年度面板,不预先施加原文回归阶段的样本限制(剔除上市当年、金融行业、特别处理公司与变量缺失观测)与缩尾处理,使用者可按研究需要自行设定。当年没有已授权发明专利存量的企业,其技术相似度之和与技术竞争压力取零,与原文描述统计中该变量最小值为零一致。 - 早期年份的可用性:上游专利数据对较早年份申请的发明专利普遍缺少授权状态与授权日期记录,授权率随申请年份推移才逐步升至正常水平,这些专利不会进入任何年度的存量。因此存量口径的有效起点落在授权记录开始成规模的年度(年份区间由数据自动推导而非写定),且样本前段数年的零值比重明显高于其后年份——这部分低值主要反映记录缺失而非真实的低技术竞争压力,且缺失程度与企业上市年龄相关。建议实证样本自授权记录趋于完整的年度起算,而非直接使用面板首年。 - 时序性质与回归设定建议:本指标为相似度加总,水平同时取决于企业间技术重叠程度与当年对手池规模。随着上市公司数量增加与专利存量累积,指标呈系统性上升;即便企业自身专利存量在相邻年度完全未变,其取值仍会因其他企业存量增长与逆文档频率重估而上升。因此不宜直接跨年度比较,且仅控制年度固定效应并不充分:在企业与年度双向去均值后,指标残差与专利存量的对数仍有相当强的相关。实证中建议在年度固定效应之外同时控制专利存量的对数,或改用年内标准化值;否则识别出的可能是创新产出规模效应,而非技术竞争效应。 - 分词词库与停用词:原文表述为导入"搜狗自然科学词库"。经核查,搜狗细胞词库中"自然科学"是一个包含数学、物理、化学、生物、天文、气象、海洋、地理地质等子领域的词库分类,而非某个单一词库,故本实现取该分类下全部词库合并去重后作为用户词典。停用词表原文未予公布,本实现采用为中国专利摘要文本建模构建的停用词表,其中既含通用虚词,也含"本发明""所述""装置""系统"一类近乎每篇专利都会出现的套语与通用器物名词,以降低套语对余弦相似度的抬升。除标点与停用词外,分词结果还剔除了长度小于两个字符的词,这在滤去分词碎片的同时也会滤去少数单字实义技术词,使词向量略偏向多字术语。 - 专利归属与对手池:部分专利记录同时关联多个上市公司代码,按项目惯例展开后计入各关联公司,与其他专利派生数据集口径保持一致。少数企业的专利几乎全部来自此类共同持有记录,其技术组合与共同持有方高度雷同,且这类观测在取值分布的头部占有一定比重,使用时建议结合企业所属行业对头部观测做稳健性剔除。此外,每年的对手池定义为当年拥有已授权发明专利存量的全部上市主体,其中包含当年尚未上市或已退市的公司,样本前段年份这一比重相对更高。 - 两个替代口径的适用范围:TF 口径与核心口径的年内排序高度一致,信息增量有限;专利名称口径因文本极短,小存量企业的向量易被通用套语主导而取值偏高,与核心口径的年内排序一致性中等,更适合在专利存量较大的子样本中使用。两者均忠实复现原文稳健性检验。 - 其他局限:零值同时包含真实没有发明专利、有申请但未获授权、以及早期授权记录缺失三种来源,彼此不可区分,建议按删失数据处理或另加是否拥有授权发明专利存量的虚拟变量;技术竞争主体限于上市公司,来自非上市企业的压力未纳入;最近年度因专利从申请到授权存在时滞而覆盖不完整;县级市层级的城市区划代码存在一定比例的匹配缺口,且在县级市密集的省份更为集中,做城市层面分析时需注意;TF-IDF 属词袋模型,在理解专利文本语义方面弱于深度学习与大语言模型。 参考文献 - 董礼,刘俊现,杨景涵,等.技术竞争的公司治理效应——基于专利文本的指标测度与检验[J].华侨大学学报(哲学社会科学版),2025(6):105-115. - Hoberg G, Phillips G. Text-based network industries and endogenous product differentiation[J]. Journal of Political Economy, 2016, 124(5): 1423-1465.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。