经营业务文本竞争(经营范围余弦相似)
「经营业务文本竞争(经营范围余弦相似)」,覆盖 2000-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 88,855。 衡量企业间在产品市场的竞争关系强度。
| 时间跨度 | 2000-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 88,855 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- CompetitorCount [竞争者数量] — 参考Hoberg and Phillips (2016, JPE)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:经营范围文本余弦相似度>=0.3的企业数量。用作研究变量,越大代表产品市场竞争者越多。单位:家
- CompetDegreeLog [竞争程度(对数)] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:ln(文本相似度阈值内竞争者数量+1)。用作研究变量,越大代表产品市场竞争越激烈
- CompetDegreeHHI [竞争程度(负HHI)] — 参考Hoberg and Phillips (2010, RFS)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:竞争者集合(Top10最相似企业+自身)内营业收入集中度的负数。用作研究变量,越大(越接近0)代表收入分布越分散、竞争越激烈
- AvgSimilarity [平均相似度] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:所有相似度>=0.3的竞争者的平均余弦相似度。用作研究变量,越大代表与竞争者的业务重叠度越高
- MaxSimilarity [最大相似度] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:与所有其他企业的最大余弦相似度。用作研究变量,越大代表存在业务高度重叠的竞争对手
- Top10AvgSim [前10竞争者均值相似度] — 参考Hoberg and Phillips (2016, JPE)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:前10个最相似企业的平均余弦相似度。用作研究变量,越大代表核心竞争者集合的业务重叠度越高
常见问题
- 「经营业务文本竞争(经营范围余弦相似)」是什么数据集?
- 经营业务文本竞争(经营范围余弦相似),隶属基础参考数据。衡量企业间在产品市场的竞争关系强度。
- 该数据集的时间范围是?
- 覆盖 2000-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:竞争者数量、竞争程度(对数)、竞争程度(负HHI)、平均相似度、最大相似度、前10竞争者均值相似度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 88,855 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在基于上市公司披露的经营范围文本信息,构建衡量企业间产品市场竞争关系的指标。该方法借鉴了文本分析在产业组织与金融研究中的应用,通过计算企业间经营范围描述的文本相似度来识别潜在竞争者,进而量化竞争强度。其核心逻辑在于,业务描述越相似的企业,在产品市场上重叠的可能性越高,竞争关系也越直接。 首先,对每家上市公司年度报告中的“经营范围”文本进行中文分词处理,并构建二元(0/1)文档-词向量,即若某个词出现在公司经营范围中则记为1,否则记为0。在此基础上,计算任意两家公司$i$和$j$在年度$t$的文本余弦相似度$Similarity{ijt}$,该值衡量了两家公司业务描述的重叠程度。 为定义明确的竞争关系,设定一个相似度阈值(0.3)。当两家公司间的$Similarity{ijt} \geq 0.3$时,即认为二者存在竞争关系。对于每家公司,统计其满足该条件的竞争者数量,得到基础指标$CompetitorCount$。同时,记录所有竞争者与该公司相似度的平均值$AvgSimilarity$,以及所有公司对中与该公司相似度的最大值$MaxSimilarity$。此外,为聚焦于最直接的竞争对手,选取与该公司相似度最高的前10家企业(无论其相似度是否超过0.3),计算其平均相似度,得到$Top10AvgSim$。 为了更综合地衡量竞争程度,构建了两个衍生指标。一是竞争程度对数$CompetDegreeLog$,计算公式为$ln(CompetitorCount + 1)$,该值越大表明竞争者越多,市场竞争越激烈。二是基于赫芬达尔-赫希曼指数(HHI)的竞争程度指标$CompetDegreeHHI$。该指标首先构建一个包含公司自身及其前10个最相似竞争者的集合,计算该集合内各公司营业收入占集合总营收的平方和,即营收集中度HHI。$CompetDegreeHHI$定义为该HHI值的负数,即$-HHI$。因此,该值越大(越接近0),表明竞争者之间的营收分布越分散,市场结构越趋向于竞争而非垄断。 补充说明 - 竞争关系的判定基于文本相似度是否大于等于0.3。 - 计算$CompetDegreeHHI$时,所使用的竞争者集合为该公司自身及其前10个最相似的企业(按相似度排序)。 参考文献 [1]Hoberg G, Phillips G. Product market synergies and competition in mergers and acquisitions: a text-based analysis[J]. The Review of Financial Studies, 2010, 23(10): 3773-3811. [2]Hoberg G, Phillips G. Text-based network industries and endogenous product differentiation[J]. Journal of Political Economy, 2016, 124(5): 1423-1465. [3]潘红波,杨海霞.竞争者融资约束对企业并购行为的影响研究[J].中国工业经济,2022(7):159-177.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。