经营业务文本竞争(年报业务文本余弦相似)
「经营业务文本竞争(年报业务文本余弦相似)」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 44,599。 衡量企业间在产品市场的竞争关系强度。
| 时间跨度 | 2015-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 44,599 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- CompetitorCount [竞争者数量] — 参考Hoberg and Phillips (2016, JPE)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:当年年报经营业务描述文本的二元(0/1)词向量余弦相似度超过当年校准阈值的其他上市公司数量。阈值按Hoberg and Phillips (2016, JPE)的行业粒度校准原则逐年标定,使文本竞争关系的密度与中上协二级行业分类的密度一致。用作研究变量,越大代表产品市场竞争者越多。单位:家
- CompetDegreeLog [竞争程度(对数)] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:ln(当年竞争者数量+1)。用作研究变量,越大代表产品市场竞争越激烈
- CompetDegreeHHI [竞争程度(负HHI)] — 参考Hoberg and Phillips (2010, RFS)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:当年竞争者集合(相似度超过当年阈值的企业中最相似的至多10家)与企业自身构成的组合内,各企业营业收入占总收入比重的平方和的相反数。当年无竞争者时取空值。用作研究变量,越大(越接近0)代表收入分布越分散、竞争越激烈
- AvgSimilarity [平均相似度] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:当年全部竞争者(相似度超过当年校准阈值者)的余弦相似度算术平均值。当年无竞争者时取空值。用作研究变量,越大代表与竞争者的业务重叠度越高
- MaxSimilarity [最大相似度] — 参考Hoberg and Phillips (2016, JPE)的方法,计算公式为:当年与其他所有上市公司经营业务文本余弦相似度的最大值。用作研究变量,越大代表存在业务高度重叠的竞争对手
- Top10AvgSim [竞争者集合均值相似度] — 参考Hoberg and Phillips (2016, JPE)和潘红波、杨海霞(2022, 中国工业经济)的方法,计算公式为:当年竞争者集合(相似度超过当年校准阈值的企业中最相似的至多10家)的余弦相似度算术平均值。当年无竞争者时取空值。用作研究变量,越大代表核心竞争者集合的业务重叠度越高
- SimThreshold [相似度阈值] — 当年判定竞争关系的余弦相似度阈值。参考Hoberg and Phillips (2016, JPE)的行业粒度校准原则,计算公式为:使相似度超过该值的公司对数量占比等于同属一个中上协二级行业的公司对数量占比的分位点。同一年度内所有公司取值相同,用于口径核查与稳健性检验,非研究变量
- BizTextLen [经营业务文本长度] — 公司当年年度报告经营业务描述章节(2015-2020年为“公司业务概要”节,2021年起为管理层讨论与分析中的“报告期内公司从事的业务情况”)经清洗后的字符数。用于评估文本质量与数据可靠性,非研究变量。单位:字符
常见问题
- 「经营业务文本竞争(年报业务文本余弦相似)」是什么数据集?
- 经营业务文本竞争(年报业务文本余弦相似),隶属基础参考数据。衡量企业间在产品市场的竞争关系强度。
- 该数据集的时间范围是?
- 覆盖 2015-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:竞争者数量、竞争程度(对数)、竞争程度(负HHI)、平均相似度、最大相似度、竞争者集合均值相似度、相似度阈值、经营业务文本长度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 44,599 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集基于上市公司年度报告披露的经营业务描述文本,构建衡量企业间产品市场竞争关系的指标。其核心逻辑在于,业务描述越相似的企业,在产品市场上的重叠程度越高,竞争关系也越直接。相较于以行业分类界定竞争者的传统做法,文本方法允许竞争关系跨越行业边界,并随企业业务的调整逐年变化。 文本来源为上市公司年度报告中的经营业务描述章节。该章节在年报中的位置随信息披露格式的演进而变化:在设立独立“公司业务概要”章节的年份取该章节;在业务描述并入“管理层讨论与分析”的年份,取其中“报告期内公司从事的业务情况”一节;北京证券交易所上市公司年报中取“业务概要”节。逐份年报按上述层级依次定位并提取相应文本,同时排除目录页中的同名条目。 对每家公司在每个年度的经营业务文本进行中文分词,剔除排除性语句(如“X业务除外”“不含X业务”)以及经营范围模板词、年报披露套话等无区分度词汇,随后构建二元(0/1)文档—词向量 $V{d,t}$:若某词出现在该公司当年的经营业务文本中则该元素取 1,否则取 0。词表在每个年度内独立构建。 在此基础上,计算任意两家公司 $i$ 与 $j$ 在年度 $t$ 的经营业务余弦相似度: $$Similarity{i,j,t} = \frac{V{i,t} \cdot V{j,t}}{|V{i,t}| \times |V{j,t}|}$$ 该值在 $[0,1]$ 区间取值,越接近 1 说明两家公司的经营业务越相似,越接近 0 说明差异越大。 竞争关系的判定需要设定相似度阈值 $\thetat$。本数据集按 Hoberg and Phillips (2016) 处理文本行业网络阈值的原则逐年校准:选取 $\thetat$,使“相似度超过 $\thetat$ 的公司对数量占全部公司对的比重”等于“同属一个中上协二级行业的公司对数量占全部公司对的比重”,从而将文本竞争关系的密度锚定在既有行业分类的粒度上。当 $Similarity{i,j,t} \thetat$ 时,认为公司 $i$ 与公司 $j$ 在年度 $t$ 存在竞争关系。该阈值以 $SimThreshold$ 字段随数据一并提供,同一年度内所有公司取值相同。 基于上述竞争关系,构建以下指标。竞争者数量 $CompetitorCount$ 为当年相似度超过阈值的其他上市公司家数;竞争程度对数 $CompetDegreeLog$ 为 $\ln(CompetitorCount + 1)$,取值越大表明产品市场竞争者越多。平均相似度 $AvgSimilarity$ 为当年全部竞争者相似度的算术平均值,最大相似度 $MaxSimilarity$ 为当年与其他所有上市公司相似度的最大值。 进一步定义竞争者集合 $C{i,t}$:在相似度超过阈值的企业中,选取与公司 $i$ 最相似的至多 10 家;若超过阈值的企业不足 10 家,则以该范围内的实际家数为准。竞争者集合均值相似度 $Top10AvgSim$ 为该集合内相似度的算术平均值。竞争程度(负 HHI)$CompetDegreeHHI$ 则刻画竞争者集合内部的收入分布:以公司自身与其竞争者集合构成的企业组合为范围,计算各企业营业收入占组合总收入比重的平方和(即赫芬达尔—赫希曼指数),并取其相反数: $$CompetDegreeHHI{i,t} = -\sum{j \in C{i,t} \cup \{i\}} \left( \frac{Revenue{j,t}}{\sum{k \in C{i,t} \cup \{i\}} Revenue{k,t}} \right)^2$$ 该值越大(越接近 0),表明竞争者之间的收入分布越分散、市场结构越趋于竞争。营业收入取自年度报告口径的合并利润表。 补充说明 - 阈值逐年校准而非跨年固定,源于经营业务文本篇幅在样本期内持续增长这一事实。在二元向量下,文本越长则词汇重叠越多、余弦相似度整体抬升;若采用跨年固定阈值,竞争者数量会随年报篇幅增长而机械上升,而这一变化并不反映竞争格局的真实变动。逐年校准消除了该影响,使竞争者数量的年际差异反映企业在文本空间中相对位置的变化。 - 相似度的绝对水平($AvgSimilarity$、$MaxSimilarity$、$Top10AvgSim$)仍受年报篇幅变化影响,跨年度比较其绝对值时宜谨慎;涉及时间维度的实证设定建议加入年份固定效应。 - 样本区间取决于年报中经营业务描述章节的披露制度。在该章节确立之前的年报不含对应内容,其相近位置的“董事会报告—主营业务分析”以经营业绩讨论为主,与业务描述口径不可比,故未纳入本数据集。 - 当公司在某年度不存在相似度超过阈值的竞争者时,竞争者集合为空,此时 $CompetDegreeHHI$、$AvgSimilarity$ 与 $Top10AvgSim$ 取空值,$CompetitorCount$ 取 0。 - 文本方法识别的竞争关系可以跨越行业分类边界,这既是该方法相对行业分类法的主要优势,也意味着竞争者集合与同行业企业集合并不重合。 - $BizTextLen$ 字段记录当年经营业务文本经清洗后的字符数,可用于筛选文本过短的样本或作为稳健性检验的控制变量。 - 本数据集未预先剔除 ST/PT 与金融行业样本,亦未做缩尾处理,研究者可按研究设计自行处理。 参考文献 [1]Hoberg G, Phillips G. Product market synergies and competition in mergers and acquisitions: a text-based analysis[J]. The Review of Financial Studies, 2010, 23(10): 3773-3811. [2]Hoberg G, Phillips G. Text-based network industries and endogenous product differentiation[J]. Journal of Political Economy, 2016, 124(5): 1423-1465. [3]潘红波,杨海霞.竞争者融资约束对企业并购行为的影响研究[J].中国工业经济,2022(7):159-177.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。