股票名称相似度(拼音编辑距离法)
「股票名称相似度(拼音编辑距离法)」,覆盖 1993-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 71,751。 衡量上市公司因股票简称文本相似而可能引发的投资者混淆风险。
| 时间跨度 | 1993-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 71,751 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年份
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- Name [股票简称] — 当年使用的股票简称(清洗前原始名称)
- CoreName [核心名称] — 去除ST/*ST/PT/G/S等前缀和(退)等后缀的纯名称
- SnsLev [Levenshtein相似度] — 参考王意德等(2025, 证券市场导报)的方法,计算公式为:对股票A转拼音后,与所有上市更早且非同行业同地区的股票逐一计算Levenshtein距离,反向映射到[0,100]后取平均值。用作研究变量,越大代表股票名称与其他股票越相似
- SnsJac [Jaccard相似度] — 参考王意德等(2025, 证券市场导报)的方法,计算公式为:对股票A的拼音字符集与配对股票拼音字符集计算Jaccard相似度,映射到[0,100]后取平均值。作为Levenshtein指标的稳健性检验
- PairCount [配对数量] — 参与计算的有效配对股票数(剔除同行业且同地区后的上市更早股票数)。单位:个
常见问题
- 「股票名称相似度(拼音编辑距离法)」是什么数据集?
- 股票名称相似度(拼音编辑距离法),隶属基础参考数据。衡量上市公司因股票简称文本相似而可能引发的投资者混淆风险。
- 该数据集的时间范围是?
- 覆盖 1993-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:核心名称、Levenshtein相似度、Jaccard相似度、配对数量。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,751 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 股票名称相似度指标用于衡量一家上市公司股票简称与其他公司股票简称在文本上的相似程度。该指标基于文本相似度计算技术,旨在捕捉因名称相似可能引发的投资者混淆或信息传递效率问题。其核心计算思路参考王意德等(2025)提出的三步法。 首先,对股票简称进行预处理,得到核心名称。具体而言,将原始股票简称(Name)中的特殊前缀(如“ST”、“ST”、“PT”、“G”、“S”)和后缀(如“(退)”)去除,得到纯文本形式的CoreName。随后,将核心名称转换为包含声调的汉语拼音序列。 其次,为每只股票构建可比配对集合。对于目标股票A,在同年份的所有其他股票中,剔除与其同行业且同地区的股票。行业分类依据中上协行业分类(制造业取二级代码前两位,其他行业取门类首位),地区依据公司注册所在省份(Province)进行判断。配对集合通常限定为上市时间早于股票A的股票,以确保计算的历史可比性。PairCount字段记录了满足上述条件的有效配对股票数量。 最后,基于拼音序列,计算股票A与配对集合中每只股票的名称相似度。采用两种经典的文本相似度度量方法: 1. Levenshtein相似度(SnsLev):计算股票A的拼音序列与配对股票拼音序列之间的Levenshtein编辑距离(即将一个序列转换为另一个序列所需的最少单字符编辑操作次数)。将该距离反向线性映射到[0, 100]区间,值越大表示名称越相似。对所有有效配对的映射结果取算术平均值,即得到年度SnsLev指标。 2. Jaccard相似度(SnsJac):将股票A的拼音序列视为字符集合,计算其与配对股票拼音字符集合的Jaccard相似系数(即交集大小除以并集大小)。同样将该系数映射到[0, 100]区间后,对所有有效配对取平均值,得到年度SnsJac指标。该指标作为SnsLev的稳健性检验。 两种相似度指标的计算公式可概括为: $$Sns = \frac{1}{N} \sum{i=1}^{N} f(d(NameA, Namei))$$ 其中,$N$为有效配对数量(PairCount),$NameA$和$Namei$分别为股票A和第$i$只配对股票的核心名称拼音序列,$d(\cdot)$代表Levenshtein距离或Jaccard距离函数,$f(\cdot)$为将距离值映射到[0, 100]区间的线性变换函数。最终,SnsLev和SnsJac的值越大,表明该股票名称与同年份其他(非同行业同地区)股票的名称越相似。 补充说明 - 计算时仅使用股票在对应年份有效的简称。 - 行业与地区的匹配用于排除因集团内部关联或地域共性导致的合理名称相似,以聚焦于可能引发市场混淆的非关联名称相似。 - 配对计算通常要求至少存在一定数量的有效配对股票,以确保相似度度量的统计意义。 参考文献 [1]王意德,张兵,于琴.股票名称相似度与股价信息损失效应[J].证券市场导报,2025(2):58-67. [2]Pradhan N, Gyanchandani M, Wadhvani R. A review on text similarity technique used in IR and its application[J]. International Journal of Computer Applications, 2015, 120(9): 29-34.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。