成交量信息含量(LMSW)
「成交量信息含量(LMSW)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 65,994。 衡量股价中所包含的私有信息程度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 65,994 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [股票名称] — 股票简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- C2 [LMSW系数] — 参考Llorente, Michaely, Saar & Wang (2002, RFS)的方法,计算公式为:回归R_{t+1}=C0+C1*R_t+C2*V_t*R_t+C3*R_{m,t+1}+e中交互项V_t*R_t的系数,其中V_t为去趋势对数周成交量(减26周移动均值)。C2越大代表知情交易程度越高、股价信息含量越大。用作研究变量,越大代表股价信息含量越高
- C2Tstat [LMSW系数t值] — 参考Llorente et al. (2002, RFS)的方法,计算公式为:C2系数的t统计量,即C2估计值除以其标准误
- C1 [收益率自相关系数] — 参考Llorente et al. (2002, RFS)的方法,计算公式为:回归模型中当期收益率R_t的系数,反映收益率序列自相关程度
- NumWeeks [回归周数] — 该stock-year用于OLS回归的周观测数量,最少30周。单位:周
- AdjR2 [调整R方] — 回归模型的调整R方,计算公式为:1-(1-R2)*(n-1)/(n-k),其中k为自变量个数。单位:比例
- IsInformed [是否知情交易主导] — 是否知情交易主导(0=否,1=是)。参考Llorente et al. (2002, RFS)的方法,当LMSW系数C2>0时判定为知情交易主导
常见问题
- 「成交量信息含量(LMSW)」是什么数据集?
- 成交量信息含量(LMSW),隶属市场交易数据。衡量股价中所包含的私有信息程度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:LMSW系数、LMSW系数t值、收益率自相关系数、回归周数、调整R方、是否知情交易主导。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 65,994 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 成交量信息含量(LMSW)指标基于Llorente等(2002)提出的理论模型构建,用于度量股价中所包含的私有信息程度。该模型的核心思想是,成交量与当期收益率的交互项对未来收益率的预测能力,能够反映知情交易活动的强度。当知情交易者基于私有信息进行交易时,其交易行为(体现为成交量)会推动股价向基本面价值调整,从而削弱收益率序列的自相关性。因此,成交量与当期收益率的乘积对未来收益率具有正向预测作用,其预测系数的大小可用于衡量股价的信息含量。 具体计算时,对每只股票在每一年度内,使用周频数据进行如下时间序列回归: $$ R{i,t+1} = C0 + C1 R{i,t} + C2 (V{i,t} \times R{i,t}) + C3 R{m,t+1} + e{i,t+1} $$ 其中,$R{i,t+1}$为股票$i$在第$t+1$周的收益率,$R{i,t}$为其在第$t$周的收益率,$R{m,t+1}$为第$t+1$周的市场收益率。$V{i,t}$为经过去趋势化处理的对数周成交量,具体计算方法为当期对数成交量减去其过去26周的移动平均值。该回归模型中的核心解释变量为交互项$V{i,t} \times R{i,t}$,其系数$C2$即为LMSW系数。 $C2$的经济含义是成交量对收益率自相关性的调节效应。一个显著为正的$C2$值意味着,在高成交量伴随的当期收益之后,未来收益率倾向于与当期收益同向变动,这被解释为知情交易者基于私有信息进行交易,并驱动价格持续调整,从而提高了股价的信息含量。因此,$C2$值越大,代表知情交易程度越高,股价信息含量越大。基于此,衍生出二元变量$IsInformed$,当$C2 0$时取值为1,表示该股票在该年度由知情交易主导,否则取值为0。回归同时提供收益率自相关系数$C1$、$C2$的t统计量$C2Tstat$、回归模型的调整R方$AdjR2$以及用于回归的有效周观测数$NumWeeks$。 补充说明 - 回归要求每只股票每年至少有30个有效的周观测值。 - 对数成交量$V{i,t}$进行了去趋势化处理,即减去其过去26周的移动平均值,以消除长期趋势的影响。 参考文献 [1] Llorente G, Michaely R, Saar G, et al. Dynamic volume-return relation of individual stocks[J]. The Review of Financial Studies, 2002, 15(4): 1005-1047. [2] Fernandes N, Ferreira M A. Insider trading laws and stock price informativeness[J]. The Review of Financial Studies, 2009, 22(5): 1845-1887. [3] 钟覃琳, 陆正飞. 资本市场开放能提高股价信息含量吗?——基于"沪港通"效应的实证检验[J]. 管理世界, 2018(1): 169-179.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。