资本市场定价效率(Moskowitz)

「资本市场定价效率(Moskowitz)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 69,267。 参考谭欢等(2026)与Hou & Moskowitz (2005, RFS)的价格延迟思想,基于年度内个股日收益率对当期及1~4阶滞后市场收益率的逐股回归,构

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数21
样本量69,267
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票名称] — 上市公司简称
  • Year [年份] — 财务年度(自然年)
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • BetaMkt [当期市场收益系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为年度内个股日收益率对当期及1~4阶滞后市场收益率回归(模型2)中当期市场收益率的回归系数beta_i,计算公式为:模型(2): r_{i,t}=alpha_i+beta_i*r_t^mkt+sum_{n=1}^4 delta_{i,n}*r_{t-n}^mkt+e_{i,t}中的beta_i。是历史收益依赖度的分母构件,反映股价对当期市场信息的同步反应强度
  • DeltaLag1 [滞后1日市场收益系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为模型(2)中滞后1日市场收益率的回归系数delta_{i,1},计算公式为:模型(2): r_{i,t}=alpha_i+beta_i*r_t^mkt+sum_{n=1}^4 delta_{i,n}*r_{t-n}^mkt+e_{i,t}中n=1的delta。反映股价对1日前市场信息的延迟反应,是历史收益依赖度的分子构件
  • DeltaLag2 [滞后2日市场收益系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为模型(2)中滞后2日市场收益率的回归系数delta_{i,2},计算公式为:模型(2): r_{i,t}=alpha_i+beta_i*r_t^mkt+sum_{n=1}^4 delta_{i,n}*r_{t-n}^mkt+e_{i,t}中n=2的delta。反映股价对2日前市场信息的延迟反应,是历史收益依赖度的分子构件
  • DeltaLag3 [滞后3日市场收益系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为模型(2)中滞后3日市场收益率的回归系数delta_{i,3},计算公式为:模型(2): r_{i,t}=alpha_i+beta_i*r_t^mkt+sum_{n=1}^4 delta_{i,n}*r_{t-n}^mkt+e_{i,t}中n=3的delta。反映股价对3日前市场信息的延迟反应,是历史收益依赖度的分子构件
  • DeltaLag4 [滞后4日市场收益系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为模型(2)中滞后4日市场收益率的回归系数delta_{i,4},计算公式为:模型(2): r_{i,t}=alpha_i+beta_i*r_t^mkt+sum_{n=1}^4 delta_{i,n}*r_{t-n}^mkt+e_{i,t}中n=4的delta。反映股价对4日前市场信息的延迟反应,是历史收益依赖度的分子构件
  • R2Restricted [模型1决定系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为仅含当期市场收益率的限制性回归(模型1: r_{i,t}=alpha_i+beta_i*r_t^mkt+e_{i,t})的决定系数R'^2,计算公式为:1-残差平方和/总平方和。用于历史信息依赖度计算
  • R2Unrestricted [模型2决定系数] — 参考Hou & Moskowitz (2005, RFS)的方法,为含当期及1~4阶滞后市场收益率的非限制性回归(模型2)的决定系数R^2,计算公式为:1-残差平方和/总平方和。用于历史信息依赖度计算
  • RegTradeDays [回归有效交易日数] — 年度内进入逐股回归的日观测数(已剔除年初因1~4阶滞后缺失的前若干交易日),年内有效交易日不足100天的(Symbol,Year)不出估计。数值越大估计越可靠,可用作稳健性样本筛选
  • ReturnDependence [历史收益依赖度] — 参考谭欢等(2026)与Hou & Moskowitz (2005, RFS)的方法(原文D2),计算公式为:sum_{n=1}^4 |delta_{i,n}|/(|beta_i|+sum_{n=1}^4 |delta_{i,n}|),即滞后市场收益系数绝对值之和占全部(当期+滞后)系数绝对值之和的比重。用作研究变量,取值[0,1],越小代表股价对历史市场收益依赖越弱、资本市场定价效率越高
  • InfoDependence [历史信息依赖度] — 参考谭欢等(2026)与Hou & Moskowitz (2005, RFS)的方法(原文D1),计算公式为:1-R'^2/R^2,其中R'^2为仅含当期市场收益率的模型1决定系数,R^2为含1~4阶滞后的模型2决定系数。用作稳健性研究变量,取值[0,1],越小代表股价对历史市场信息依赖越弱、资本市场定价效率越高

常见问题

「资本市场定价效率(Moskowitz)」是什么数据集?
资本市场定价效率(Moskowitz),隶属风险因子。参考谭欢等(2026)与Hou & Moskowitz (2005, RFS)的价格延迟思想,基于年度内个股日收益率对当期及1~4阶滞后市场收益率的逐股回归,构
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 21 个变量。核心指标包括:当期市场收益系数、滞后1日市场收益系数、滞后2日市场收益系数、滞后3日市场收益系数、滞后4日市场收益系数、模型1决定系数、模型2决定系数、回归有效交易日数、历史收益依赖度、历史信息依赖度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,267 条观测。
数据是如何测算/获取的?
指标定义与计算方法 资本市场定价效率刻画股票价格吸收并反映市场层面信息的速度。当股价能够及时、充分地随同期市场信息调整时,定价效率较高;反之,若股价对过往市场信息存在持续的延迟反应,则表明信息摩擦较强、定价效率较低。本数据集沿用 Hou 和 Moskowitz (2005) 的价格延迟思想,并采用谭欢等 (2026) 的"系数绝对值比重"口径,以年度内个股日交易数据逐股估计,构建两个互补的定价效率被解释变量。 度量的基础是两个嵌套的时间序列回归。对每家公司、每个自然年度,以该股票当日收益率为被解释变量,分别估计限制性模型与非限制性模型。限制性模型仅纳入当期市场收益率: $$r{i,t} = \alphai + \betai\, rt^{mkt} + \varepsilon{i,t}$$ 非限制性模型在此基础上追加一至四阶滞后的市场收益率: $$r{i,t} = \alphai + \betai\, rt^{mkt} + \sum{n=1}^{4}\delta{i,n}\, r{t-n}^{mkt} + \varepsilon{i,t}$$ 其中 $r{i,t}$ 为股票 $i$ 第 $t$ 个交易日的收益率,$rt^{mkt}$ 为当日市场收益率(以涵盖主板、创业板与科创板的广义市场、按流通市值加权并考虑现金红利再投资计算),$r{t-n}^{mkt}$ 为滞后 $n$ 个交易日的市场收益率。当期系数 $\betai$ 衡量股价对同步市场信息的反应强度,而滞后系数 $\delta{i,n}$ 则刻画股价对历史市场信息的延迟反应。滞后项在各自然年度内按交易日构造,跨年度不串联。 第一个被解释变量为历史收益依赖度,定义为全部滞后系数绝对值之和占当期与滞后系数绝对值总和的比重: $$D2i = \frac{\sum{n=1}^{4}\lvert\delta{i,n}\rvert}{\lvert\betai\rvert + \sum{n=1}^{4}\lvert\delta{i,n}\rvert}$$ 该指标取值于 $[0,1]$ 区间。当股价主要由当期市场信息驱动时 $\lvert\betai\rvert$ 相对较大,$D2i$ 趋小,意味着延迟反应弱、定价效率高;反之 $D2i$ 趋大则表明股价对历史市场收益的依赖更强、定价效率更低。 第二个被解释变量为历史信息依赖度,基于两模型决定系数的相对增量构造: $$D1i = 1 - \frac{R'^2i}{R^2i}$$ 其中 $R'^2i$ 为限制性模型(模型一)的决定系数,$R^2i$ 为非限制性模型(模型二)的决定系数。$D1i$ 度量了滞后市场收益率对个股收益解释力的边际贡献份额:若加入滞后项后解释力提升有限,则 $D1i$ 趋近于零,表明股价已充分吸收同期信息、定价效率高;反之 $D1i$ 越大,说明历史信息在定价中扮演更重要的角色、定价效率越低。两个指标方向一致、相互印证,可分别用作主回归与稳健性检验的被解释变量。 为便于机制分析,数据集同时保留回归的关键构件,包括当期市场收益系数、各阶滞后市场收益系数,以及两个嵌套模型的决定系数。 补充说明 - 逐股回归在每个自然年度内独立进行,覆盖沪、深、京全部 A 股(含创业板、科创板与北交所),不局限于特定行业或子样本。 - 年度内有效交易日不足 100 天的"公司-年度"不予估计,以剔除当年上市、退市或长期停牌导致的不可靠回归;同时输出每个估计实际使用的有效交易日数,供研究者按需施加更严格的样本筛选。 - 历史收益依赖度天然落于 $[0,1]$;历史信息依赖度在嵌套模型下亦约束于 $[0,1]$。对于交易极为稀疏的次新股,回归可能产生数值较大的当期系数,此类估计可借助有效交易日数字段加以识别与处理。 参考文献 - Hou K, Moskowitz T J. Market frictions, price delay, and the cross-section of expected returns[J]. The Review of Financial Studies, 2005, 18(3): 981-1020. - 谭欢,李青原,王治,罗云磊.环境信息粉饰行为与资本市场定价效率——来自A股上市公司CSR报告的证据[J/OL].当代财经,2026.https://doi.org/10.13676/j.cnki.cn36-1030/f.20260529.004.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。