管理层语调(CFSD词典法)

「管理层语调(CFSD词典法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 67,863。 衡量上市公司年报管理层讨论与分析(MD&A)文本的乐观或悲观语调。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数20
样本量67,863
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • Tone [净语调(CFSD)] — 参考Loughran & McDonald (2011, JF)和曾庆生等(2018, 管理世界)的方法,使用姜富伟等(2021, 经济学季刊)CFSD词典,计算公式为:(正面词数-负面词数)/(正面词数+负面词数),用作研究变量,越大代表管理层语调越积极。单位:比例
  • ToneStd [标准化净语调(CFSD)] — 参考Loughran & McDonald (2011, JF)的方法,使用姜富伟等(2021, 经济学季刊)CFSD词典,计算公式为:(正面词数-负面词数)/MD&A总词数。单位:比例
  • PosRatio [正面词占比(CFSD)] — 参考Loughran & McDonald (2011, JF)的方法,使用姜富伟等(2021, 经济学季刊)CFSD词典,计算公式为:CFSD正面词匹配数/MD&A总词数。单位:比例
  • NegRatio [负面词占比(CFSD)] — 参考Loughran & McDonald (2011, JF)的方法,使用姜富伟等(2021, 经济学季刊)CFSD词典,计算公式为:CFSD负面词匹配数/MD&A总词数。单位:比例
  • PosCount [正面词数(CFSD)] — 使用姜富伟等(2021, 经济学季刊)CFSD词典(3173个正面词)在MD&A中匹配到的正面词数(含否定词翻转)。单位:个
  • NegCount [负面词数(CFSD)] — 使用姜富伟等(2021, 经济学季刊)CFSD词典(5600个负面词)在MD&A中匹配到的负面词数(含否定词翻转)。单位:个
  • SentiWordCount [情感词总数(CFSD)] — 参考Donald (2011, JF)。正面词数与负面词数之和。单位:个
  • TotalWords [MD&A总词数] — 参考Donald (2011, JF)。jieba分词后MD&A章节的词数(去停用词后)。单位:个
  • MDAExtracted [MD&A提取标志] — 参考Donald (2011, JF)。是否成功提取管理层讨论与分析章节(0=否,1=是),MD&A提取标志=0时人工智能水平-MDA基于全文计算

常见问题

「管理层语调(CFSD词典法)」是什么数据集?
管理层语调(CFSD词典法),隶属信息环境。衡量上市公司年报管理层讨论与分析(MD&A)文本的乐观或悲观语调。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:净语调(CFSD)、标准化净语调(CFSD)、正面词占比(CFSD)、负面词占比(CFSD)、正面词数(CFSD)、负面词数(CFSD)、情感词总数(CFSD)、MD&A总词数、MD&A提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,863 条观测。
数据是如何测算/获取的?
指标定义与计算方法 管理层语调是衡量上市公司年报中“管理层讨论与分析”(MD&A)章节文本所传达的乐观或悲观情绪的重要指标。基于文本分析技术,通过计算特定情感词典在文本中出现的频率,可以量化管理层的语言倾向。本数据集采用姜富伟等(2021)构建的CFSD中文金融情感词典,该词典包含3194个正面词和5621个负面词,专门针对中文金融文本语境,对年报MD&A文本进行情感分析。 分析过程首先对MD&A文本进行分词处理,并与CFSD词典进行匹配,统计正面词和负面词的出现次数。为提升分析的准确性,引入了否定词处理机制:若情感词前一个词语为否定词(如“不”、“没有”),则该情感词的极性将被翻转(正面转为负面,负面转为正面)。最终,基于匹配并处理后的正面词数($Pos$)和负面词数($Neg$),以及MD&A文本的总词数($TotalWords$),计算出一系列语调指标。 核心的语调指标为净语调($Tone$),其计算方法参考Loughran和McDonald(2011)以及曾庆生等(2018)的研究,定义为正面词数与负面词数之差除以二者之和,用以衡量管理层语言的净积极程度。此外,还计算了标准化净语调($ToneStd$),即净情感词数除以文本总词数,以控制文本长度的影响。同时,分别计算正面词占比($PosRatio$)和负面词占比($NegRatio$),即正面或负面词数除以总词数,以反映积极或消极情绪的绝对密度。情感词总数($SentiWordCount$)为正面词数与负面词数之和。 净语调($Tone$)的计算公式为: $$Tone = \frac{Pos - Neg}{Pos + Neg}$$ 其中$Pos$为经否定词处理后的CFSD正面词匹配数,$Neg$为经否定词处理后的CFSD负面词匹配数。标准化净语调($ToneStd$)的计算公式为$ToneStd = (Pos - Neg) / TotalWords$;正面词占比($PosRatio$)为$PosRatio = Pos / TotalWords$;负面词占比($NegRatio$)为$NegRatio = Neg / TotalWords$。 补充说明 - 本数据集的分析对象为上市公司年报的“管理层讨论与分析”(MD&A)章节文本。 - 字段MDAExtracted标识是否成功提取到MD&A章节,当该标志为0时,表明基于全文进行了计算。 参考文献 - Loughran T, McDonald B. When is a liability not a liability? Textual analysis, dictionaries, and 10-Ks[J]. The Journal of Finance, 2011, 66(1): 35-65. - 姜富伟, 胡逸驰, 黄楠. 媒体文本情绪与股票回报预测[J]. 经济学(季刊), 2021, 21(4): 1323-1344. - 曾庆生, 周波, 张程, 等. 年报语调与内部人交易:“表里如一”还是“口是心非”?[J]. 管理世界, 2018, 34(9): 143-160.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。