管理层语调(NTUSD词典法)
「管理层语调(NTUSD词典法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 22 个变量,样本量约 67,305。 衡量上市公司管理层在年度报告中披露信息的情感倾向。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 22 |
| 样本量 | 67,305 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年报对应财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- NTUSD_Pos [NTUSD积极词频数] — 参考曾庆生等(2018, 管理世界)和Loughran & McDonald (2011, JF)的方法,使用NTUSD中文情感词典(台湾大学)统计年报全文中积极词出现次数,否定词后的积极词不计入。单位:次
- NTUSD_Neg [NTUSD消极词频数] — 参考曾庆生等(2018, 管理世界)和Loughran & McDonald (2011, JF)的方法,使用NTUSD中文情感词典(台湾大学)统计年报全文中消极词出现次数,否定词后的消极词不计入。单位:次
- TotalWords [全文总词数] — 年报全文经jieba分词后的总词数(去除停用词和单字符词)。单位:个
- NTUSD_Tone1 [NTUSD语调1(全文)] — 参考曾庆生等(2018, 管理世界)的方法,计算公式为:(积极词频数-消极词频数)/全文总词数。值越大代表年报语调越积极乐观。单位:比例
- NTUSD_Tone2 [NTUSD语调2(全文)] — 参考曾庆生等(2018, 管理世界)的方法,计算公式为:(积极词频数-消极词频数)/(积极词频数+消极词频数)。作为Tone1的稳健性检验。单位:比例
- MDA_NTUSD_Pos [MD&A NTUSD积极词频数] — 年报管理层讨论与分析(MD&A)章节中NTUSD积极词出现次数。MD&A提取成功标志=0时为空值。单位:次
- MDA_NTUSD_Neg [MD&A NTUSD消极词频数] — 年报管理层讨论与分析(MD&A)章节中NTUSD消极词出现次数。MD&A提取成功标志=0时为空值。单位:次
- MDA_TotalWords [MD&A总词数] — 管理层讨论与分析(MD&A)章节经jieba分词后的总词数。MD&A提取成功标志=0时为空值。单位:个
- MDA_NTUSD_Tone1 [NTUSD语调1(MD&A)] — 参考曾庆生等(2018, 管理世界)的方法,仅基于MD&A章节计算,公式为:(MD&A积极词频数-MD&A消极词频数)/MD&A总词数。MD&A提取成功标志=0时为空值。单位:比例
- MDA_NTUSD_Tone2 [NTUSD语调2(MD&A)] — 参考曾庆生等(2018, 管理世界)的方法,仅基于MD&A章节计算,公式为:(MD&A积极词频数-MD&A消极词频数)/(MD&A积极词频数+MD&A消极词频数)。MD&A提取成功标志=0时为空值。单位:比例
- MDAExtracted [MD&A提取成功标志] — 是否成功从年报全文中提取MD&A章节(0=否,1=是)。2001年后提取率>=95%
常见问题
- 「管理层语调(NTUSD词典法)」是什么数据集?
- 管理层语调(NTUSD词典法),隶属信息环境。衡量上市公司管理层在年度报告中披露信息的情感倾向。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 22 个变量。核心指标包括:NTUSD积极词频数、NTUSD消极词频数、全文总词数、NTUSD语调1(全文)、NTUSD语调2(全文)、MD&A NTUSD积极词频数、MD&A NTUSD消极词频数、MD&A总词数、NTUSD语调1(MD&A)、NTUSD语调2(MD&A)、MD&A提取成功标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,305 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集基于文本分析方法,度量中国上市公司年度报告(年报)中管理层披露文本的情感语调。该方法借鉴了Loughran和McDonald(2011)关于英文财务文本情感分析的思想,并采用曾庆生等(2018)针对中文年报的具体研究框架,使用NTUSD(台湾大学情感词典)作为基础情感词库。管理层语调反映了管理层在对外披露信息时所展现的乐观或悲观倾向,是研究公司信息披露策略、盈余管理及市场反应的重要变量。 计算过程首先对年报文本进行预处理,包括使用分词工具进行分词,并去除停用词和单字符词。随后,使用NTUSD词典对文本中的词汇进行情感分类,统计积极词和消极词的出现频数。为提升准确性,对否定词(如“不”、“没有”)后的情感词进行了特殊处理,不计入相应情感词频。本数据集提供了两个层面的分析:基于年报全文的语调分析,以及专门针对“管理层讨论与分析”(MD&A)章节的语调分析。MD&A章节是管理层对公司经营状况、财务状况和未来展望进行集中阐述的部分,其语调被认为更具信息含量。 核心语调指标的计算遵循曾庆生等(2018)定义的两种公式。第一种语调指标(Tone1)将净情感词频(积极词频减消极词频)除以文本总词数进行标准化,以控制文本长度的影响。第二种语调指标(Tone2)将净情感词频除以情感词总数(积极词频与消极词频之和),该指标在情感词数量较少时更为稳健,常作为Tone1的补充检验。 对于全文语调,计算公式为: $$Tone1 = \frac{P{full} - N{full}}{W{full}}$$ $$Tone2 = \frac{P{full} - N{full}}{P{full} + N{full}}$$ 对于MD&A章节语调,计算公式为: $$Tone1{MD\&A} = \frac{P{MD\&A} - N{MD\&A}}{W{MD\&A}}$$ $$Tone2{MD\&A} = \frac{P{MD\&A} - N{MD\&A}}{P{MD\&A} + N{MD\&A}}$$ 其中$P{full}$、$N{full}$、$W{full}$分别为年报全文的NTUSD积极词频数、消极词频数和总词数;$P{MD\&A}$、$N{MD\&A}$、$W{MD\&A}$分别为MD&A章节的NTUSD积极词频数、消极词频数和总词数。指标值越大,代表文本语调越积极乐观。 补充说明 - 数据覆盖2001年及以后的年度报告。对于MD&A章节的指标,仅当成功从年报全文中提取出MD&A文本(MDAExtracted标志为1)时,相关字段才有有效值,否则为空值。2001年后的MD&A文本提取成功率不低于95%。 - 文本总词数的统计基于分词结果,并已去除停用词和单字符词。 参考文献 - Loughran T, McDonald B. When is a liability not a liability? Textual analysis, dictionaries, and 10-Ks[J]. The Journal of Finance, 2011, 66(1): 35-65. - 曾庆生, 周波, 张程, 陈信元. 年报语调与内部人交易:“表里如一”还是“口是心非”?[J]. 管理世界, 2018, 34(9): 143-160.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。