企业家信心指数(MD&A情感单元法)
「企业家信心指数(MD&A情感单元法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 67,309。 基于上市公司年报MD&A文本,采用情感单元法构建的微观企业家信心指数(王宇伟等2025),含主口径、剔除操纵的正常值、姚加权词典版、未来展望部分四个口径。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 67,309 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [股票简称] — 上市公司股票简称(按年份动态匹配当年简称)
- Year [年份] — 年报对应会计年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 当年中上协行业分类代码(如C26,J66)
- IndustryName [行业名称] — 当年中上协行业分类名称
- N_SentiUnits [情感单元总数] — 参考王宇伟等(2025,经济理论与经济管理)的方法,MD&A全文经Jieba分词后按姜富伟等(2021)金融情感词典识别出的情感单元总数(从一个情感词到下一个情感词为一个单元),即企业家信心指数计算公式的分母N。用作研究变量,可作文本信息量代理或样本筛选(数值越小测量越不稳定)。
- MDAExtracted [MD&A提取标志] — 是否成功从年报全文提取到管理层讨论与分析(MD&A)章节(0=否,1=是)。为0时各信心指数基于年报全文计算(回退口径)。
- FutureExtracted [未来展望段提取标志] — 是否成功从MD&A中提取到未来展望子段(0=否,1=是)。为0时未来展望信心指数(Confidence_Future)回退为MD&A全文口径(等于Confidence)。
- Confidence [企业家信心指数(微观)] — 参考王宇伟、刘宏雅、范从来(2025,经济理论与经济管理)的方法,基于年报管理层讨论与分析(MD&A)文本与姜富伟等(2021)金融情感词典,采用情感单元法,计算公式为:Confidence=Σ(-1)^n·W_i/N,其中W_i为情感词权重(积极=1,消极=-1),(-1)^n为否定词权重(n为该情感单元内情感词之前出现的否定词次数),N为情感单元总数(从一个情感词到下一个情感词为一个单元)。用作研究变量,数值越大代表企业家信心越高。
- NConfidence [企业家信心指数正常值(剔除操纵)] — 参考王宇伟等(2025)对企业家信心剔除操纵的处理,借鉴林晚发等(2022,管理世界)与Huang、Teoh & Zhang(2014,TAR)的异常语调残差法,计算公式为:将Confidence对基本面变量(资产收益率、年度个股收益率、规模、账面市值比、收益波动率、盈余波动率、上市年限、是否亏损、盈余变化)及年份、行业固定效应回归,取拟合值作为剔除企业家操纵成分后的企业家信心正常值。用作研究变量,数值越大代表正常(非操纵)信心越高。
- Confidence2 [企业家信心指数(姚加权词典版)] — 参考王宇伟等(2025)更换情感词典的稳健性检验,采用姚加权等(2021,管理科学学报)基于上市公司年报构建的正式用语金融情感词典,按与Confidence相同的情感单元法计算公式为:Confidence2=Σ(-1)^n·W_i/N。因两词典正负词基线不同,其绝对水平系统性高于Confidence,宜作秩稳健性使用。用作研究变量,数值越大代表企业家信心越高。
- Confidence_Future [企业家信心指数(未来展望部分)] — 参考王宇伟等(2025)更换被解释变量的稳健性检验,计算公式为:仅对MD&A中未来展望子段(由起始/结尾标题词正则提取)按情感单元法(姜富伟词典)计算Confidence_Future=Σ(-1)^n·W_i/N;提取失败时回退为MD&A全文口径(见FutureExtracted)。相较回顾部分更能体现企业家对未来的发展信心。用作研究变量,数值越大代表对未来信心越高。
常见问题
- 「企业家信心指数(MD&A情感单元法)」是什么数据集?
- 企业家信心指数(MD&A情感单元法),隶属信息环境。基于上市公司年报MD&A文本,采用情感单元法构建的微观企业家信心指数(王宇伟等2025),含主口径、剔除操纵的正常值、姚加权词典版、未来展望部分四个口径。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:情感单元总数、MD&A提取标志、未来展望段提取标志、企业家信心指数(微观)、企业家信心指数正常值(剔除操纵)、企业家信心指数(姚加权词典版)、企业家信心指数(未来展望部分)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,309 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业家信心是宏观预期向微观主体传导的关键环节,相较于宏观层面的问卷调查指数,基于上市公司年报"管理层讨论与分析"(MD&A)文本构造的微观信心指标能够刻画单个企业管理层对自身经营前景的主观判断。本数据集参考王宇伟、刘宏雅、范从来(2025)的做法,以年报 MD&A 部分为语料,采用情感单元法构造反映微观层面企业家信心的指数。 构造过程分两步。第一步,对 MD&A 文本进行中文分词,并以金融领域情感词典筛选出文本中的情感词(积极词与消极词);情感词与否定词在分词与停用词处理中予以保留,以保证极性与否定关系不被破坏。第二步,定义"情感单元"为从一个情感词出现到下一个情感词出现之间的文本片段,并假定每个情感词的极性仅受其之前词汇(尤其是否定词)的影响。在此基础上,企业家信心指数的计算公式为 $$\text{Confidence}=\frac{\sum{i=1}^{N}(-1)^{ni}\,Wi}{N}$$ 其中 $Wi$ 为第 $i$ 个情感单元中情感词的极性权重,积极词取 $+1$、消极词取 $-1$;$ni$ 为该情感单元内、情感词之前出现的否定词个数,$(-1)^{ni}$ 表示否定修饰的奇偶翻转(奇数次否定翻转极性,偶数次否定还原极性,从而正确处理"并非不利"一类双重否定);$N$ 为全文识别到的情感单元总数,即指数的分母。$\text{Confidence}$ 取值介于 $-1$ 与 $1$ 之间,数值越大表示管理层语调越积极、企业家信心越高。这里所用的否定词典仅收录纯否定算子(如"无""勿""从未""没有""毫无"等虚词性否定词),而不包含本身即为消极含义的实义词,后者按其情感词典归类正常计为消极单元,以避免负面信号被否定算子吞噬并错误翻转。 为检验主口径的稳健性,本数据集进一步给出三个替代度量。其一,更换情感词典:主口径采用基于经济金融新闻语料构建的金融情感词典,考虑到其用语与上市公司正式披露文件存在差异,另取基于上市公司年报构建的正式用语情感词典,按完全相同的公式重算得到 $\text{Confidence2}$;由于两套词典的正负词基线不同,$\text{Confidence2}$ 的绝对水平系统性高于主口径,宜以秩相关方式作稳健性比较。其二,更换被解释变量为前瞻文本:MD&A 既包含对既往经营的回顾,也包含对未来形势的展望,后者更能体现企业家对未来的发展信心,故仅截取 MD&A 中的"未来展望"子段按相同公式计算得到 $\text{Confidence\Future}$;当该子段无法可靠识别时,回退为 MD&A 全文口径。其三,剔除管理层操纵:MD&A 语调可能因印象管理而被人为夸大,借鉴语调操纵文献,将 $\text{Confidence}$ 对一组反映企业基本面的变量(资产收益率、年度个股收益率、规模、账面市值比、个股收益波动率、盈余波动率、上市年限、是否亏损、盈余变化)以及年份与行业固定效应作回归, $$\text{Confidence}{it}=\alpha+\boldsymbol{\beta}^{\top}\mathbf{X}{it}+\gammat+\etaj+\varepsilon{it}$$ 取拟合值 $\widehat{\text{Confidence}}{it}$ 作为剔除企业家操纵成分后的"正常信心" $\text{NConfidence}$,残差 $\varepsilon{it}$ 则对应被操纵的异常成分。$\text{NConfidence}$ 反映由基本面与系统性因素决定的预期信心水平,因而其离散程度小于原始指数。 补充说明 - MD&A 文本以正则模式从年报全文中定位并截取,覆盖各年代节标题格式;整体提取成功率在 2001 年及以后各年度均不低于 95%,提取失败的少数样本以全文替代并以标志位标识。 - "未来展望"子段以起始与结尾标题词正则提取,识别成功与否同样以标志位标识;该子段的可识别程度随披露规范的演进而提高,使用前瞻口径时建议结合标志位限定样本或加入年份固定效应。 - 指数分母 $N$(情感单元总数)随文本同时输出,可用作文本信息量的代理或样本筛选依据;$N$ 过小的观测测量噪声较大,作面板回归时建议设置最小阈值或加入年份固定效应。 - 银行等金融机构年报缺乏标准化 MD&A 结构,提取成功率偏低,相关行业研究宜单独建模或予以剔除。 参考文献 - 王宇伟, 刘宏雅, 范从来. 央行言辞沟通能否提振企业家信心[J]. 经济理论与经济管理, 2025, 45(8): 33-52. - 姚加权, 冯绪, 王赞钧, 纪荣嵘, 张维. 语调、情绪及市场影响: 基于金融情绪词典[J]. 管理科学学报, 2021, 24(5): 26-46. - 林晚发, 赵仲匡, 宋敏. 管理层讨论与分析的语调操纵及其债券市场反应[J]. 管理世界, 2022, 38(1): 164-180. - Huang X, Teoh S H, Zhang Y. Tone management[J]. The Accounting Review, 2014, 89(3): 1083-1113.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。