关键审计事项语调(情感词典法)

「关键审计事项语调(情感词典法)」,覆盖 2016-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 38,959。 基于审计报告披露的关键审计事项文本,用中文情绪词汇列表度量审计师语调。

时间跨度2016-2025 年
数据频率年度
层级上市公司
变量数20
样本量38,959
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • KAMCount [关键审计事项条数] — 该公司当年审计报告中披露的关键审计事项条目数
  • TotalWords [关键审计事项总词数] — 关键审计事项段文本(事项段与应对段合并)经中文分词并剔除空白词元后的全部词汇数,用作语调指标的分母
  • PosWords [积极情绪词频] — 关键审计事项段文本中命中积极情绪词集的词汇数
  • NegWords [消极情绪词频] — 关键审计事项段文本中命中消极情绪词集的词汇数
  • KAMToneNeg [关键审计事项消极语调] — 参考黄溶冰和冯严超 (2022, 中南财经政法大学学报)的方法,计算公式为:关键审计事项段消极词汇词集对应的词频除以关键审计事项段文本总词数。用作研究变量,越大代表审计师对被审计单位财务信息质量的负面感知越强
  • KAMTonePos [关键审计事项积极语调] — 参考黄溶冰和冯严超 (2022, 中南财经政法大学学报)的方法,计算公式为:关键审计事项段积极词汇词集对应的词频除以关键审计事项段文本总词数。用作研究变量,越大代表审计师用词越正面
  • KAMTone [关键审计事项净积极语调] — 参考黄溶冰和冯严超 (2022, 中南财经政法大学学报)的方法,计算公式为:(积极语调-消极语调)/(积极语调+消极语调),取值介于-1与1之间。用作研究变量,越大代表审计师在关键审计事项段中用词越积极正面,即认为客户粉饰报表和隐瞒负面消息的可能性越低
  • KAMToneEvent [事项段净积极语调] — 仅对事项段(对关键审计事项本身的描述)计算的净积极语调,计算公式为:(事项段积极词频-事项段消极词频)/(事项段积极词频+事项段消极词频)。事项段聚焦企业层面的风险事项,越大代表用词越积极正面
  • KAMToneResp [应对段净积极语调] — 仅对应对段(审计中针对该事项执行的程序)计算的净积极语调,计算公式为:(应对段积极词频-应对段消极词频)/(应对段积极词频+应对段消极词频)。应对段以审计程序描述为主,越大代表用词越积极正面

常见问题

「关键审计事项语调(情感词典法)」是什么数据集?
关键审计事项语调(情感词典法),隶属信息环境。基于审计报告披露的关键审计事项文本,用中文情绪词汇列表度量审计师语调。
该数据集的时间范围是?
覆盖 2016-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:关键审计事项条数、关键审计事项总词数、积极情绪词频、消极情绪词频、关键审计事项消极语调、关键审计事项积极语调、关键审计事项净积极语调、事项段净积极语调、应对段净积极语调。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 38,959 条观测。
数据是如何测算/获取的?
指标定义与计算方法 自《中国注册会计师审计准则第1504号——在审计报告中沟通关键审计事项》实施以来,审计报告不再是标准化的格式文书。审计师需以叙述性文字披露其认为对本期财务报表审计最为重要的事项,并说明审计中如何应对这些事项,其确定原则包括特别风险事项、重大会计估计和不确定事项以及重大交易事项等。这使得审计报告首次承载了可供外部识别的、非定式化的文本信息。 语调被定义为文本信息中所表达出的积极(正面)或消极(负面)的情感倾向。相较于数字信息,语言在表达判断与感觉时更具弹性和灵活性。关键审计事项往往是不确定程度比较高的事项,其文本语调反映了审计师对上市公司经营状况和财务风险的判断:当审计师对被审计单位的财务信息质量存在负面感知时,倾向于使用一些消极词汇;而积极词汇越多、消极词汇越少,则意味着审计师认为客户粉饰报表和隐瞒负面消息的可能性较低。因此,关键审计事项语调可视为对重大潜在风险的一种预判或警示,相当于审计师给出的一种结论性评价。 本指标以公司-年度为单位度量上述语调。文本口径取审计报告中该公司当年披露的全部关键审计事项条目,每一条目均包含两个段落:事项段,即对该关键审计事项本身的描述;应对段,即审计中针对该事项所执行的程序。两段合并构成该公司当年的关键审计事项段文本。事项名称属于标题、附注索引属于定位信息,二者均不属于段落正文,故不计入文本。 对合并后的文本使用中文分词工具切分为词汇序列,剔除其中的纯空白词元后,所得词汇总数记为 $N$。之所以剔除空白词元,是因为换行是将多条事项拼接为一段文本时人为引入的分隔标记,并非原文词汇,若计入分母会使披露事项条目较多的公司分母虚增。随后将每个词元与情绪词汇列表比对,命中积极词集的词频记为 $f{pos}$,命中消极词集的词频记为 $f{neg}$。 消极语调与积极语调分别定义为相应词集对应的词频与关键审计事项段文本总词数之比: $$Neg=\frac{f{neg}}{N},\qquad Pos=\frac{f{pos}}{N}$$ 在此基础上,净积极语调定义为积极词频相对于消极词频的差异程度: $$Tone=\frac{Pos-Neg}{Pos+Neg}$$ $Pos$ 相对于 $Neg$ 越多,$Tone$ 越大,说明审计师在关键审计事项段中的用词越积极和正面;反之则越消极。该式取值介于 $-1$ 与 $1$ 之间,当文本中不含任何情绪词汇时取缺失值。三者中,消极语调刻画审计师传递的风险警示强度,净积极语调则被认为具有更高的信息含量,因为它同时利用了两个方向的用词信息,相当于审计师对被审计单位财务报告质量给出的综合判断。 考虑到事项段与应对段的功能存在本质差异——前者聚焦企业层面的风险事项,后者主要描述审计程序与应对措施——本指标进一步将两段拆开,分别按上式计算事项段净积极语调与应对段净积极语调,以便使用者在实证设计中区分两类文本所承载的信息。 为便于使用者复核比率或按自身研究设计重构口径,本数据集同时给出计算链上的构件变量,包括该公司当年披露的关键审计事项条数、分词后的全部词汇数以及积极与消极情绪词频。 补充说明 - 样本口径:本数据集覆盖全部披露关键审计事项的公司年度,不预先剔除金融业、被特别处理或财务异常的样本。金融机构的关键审计事项高度集中于贷款减值与结构化主体合并等特有议题,其文本用词与一般工商企业差异较大;使用时建议按研究设计自行施加样本限制,并加入行业与年份固定效应。 - 情绪词汇列表的替代:原文的情绪词汇列表以一部英文金融情感词汇列表为种子词集,经商业文本数据平台的同义词词林扩充后再由作者人工筛选而成,词频统计亦基于该平台的分词服务。该列表依赖商业数据库与未公开的人工筛选结果,无法重建。本数据集改用公开可得的中文情绪词表(通用中文情感词表与中文金融领域情感词表合并,两表极性相互矛盾的词汇整体剔除),分词改用公开的中文分词工具。在原文的样本区间上,本数据集三个指标的标准差与原文报告值高度一致,即离散结构相符;水平上消极语调偏低、积极语调与净积极语调偏高,差异主要表现为平移。 - 中性用语与构念局限:原文经人工筛选剔除了无情感色彩的词汇,该筛选结果未公开。所用公开词表中"了解""确定""进行"等在审计语境下属中性程序用语的词汇因此保留在积极词集内。语境核查显示,命中的高频词有相当比例是会计科目名的碎片——"存货跌价准备"被切分为跌价与准备、"预期信用损失"被切分为信用与损失,两者分属消极与积极词集,在净语调的分子上相互抵消而只抬高分母。将词表随机对半分后,两半给出的公司排序几乎不相关,表明该指标的跨公司排序对词表构成较为敏感。与非标准审计意见、亏损、资产收益率、资产负债率、破产风险、商誉减值、监管问询等外部风险效标做年内标准化后的相关检验,相关系数绝对值均很小且部分符号与预期相反。建议不将本指标作为企业真实风险的单一代理变量,而与其他风险度量并用,并控制文本长度。 - 跨 2019 年的可比性:新金融工具准则自 2019 年起在境内上市公司全面施行,应收款项减值改按"预期信用损失"模型计提,该科目名称随之大量进入关键审计事项文本。由于"损失"属消极词,消极语调在该年出现结构性抬升,这源于会计术语的变迁而非审计师情感的变化。跨该年份作时间序列比较时须加入年份固定效应,必要时应做分段回归。 - 分段语调的构念差异:事项段语调对非标准审计意见具有较强的区分力,应对段语调则不具区分力,后者更多反映审计程序用语的密度。两者不宜互相替代。 - 其他局限:上游文本存在长度上限,少数条目在该上限处被截断,其词数与情绪词频相应偏低,应对段受影响多于事项段;上游明细中另有个别公司年存在事项序号重复且段落字段错位的记录,本实现未作去重,该公司年相当于对同一事项的两个版本取加权平均。此外,制度实施首年为试点年份,披露公司数量很少,使用时可考虑剔除。 参考文献 - 黄溶冰,冯严超.关键审计事项语调与股价崩盘风险[J].中南财经政法大学学报,2022(5):18-31.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。