关键审计事项可读性(语言模型生成概率法)

「关键审计事项可读性(语言模型生成概率法)」,覆盖 2016-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 38,959。 度量上市公司审计报告中关键审计事项段文本的易读程度。

时间跨度2016-2025 年
数据频率年度
层级上市公司
变量数15
样本量38,959
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • KAMSentenceCount [关键审计事项段句子数] — 关键审计事项段经切分后进入可读性计算的句子总数,即可读性计算公式中的分母N。句子边界取中文句末标点(句号、叹号、问号、分号),排版换行不作为句子边界;分词后有效中文词不足2个的句子不计入。
  • KAMReadability [关键审计事项可读性] — 参考田高良等(2021,会计研究)的方法,计算公式为:关键审计事项段各句子生成概率的对数似然的算术平均,即可读性=(1/N)×Σlog(P_s),其中P_s为第s个句子的生成概率、N为句子总数。句子生成概率由在全部关键审计事项文本上训练的词向量语言模型(CBOW结构、层次softmax输出层)按词的前后搭配逐词累乘得到。该指标恒为负值,用作研究变量,越大(越接近0)代表词对搭配在语料中出现得越频繁、文本越容易被理解、可读性越高。
  • LnAbsKAMReadability [关键审计事项可读性绝对值对数] — 参考田高良等(2021,会计研究)的方法,计算公式为:可读性指标绝对值的自然对数,即ln(|可读性|)。因可读性指标恒为负,原文在计算公司间差异之前先作此变换。用作研究变量,与可读性指标方向相反,越大代表文本越难被理解。
  • KAMReadabilityBody [关键审计事项正文可读性] — 参考田高良等(2021,会计研究)的方法,计算公式与关键审计事项可读性相同,但文本范围仅取事项描述段与审计应对段、不含事项类别子标题,用于文本范围口径的敏感性对照。用作研究变量,越大(越接近0)代表文本越容易被理解。

常见问题

「关键审计事项可读性(语言模型生成概率法)」是什么数据集?
关键审计事项可读性(语言模型生成概率法),隶属信息环境。度量上市公司审计报告中关键审计事项段文本的易读程度。
该数据集的时间范围是?
覆盖 2016-2025 年。
包含哪些变量/指标?
共 15 个变量。核心指标包括:关键审计事项段句子数、关键审计事项可读性、关键审计事项可读性绝对值对数、关键审计事项正文可读性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 38,959 条观测。
数据是如何测算/获取的?
指标定义与计算方法 自审计报告准则改革以来,注册会计师须在审计报告中单设关键审计事项部分,说明其依职业判断认定的、对本期财务报表审计最为重要的事项,并交代识别该事项的理由与围绕它执行的特殊审计程序。这段文字是审计工作中少有的、由审计师自行组织的叙述性披露,其遣词造句习惯被认为承载了会计师事务所的内部工作规则与培训范式。可读性衡量文本易读与难读的水平,隐含着不同的信息含量:审计师在关键审计事项段可读性上的差异,反映的是事务所整体思维模式与文本书写习惯对其执业人员的潜移默化。 本数据集针对整个关键审计事项段文本度量可读性。传统的文本可读性度量方式往往忽略词汇的前后搭配顺序,或更适用于英文文本。这里采用的方法在朴素贝叶斯的假设下,即假设文本中句子相互独立,并考虑句中词汇的前后搭配顺序,将文本中各个句子生成概率乘积的对数似然的均值,作为此文本的可读性度量: $$Readability=\frac{1}{N}\sum{s=1}^{N}\log Ps$$ 其中 $Ps$ 表示句子 $s$ 生成的概率,$N$ 表示构成文本的句子数。其值越高,表示文本中词对搭配顺序在语料中出现的频率越高,文本越容易被理解,文本可读性越高;反之,则表示词对在语料中出现的频率越低,文本越不容易被理解,文本可读性越差。由于各句生成概率均小于一,该指标恒取负值。 句子生成概率由一个词向量语言模型给出,其构建分三步:先利用词嵌入将每个词表示成一个密集的固定长度的实值向量,使语义相近的词在向量空间上具有相近的向量表示;再借鉴层次softmax的优化思想,由目标词在词频构造的编码树上的路径逐节点累乘,得到该词在其上下文条件下的条件概率,进而得到整句的生成概率(原文将层次softmax与负采样并提,但负采样的目标函数并非归一化的词条件概率,无从据以得到句子生成概率,故此处只取前者);最后将各个句子生成概率乘积的对数均值作为该文档的可读性度量。模型采用连续词袋结构,词向量维度一百、上下文窗口为前后各五词、词频下限为五、迭代五轮,并以单线程与固定随机种子训练,以保证结果可完全复现。句子的对数生成概率按上述定义精确求值,未采用以查找表近似对数几率函数、并跳过大内积项的加速实现,后者会使结果系统性偏负约百分之二。 关键审计事项段文本由事项类别子标题、事项描述段与审计应对段三部分按披露顺序拼接而成,按公司与年度汇总该公司当年披露的全部事项条目;附注索引是定位信息而非事项段行文,不计入。句子边界取中文句末标点,即句号、叹号、问号与分号。文本中的换行先行删除:其中约六分之五本就紧跟句末标点,删除与否不改变切分结果,其余则是原始报告的排版折行,若把它们当作句子边界,排版折行严重的报告会被切成十余字的碎片,因短句生成概率高而使可读性大幅虚高。分词后只保留含汉字的词元,数字与英文字符不计入。经分词后有效中文词不足两个、或落在语言模型词表内的词不足两个的句子,无从计算词间搭配概率,不计入句子数。 除核心指标外,数据集一并给出三个派生量。句子数即上式中的 $N$,是该公司当年关键审计事项段进入计算的句子总数。可读性绝对值的自然对数 $\ln(|Readability|)$ 是原文在计算公司间可读性差异之前所施加的变换,因可读性恒为负而先取绝对值;该列与核心指标方向相反,取值越大表示文本越难读。正文可读性沿用同一公式,但文本范围仅取事项描述段与审计应对段、不含事项类别子标题,用于文本范围口径的对照。 补充说明 - 样本口径:涵盖全部披露关键审计事项的公司年,不预先剔除金融业、特别处理公司与非标准审计意见样本,也不作缩尾处理,以便使用者按各自研究设计自行施加限制。 - 可读性的基准语料:原文的可读性取自一个商业财经文本数据库,其训练语料未公开。本数据集改在关键审计事项文本自身上训练语言模型,因而度量的是"某公司的关键审计事项写法相对于审计报告这一文体的常规写法有多罕见"。其绝对数值取决于基准语料,不能与其他语料上训练所得的可读性指标直接比较,跨数据源比较前应先作标准化。在原文样本窗口按原文口径复现公司对差异,本数据集各统计量约为原文报告值的七成,分布形态一致而离散度整体压缩,即差异表现为尺度而非构念。 - 年度趋势须加年份固定效应:该指标逐年上升。以早期年份语料单独训练模型、对其后年份完全样本外地重新打分,上升幅度约减半,说明其中约一半可归为审计文本的真实同质化,另约一半来自语言模型对后期语料更为熟悉。作时间序列或双重差分推断时应加年度固定效应,不宜将年度均值变化直接解读为可读性的真实改善。 - 首年样本不可比:关键审计事项准则分批生效,最早一年仅少数境内外同时上市的公司先行执行,金融业占比远高于其后年份,而金融业恰是本指标最低的行业;按其后年份的行业权重重新加权后,该年与后续年份的差距缩小约七成。建议样本起点取准则对境内上市公司全面生效的年度。 - 与词频基线的关系:该指标与"句内各词对数词频之和的句均值"这一朴素基线的相关系数约零点九三,再计入平均句长后可决系数约零点八九。这是层次softmax以词频构造编码路径所致,属该方法的固有性质。其相对于简单词频统计的增量信息来自词的前后搭配,若研究只需用词生僻度的代理,朴素词频基线亦可胜任。 - 其他局限:词频低于下限的词不进入语言模型词表,计算生成概率时被跳过,含较多罕见词的句子的对数似然会因此偏高;训练与打分使用同一批文本,以部分公司语料训练、对其余公司样本外打分的对照显示,样本内训练带来的乐观偏差在水平上很小、对公司间排序几乎无影响;上游文本设有长度上限,触顶条目的可读性更低,按字段长度分档观察为单调下降而非断崖跳变,属"长文本本身更难读"的延续;上游少数条目在文本清洗中丢失句号,分句后形成长句而使可读性偏低;正文口径与核心指标共用同一模型且句子高度重叠,展示的是文本范围差异,不构成独立的方法学验证;更换随机种子重训重算,取值的跨种子标准差约为全样本标准差的百分之一。 参考文献 - 田高良,陈匡宇,齐保垒.会计师事务所有基于关键审计事项的审计风格吗——基于中国上市公司披露新版审计报告的经验证据[J].会计研究,2021,(11):160-177.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。