关键审计事项呈现形式
「关键审计事项呈现形式」,覆盖 2016-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 38,651。 衡量上市公司审计报告中关键审计事项部分采用的信息呈现形式。
| 时间跨度 | 2016-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 14 |
| 样本量 | 38,651 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- KAMSectionChars [关键审计事项章节字符数] — 审计报告中关键审计事项章节的文本长度,计算公式为:自关键审计事项章节标题起至审计报告下一章节标题止的文本字符个数。可用于判断该章节文本的提取完整程度
- IsKAMSectionExtracted [是否成功提取关键审计事项章节] — 是否从年报的审计报告中成功定位到关键审计事项章节(0=否,1=是)。取0表示该公司当年的年报文本未包含可供解析的审计报告关键审计事项章节,呈现形式无法判定
- IsTableFormat [关键审计事项是否表格形式呈现] — 参考皮小玲等(2025,会计之友)的方法,审计报告中关键审计事项是否采用表格形式呈现(0=否,1=是),即原文的关键审计事项呈现形式变量。采用表格逐项并列呈现事项与审计应对的取1,采用纯文本段落依次叙述的取0,依据审计报告原文中关键审计事项列与审计应对列两列表头的排版特征判定。用作研究变量,取1代表信息呈现更简明扼要、施加给信息使用者的认知负荷更低
常见问题
- 「关键审计事项呈现形式」是什么数据集?
- 关键审计事项呈现形式,隶属公司治理。衡量上市公司审计报告中关键审计事项部分采用的信息呈现形式。
- 该数据集的时间范围是?
- 覆盖 2016-2025 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:关键审计事项章节字符数、是否成功提取关键审计事项章节、关键审计事项是否表格形式呈现。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 38,651 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 认知心理学的认知负荷理论指出,个体处理信息的认知资源有限,信息的呈现形式并非中性的载体:同等内容在不同排版下会对信息使用者施加不同的认知成本,进而改变其信息获取效率与决策行为。会计信息的表达形式因此与内容本身同样重要。自新审计准则实施、审计报告中增设关键审计事项段以来,注册会计师需要就其识别的重大风险事项及相应的审计应对进行沟通,这一段落成为审计师向市场传递增量信息的主要渠道,而其呈现形式在实务中并未统一。 关键审计事项在实务中存在两种典型的呈现形式。一种是表格形式:审计师以两列表格逐项并列列示,左列陈述事项本身及其被识别为关键审计事项的理由,右列对应说明该事项在审计中是如何应对的。表格的行列结构使事项与应对一一对应,条框的约束性去除了部分非必要描述,信息按层次排列,有助于降低搜索与理解所需的认知努力,也便于在不同事项之间横向比较。另一种是纯文本形式:审计师以段落依次叙述,通常先描述事项、再阐述所执行的审计程序。纯文本在逻辑表达上更具灵活性与完整性,能够容纳更充分的风险论证,但同时也可能带来信息冗余与重点分散。 本数据集刻画上市公司审计报告中关键审计事项所采用的呈现形式,定义为二元变量: $$ \mathrm{Format}{i,t}= \begin{cases} 1, & \text{公司 } i \text{ 第 } t \text{ 年审计报告的关键审计事项以表格形式呈现}\\[2pt] 0, & \text{以纯文本形式呈现} \end{cases} $$ 指标的构造分为章节定位与形式判定两步。 第一步,从年度报告全文中切分出审计报告的关键审计事项章节。 由于"关键审计事项"一词在年报目录、章节索引以及正文叙述中均可能出现,直接检索首个匹配位置会把起点错误地落在目录条目上。为此先以"形成审计意见的基础"这一仅出现于审计报告正文的固定表述作为锚点(对非标准审计意见,相应兼容"形成保留意见的基础"等措辞),在其之后寻找独立成行的关键审计事项章节标题作为起点,再以审计报告中紧随其后的同级章节标题——其他信息、管理层和治理层对财务报表的责任、注册会计师对财务报表审计的责任及其措辞变体——作为终点。标题的序号形态在实务中并不统一,顿号式、阿拉伯数字式、全角括号式与无序号的裸标题均需兼容,行首还可能残留由版式转换产生的项目符号。切分所得片段的长度须落在 $[500,\,30000]$ 字符区间内:过短意味着章节正文未被完整保留,过长意味着起止点界定失败、片段越出了审计报告范围,两种情形均记为定位失败而不做猜测。 第二步,依据两列表头的排版特征判定呈现形式。 表格形式的审计报告必然在关键审计事项章节内出现一组两列表头,左列题为"关键审计事项",右列题为"该事项在审计中是如何应对的"或其措辞变体(在审计中如何应对该事项、我们在审计中如何应对关键审计事项、审计中的应对、审计应对、应对措施等);纯文本形式则直接进入以事项名称为小标题的叙述段落,不存在这样的表头。版式转换会使同一组表头落在不同的文本形态上,因此需要同时识别三种形态:其一,左右两列表头被拆分为相邻的两个独立短行;其二,两列表头保留在同一行内、以连续空白分隔;其三,章节起点回退到表格左栏表头之后,使左栏表头被当作章节标题吞掉、片段开头只余右栏表头。命中任一形态即判定为表格形式,均未命中则判定为纯文本形式。纯文本形式的章节开头恒为固定措辞的引言段,不会以应对列表头起始,故第三种形态不会产生误判。 章节定位失败的公司年度保留在数据集中,其呈现形式取值为缺失而非取零,以免将"未能识别"与"确为纯文本"混为一谈。数据集同时给出章节字符数与章节是否成功提取两个字段,供使用者评估文本解析质量并自行决定样本取舍。 补充说明 - 样本口径:以已确认披露关键审计事项、且年度报告全文可得的公司年度为样本,不预先施加剔除金融保险业、剔除特别处理公司或剔除资不抵债样本等回归设定,二元变量亦无需缩尾;使用者可按研究设计自行筛选。 - 识别方式:原文未公开该变量的识别算法,其取值来源于商业数据库的既有标注或人工判读。本数据集改由审计报告原文的排版特征自动识别,与原文标注在个案上可能存在差异,总体水平与原文报告的量级和方向一致。 - 方法性质:呈现形式在很大程度上由会计师事务所的报告模板决定,同一事务所的客户往往一致地采用同一种形式,公司层面的跨年取值也具有很强的粘性。以本变量研究企业层面的经济后果时,它会同时承载事务所层面的差异,建议在回归中加入事务所固定效应,或以更换事务所的样本进行识别。 - 章节定位失败的分布:定位失败并非随机分布,在金融业与交通运输业中的比例高于制造业,主要成因是部分公司的年报文本未包含审计报告全文(大型企业与金融机构较常将审计报告单独披露)。以同一公司相邻年度取值推断,缺失样本中表格形式的占比高于可观测样本,含规模控制变量的回归会因此损失一部分样本,建议报告缺失填补后的稳健性结果。 - 其他局限:新审计准则实施首年仅 A+H 股公司先行披露关键审计事项,该年度样本的公司规模与呈现形式分布均不宜与其余年度直接比较,建议主分析自次年起算;北交所公司的证券代码在样本期内发生过整体变更,同一主体在面板中会呈现为两个代码,做公司固定效应或滞后项设定前需先行归并;关键审计事项明细的收录进度可能落后于年报披露进度,最新年度的覆盖低于往年;排版指纹法存在少量残余测量误差,以同一事务所同一年度内的少数派观测衡量,其上界处于百分之几的水平。 参考文献 [1]皮小玲,唐凯桃,杨萌.关键审计事项呈现形式与分析师关注度[J].会计之友,2025,(20):107-115.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。