关键审计事项类别文本相似度
「关键审计事项类别文本相似度」,覆盖 2016-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 38,959。 参考田高良等(2021,会计研究)的方法,以关键审计事项段一级子标题构成的类别短文本为对象,对同一年度同一行业分组内的公司两两计算N元语法模糊匹配相似度并聚合到
| 时间跨度 | 2016-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 38,959 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NKAMItems [关键审计事项条数] — 上市公司当年审计报告关键审计事项段中披露的事项条数,按事项的一级子标题计数;同一类别名称下描述内容不同的并列事项分别计入。用于刻画审计师识别并沟通的重大风险点数量。
- KAMCharSetSize [类别文本字符集规模] — 将当年全部关键审计事项一级子标题拼接为一段短文本后该文本包含的不重复字符个数,计算公式为:G(x)的元素个数,其中G(x)为短文本x去除空白字符后的字符集合。该值是类别文本相似度计算式的分母构件,标题措辞越冗长其值越大;由于相似度指标对文本长度存在固有敏感性,建议在回归分析中将其作为控制变量。
- NPeerFirms [同侪公司数] — 与本公司处于同一年度、同一行业分组且当年同样披露了关键审计事项、因而参与两两配对的其他公司数量,计算公式为:所在行业年度组内公司数减1。行业分组为制造业保留行业代码前两位字符、非制造业保留首字母,并按年度动态匹配。该值越小表示相似度所依据的配对越少、估计噪声越大。
- TypeSimilarity [关键审计事项类别文本相似度] — 参考田高良等 (2021, 会计研究)的方法,衡量公司披露的关键审计事项类别与同行业同年度其他公司的文本可比性。先将公司当年全部关键审计事项一级子标题拼接为一段短文本,再对同一年度同一行业分组内的公司两两做N元语法模糊匹配,计算公式为:相似度=2×两段文本共有字符个数/(两段文本各自字符个数之和),取N=1;最后对该公司与组内全部其他公司的相似度取算术平均。取值介于0与1之间。用作研究变量,越大代表该公司披露的关键审计事项类别越贴近同行业常规做法、披露的企业特异性越弱。
- TypeSimilarityMed [类别文本相似度中位数] — 参考De Franco等 (2011, JAR)将配对可比性转换为公司层面变量时采用同行业中位数的做法,计算公式为:本公司与同一年度同一行业分组内全部其他公司的关键审计事项类别文本相似度的中位数,相似度定义与主口径一致。用作稳健性检验变量,相比均值口径更不易受个别极端配对影响。
- TypeSimilarityBigram [类别文本相似度(二元组口径)] — 关键审计事项类别文本相似度的二元组替代口径,计算公式为:将比较单元由单个字符改为相邻两字符构成的二元组后,相似度=2×两段文本共有二元组个数/(两段文本各自二元组个数之和),再对全部同侪取算术平均。用作稳健性检验变量,用于检验主口径对N元语法阶数选择的敏感性。
常见问题
- 「关键审计事项类别文本相似度」是什么数据集?
- 关键审计事项类别文本相似度,隶属公司治理。参考田高良等(2021,会计研究)的方法,以关键审计事项段一级子标题构成的类别短文本为对象,对同一年度同一行业分组内的公司两两计算N元语法模糊匹配相似度并聚合到
- 该数据集的时间范围是?
- 覆盖 2016-2025 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:关键审计事项条数、类别文本字符集规模、同侪公司数、关键审计事项类别文本相似度、类别文本相似度中位数、类别文本相似度(二元组口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 38,959 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 审计报告中的关键审计事项段,是注册会计师按职业判断认定的、对本期财务报表审计最为重要的事项。审计师在这一段落中先以一级子标题概括所识别的事项类别,如"收入确认""商誉减值""应收账款坏账准备",再在标题之下说明识别该事项的依据以及围绕它执行的特殊审计程序。事项类别的取舍并非纯粹由被审计公司的固有属性决定:会计师事务所内部的准则解读、工作范式与对注册会计师的继续教育,会使同一家事务所的审计师系统性地偏好检验某些会计科目、沟通某类事项,而系统性地忽略另一些。因此,关键审计事项类别披露的可比性,构成了继财务报告应计结构之后另一条观测会计师事务所审计风格的路径。本数据集依此思路,度量每家上市公司披露的关键审计事项类别与同行业同年度其他公司之间的文本相似程度。 计算自类别短文本的构造开始。对每一个公司—年度,取该年审计报告关键审计事项段的全部一级子标题,按事项在报告中的排列次序拼接为一段短文本,并去除其中的全部空白字符。类别名称相同但描述内容不同的并列事项(例如同一公司分别披露两项资产的商誉减值)各自计入,仅当类别名称与描述内容完全一致时才视为冗余记录予以合并。这段短文本即为后续全部计算的输入,其所含事项条数与不重复字符个数一并作为中间变量输出。 配对相似度采用字符层面的 N 元语法模糊匹配。设 $GN(x)$ 为短文本 $x$ 的字符 N 元语法集合(二值集合,不计同一元语法的重复出现),两家公司 $a$ 与 $b$ 之间的类别文本相似度定义为两个集合的 Sørensen-Dice 系数: $$\text{Sim}(a,b)=\frac{2\left|GN(a)\cap GN(b)\right|}{\left|GN(a)\right|+\left|GN(b)\right|}$$ 其取值介于 0 与 1 之间:为 0 表示两家公司的类别文本没有任何共同成分,为 1 表示两者所用字符完全一致。 需要说明的是,原文只写明使用 N 元语法距离做模糊匹配、相似度得分落在 0 与 1 之间,并未给出元语法的阶数与具体的归一化公式,类别文本的清洗规则亦未交代。上式因此是在原文口径下反推确定的:本数据集在原文的样本区间与样本筛选条件下,对字符一元、二元、三元语法分别配以 Dice 与 Jaccard 归一化,并与序列匹配比率、分词后的词级一元与二元语法等候选实现逐一试算,取配对层面描述统计最贴近原文表 2 所报告数值者作为主口径,即以单个汉字为比较单元的字符一元语法 Dice 系数,其与原文报告均值的偏离在数个百分点之内,而其余候选的偏离幅度高出数倍。$N=2$ 的二元语法口径作为替代度量并行输出,用于检验结果对元语法阶数选择的敏感性。 配对在同一年度、同一行业分组的公司之间穷尽进行,即每家公司与同组内其余每家公司各配对一次。行业分组沿用中国上市公司协会的行业分类并按年度动态匹配公司当年所属行业:制造业保留行业代码的前两位字符,非制造业保留首位字母。原文使用证监会 2012 年版分类并声明"对于制造业 C 保留两位细分行业编码",该表述在字符数上存在歧义;本数据集按两位字符理解,依据是在原文样本区间与样本筛选条件下,按此粒度分组所得的公司对总数与原文报告的配对样本量高度吻合,而按"字母加两位数字"的更细粒度所得配对数则与之相差数倍。 由于配对相似度以公司对为观测单位,而本数据集以公司—年度为观测单位,须将配对结果聚合到公司层面。核心指标取算术平均,即公司 $i$ 与同年度同行业分组内全部其他公司 $j$ 的相似度均值 $\text{TypeSimilarity}i=\overline{\text{Sim}(i,j)}$;稳健口径另取同组相似度的中位数,沿用 De Franco 等将配对可比性转换为公司层面变量时采用同行业中位数的做法。指标数值越大,表示该公司披露的关键审计事项类别越贴近同行业的常规做法;数值越小,表示其披露越具企业特异性,越多地指向本企业当期特有的风险点。参与配对的同侪公司数量一并输出,供使用者判断各观测所依据的配对基数。 补充说明 - 样本口径:本数据集保留全部披露关键审计事项的公司—年度,不预先剔除被实施特别处理的公司与获得非标准审计意见的公司,也不做缩尾处理。原文在构建配对样本时剔除了这两类公司,理由是它们更多披露与持续经营不确定性相关的事项。保留它们可使这些在审计研究中往往最受关注的公司自身也获得取值,代价是配对池纳入了披露更具特异性的样本,公司层面相似度因而略低于原文口径;使用者可依据特别处理状态与审计意见类型自行过滤以复现原文设定。 - 观测粒度:原文的被解释变量定义在公司对上,本数据集将其聚合至公司—年度。聚合不改变配对相似度本身的定义,但公司层面的取值不能与原文所报告的配对层面描述统计直接对标。原文另有取"最相似若干家均值"的极值型聚合口径,本数据集经检验后不予采用:固定同一总体而仅改变组规模时,该口径随组内公司数单调上升并大量取到上界,实际度量的是行业规模而非披露相似度。 - 文本长度敏感性:Dice 系数以两段文本的字符集规模之和为分母,措辞冗长的标题会被系统性判定为更具特异性。事项条数无法代理这一效应,故数据集直接输出类别文本的字符集规模,建议在回归分析中将其作为控制变量。 - 顺序不敏感:主口径以字符集合为比较单元,相似度对类别的排列次序与同类事项的重复披露不敏感,同一字符集合被判定为完全一致。这与"类别集合本无先后"的构念相符,对排列敏感的研究可改用二元语法口径;该口径下多条标题按序无分隔拼接,接缝处会产生少量跨事项的二元语法。 - 时间可比性:关键审计事项准则对不同板块分年度生效,先行执行年份的公司数量与披露风格均与其后年份差异明显,其取值不宜与后续序列并置;末一年度的源数据通常仍在补录之中。同侪组按年度动态匹配行业,少数公司在相邻年度发生行业切换时,即使披露文本完全未变,取值也会因参照组更换而跳动,使用公司固定效应模型时宜加以处理。指标存在明显的时间趋势,做时间维度的推断须加入年度固定效应。 参考文献 - 田高良,陈匡宇,齐保垒.会计师事务所有基于关键审计事项的审计风格吗——基于中国上市公司披露新版审计报告的经验证据[J].会计研究,2021,(11):160-177. - Francis J R, Pinnuck M L, Watanabe O. Auditor style and financial statement comparability[J]. The Accounting Review, 2014, 89(2): 605-633. - De Franco G, Kothari S P, Verdi R S. The benefits of financial statement comparability[J]. Journal of Accounting Research, 2011, 49(4): 895-931.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。