关键审计事项文本相似度(TF-IDF余弦相似度)

「关键审计事项文本相似度(TF-IDF余弦相似度)」,覆盖 2017-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 32,551。 衡量审计师在关键审计事项披露中的履职积极性与信息增量。

时间跨度2017-2025 年
数据频率年度
层级上市公司
变量数16
样本量32,551
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [股票简称] — 根据NameChange动态匹配的当年股票简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • KAMSimCos [KAM余弦相似度] — 参考Brown & Tucker (2011, JAR)和董延安、展嘉宜(2024, 会计之友)的方法,计算公式为:cos(TF-IDF_t, TF-IDF_{t-1}),度量同一公司相邻年度关键审计事项文本的纵向相似度。用作研究变量,越大代表审计师对关键审计事项披露修改越少
  • KAMModScore [KAM修改程度] — 参考Brown & Tucker (2011, JAR)的方法,计算公式为:1 - KAMSimCos。用作研究变量,越大代表审计师对关键审计事项文本修改越多
  • KAMItemCount [KAM事项数量当年] — 当年关键审计事项的条目数量
  • KAMWordCount [KAM词数当年] — 当年所有关键审计事项完整文本(Description+Method)合并后jieba分词的词数
  • KAMWordCountPrior [KAM词数上年] — 上年所有关键审计事项完整文本(Description+Method)合并后jieba分词的词数

常见问题

「关键审计事项文本相似度(TF-IDF余弦相似度)」是什么数据集?
关键审计事项文本相似度(TF-IDF余弦相似度),隶属信息环境。衡量审计师在关键审计事项披露中的履职积极性与信息增量。
该数据集的时间范围是?
覆盖 2017-2025 年。
包含哪些变量/指标?
共 16 个变量。核心指标包括:KAM余弦相似度、KAM修改程度、KAM事项数量当年、KAM词数当年、KAM词数上年。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 32,551 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在度量上市公司年度报告中关键审计事项(KAM)文本披露的纵向变化程度,以评估审计师履职的积极性与信息披露的增量。其核心思想源于Brown和Tucker(2011)对管理层讨论与分析(MD&A)文本修改的研究,认为审计师对KAM披露内容的修改反映了其勤勉尽责的程度。具体而言,通过计算同一公司相邻两个年度KAM披露文本的相似度,相似度越高,表明审计师对KAM的披露内容修改越少,信息增量有限;相似度越低,则表明审计师进行了更多实质性修改,履职更为积极。 计算过程首先需要构建年度KAM文本。对于每家公司在每个财务年度,将其所有关键审计事项的“事项描述”(Description)与“审计应对”(Method)两部分完整文本进行合并,形成该年度唯一的KAM文本。随后,使用中文分词工具对全样本所有年度的合并文本进行分词,并基于词频-逆文档频率(TF-IDF)方法,将每个年度文本转化为一个高维向量,其中TF采用亚线性缩放(sublineartf)以平滑词频的影响。 核心指标为KAM文本的余弦相似度(KAMSimCos),它度量了公司第t年与第t-1年KAM TF-IDF向量之间的夹角余弦值,计算公式为: $$KAMSimCos = \cos(\vec{Vt}, \vec{V{t-1}}) = \frac{\vec{Vt} \cdot \vec{V{t-1}}}{\|\vec{Vt}\| \|\vec{V{t-1}}\|}$$ 其中$\vec{Vt}$和$\vec{V{t-1}}$分别代表第t年和第t-1年KAM文本的TF-IDF向量。 基于此相似度,进一步计算KAM修改程度(KAMModScore),其定义为$1 - KAMSimCos$。该值越大,代表文本修改程度越高。此外,数据集还提供了辅助变量,包括当年KAM事项数量(KAMItemCount)、当年KAM文本分词后的总词数(KAMWordCount)以及上一年度的KAM文本总词数(KAMWordCountPrior),用于控制披露文本的基本特征。 补充说明 - 计算相似度要求公司必须拥有连续两年(t年和t-1年)的KAM披露文本。 - 仅基于公司自身前后期文本进行纵向比较,不进行跨公司横向比较。 参考文献 [1]Brown S V, Tucker J W. Large-sample evidence on firms' year-over-year MD&A modifications[J]. Journal of Accounting Research, 2011, 49(2): 309-346. [2]董延安,展嘉宜.董事高管责任保险与审计师履职行为——来自关键审计事项相似度的证据[J].会计之友,2024,(2):19-26.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。