关键审计事项文本相似度(TF-IDF余弦相似度)
「关键审计事项文本相似度(TF-IDF余弦相似度)」,覆盖 2017-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 32,551。 衡量审计师在关键审计事项披露中的履职积极性与信息增量。
| 时间跨度 | 2017-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 32,551 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [股票简称] — 根据NameChange动态匹配的当年股票简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- KAMSimCos [KAM余弦相似度] — 参考Brown & Tucker (2011, JAR)和董延安、展嘉宜(2024, 会计之友)的方法,计算公式为:cos(TF-IDF_t, TF-IDF_{t-1}),度量同一公司相邻年度关键审计事项文本的纵向相似度。用作研究变量,越大代表审计师对关键审计事项披露修改越少
- KAMModScore [KAM修改程度] — 参考Brown & Tucker (2011, JAR)的方法,计算公式为:1 - KAMSimCos。用作研究变量,越大代表审计师对关键审计事项文本修改越多
- KAMItemCount [KAM事项数量当年] — 当年关键审计事项的条目数量
- KAMWordCount [KAM词数当年] — 当年所有关键审计事项完整文本(Description+Method)合并后jieba分词的词数
- KAMWordCountPrior [KAM词数上年] — 上年所有关键审计事项完整文本(Description+Method)合并后jieba分词的词数
常见问题
- 「关键审计事项文本相似度(TF-IDF余弦相似度)」是什么数据集?
- 关键审计事项文本相似度(TF-IDF余弦相似度),隶属信息环境。衡量审计师在关键审计事项披露中的履职积极性与信息增量。
- 该数据集的时间范围是?
- 覆盖 2017-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:KAM余弦相似度、KAM修改程度、KAM事项数量当年、KAM词数当年、KAM词数上年。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 32,551 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在度量上市公司年度报告中关键审计事项(KAM)文本披露的纵向变化程度,以评估审计师履职的积极性与信息披露的增量。其核心思想源于Brown和Tucker(2011)对管理层讨论与分析(MD&A)文本修改的研究,认为审计师对KAM披露内容的修改反映了其勤勉尽责的程度。具体而言,通过计算同一公司相邻两个年度KAM披露文本的相似度,相似度越高,表明审计师对KAM的披露内容修改越少,信息增量有限;相似度越低,则表明审计师进行了更多实质性修改,履职更为积极。 计算过程首先需要构建年度KAM文本。对于每家公司在每个财务年度,将其所有关键审计事项的“事项描述”(Description)与“审计应对”(Method)两部分完整文本进行合并,形成该年度唯一的KAM文本。随后,使用中文分词工具对全样本所有年度的合并文本进行分词,并基于词频-逆文档频率(TF-IDF)方法,将每个年度文本转化为一个高维向量,其中TF采用亚线性缩放(sublineartf)以平滑词频的影响。 核心指标为KAM文本的余弦相似度(KAMSimCos),它度量了公司第t年与第t-1年KAM TF-IDF向量之间的夹角余弦值,计算公式为: $$KAMSimCos = \cos(\vec{Vt}, \vec{V{t-1}}) = \frac{\vec{Vt} \cdot \vec{V{t-1}}}{\|\vec{Vt}\| \|\vec{V{t-1}}\|}$$ 其中$\vec{Vt}$和$\vec{V{t-1}}$分别代表第t年和第t-1年KAM文本的TF-IDF向量。 基于此相似度,进一步计算KAM修改程度(KAMModScore),其定义为$1 - KAMSimCos$。该值越大,代表文本修改程度越高。此外,数据集还提供了辅助变量,包括当年KAM事项数量(KAMItemCount)、当年KAM文本分词后的总词数(KAMWordCount)以及上一年度的KAM文本总词数(KAMWordCountPrior),用于控制披露文本的基本特征。 补充说明 - 计算相似度要求公司必须拥有连续两年(t年和t-1年)的KAM披露文本。 - 仅基于公司自身前后期文本进行纵向比较,不进行跨公司横向比较。 参考文献 [1]Brown S V, Tucker J W. Large-sample evidence on firms' year-over-year MD&A modifications[J]. Journal of Accounting Research, 2011, 49(2): 309-346. [2]董延安,展嘉宜.董事高管责任保险与审计师履职行为——来自关键审计事项相似度的证据[J].会计之友,2024,(2):19-26.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。