企业年报文本信息复杂性(三词典百字密度法)
「企业年报文本信息复杂性(三词典百字密度法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 22 个变量,样本量约 68,620。 参考王克敏等(2018,管理世界)的方法,从文本逻辑与字词两个角度度量中文年报文本信息的复杂性。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 22 |
| 样本量 | 68,620 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- CJKCharCount [年报中文字符总数] — 年报正文经清洗后的中文字符总数,为三个密度指标的共同分母。清洗规则为删除不含中文字符的段落、数字与空白字符占比超过30%的段落、年报固定格式行,并只保留含句读标点或中文字符数不少于15的文本行
- AdverseCount [逆接成分出现次数] — 年报正文分词后落入逆接连接成分表的词次,逆接成分指表达转折、让步、意外、实情等前后不协调关系的篇章连接成分
- AccountingTermCount [会计术语出现次数] — 年报正文分词后落入汉英会计词典中文词条集合的词次
- UncommonCharCount [次常用字出现次数] — 年报正文中属于《现代汉语常用字表》次常用字表(收字1000)的字符数
- Adverse [逆接成分密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:年报正文逆接成分出现次数/年报中文字符总数×100,即每百字中包含的逆接连接成分个数。用作研究变量,越大代表年报文本各句子、段落之间的语义转折越多、文本逻辑复杂性越高
- ATDensity [会计术语密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:年报正文会计术语出现次数/年报中文字符总数×100,即每百字中包含的会计专业术语个数。用作研究变量,越大代表年报文本的专业词汇越密集、对缺乏专业知识的投资者理解难度越高
- UCDensity [次常用字密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:年报正文次常用字出现次数/年报中文字符总数×100,即每百字中包含的次常用字个数。用作研究变量,越大代表年报文本中的生僻字越多、阅读顺畅性越差
- CJKCharCountLoose [宽松口径中文字符总数] — 仅施加段落级清洗规则(删除不含中文字符的段落、数字与空白字符占比超过30%的段落、年报固定格式行)时的年报正文中文字符总数,不施加保留成句文本行的门槛
- AdverseLoose [宽松口径逆接成分密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:宽松清洗口径下年报正文逆接成分出现次数/宽松口径中文字符总数×100。用作稳健性检验变量,与逆接成分密度的差异反映文本清洗口径的影响
- ATDensityLoose [宽松口径会计术语密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:宽松清洗口径下年报正文会计术语出现次数/宽松口径中文字符总数×100。用作稳健性检验变量,与会计术语密度的差异反映文本清洗口径的影响
- UCDensityLoose [宽松口径次常用字密度] — 参考王克敏等(2018,管理世界)的方法,计算公式为:宽松清洗口径下年报正文次常用字出现次数/宽松口径中文字符总数×100。用作稳健性检验变量,与次常用字密度的差异反映文本清洗口径的影响
常见问题
- 「企业年报文本信息复杂性(三词典百字密度法)」是什么数据集?
- 企业年报文本信息复杂性(三词典百字密度法),隶属信息环境。参考王克敏等(2018,管理世界)的方法,从文本逻辑与字词两个角度度量中文年报文本信息的复杂性。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 22 个变量。核心指标包括:年报中文字符总数、逆接成分出现次数、会计术语出现次数、次常用字出现次数、逆接成分密度、会计术语密度、次常用字密度、宽松口径中文字符总数、宽松口径逆接成分密度、宽松口径会计术语密度、宽松口径次常用字密度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 68,620 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 年度报告是上市公司向市场传递信息最重要的载体,但其中的文字部分并非天然易读。根据不完全反应假说,资产价格反映信息的程度取决于信息的解读成本;当文本本身的解读成本上升时,普通投资者更难看清公司的真实经营状况,管理者因而获得了通过文字表达方式影响市场预期的空间。与英文财报研究主要依赖文件长度与 Fog 指数不同,中文年报的复杂性既体现在字词层面,也体现在句子与段落之间的逻辑衔接上。本数据集沿用王克敏等(2018)的设计,从文本逻辑与字词两个角度构造三个密度指标,刻画中文年报文本信息的复杂性。三者取值越大,表示年报文本的解读难度越高。 三个指标共用同一个构造原则:先统计某一类语言成分在年报正文中出现的次数,再以正文的中文字符总数标准化,最后乘以一百,使其含义统一为「每百字中包含该类成分的个数」。记某份年报正文的中文字符总数为 $N$,某类成分的出现次数为 $n$,则 $$\text{Density}=\frac{n}{N}\times 100$$ 其中 $N$ 只计中日韩统一表意文字,不计标点、数字、拉丁字母与空白,因而不受排版差异影响。 在计数之前需要先把年报正文从版式噪声中剥离出来。原始文本中混杂着大量表格数值、页眉页脚、联系方式与勾选框,这些内容并不承载叙述信息,若计入分母会稀释密度、计入分子则会制造虚假命中。因此依次施加四条清洗规则:删除不含任何中文字符的段落;删除数字与空白字符占比超过百分之三十的段落,这类段落绝大多数是未被标记为表格的数值行;删除年报固定格式行,即仅由勾选框与「适用/不适用」「是/否」构成的行,以及孤立的计量单位行;最后,保留含有句读标点或中文字符数不少于十五的文本行,这一条对应原文对表格单元格施加的判别准则,用以剔除表格中的短标签而保留成句的叙述。经上述清洗后的文本即为下文所称的年报正文。考虑到少数公司披露的是繁体文本,会使简体词典与字表全部落空,正文在计数前先做繁简归一:以年报中必然出现的高频词所含繁体专用字为探针,命中才对全篇转换,对简体文本该操作无影响。 第一个指标是逆接成分密度(Adverse)。文本中各语言片段之间的逻辑关系越复杂,读者理解的难度越大;其中逆接成分,即表达转折、让步、意外、实情等「前后不协调」关系的篇章连接成分,是增加理解负担的典型标志。当段落之间频繁出现语义反转时,读者必须不断修正已形成的理解,阅读成本显著上升。该指标取廖秋忠(1986)所归纳的现代汉语篇章逆接连接成分,统计其在年报正文中的出现次数并按上式标准化。由于计数对象是成词的连接成分而非字符串片段,统计前先对正文分词,再以词为单位与连接成分表比对,使「但」「但是」这类连接成分只在其独立成词时计入。 第二个指标是会计术语密度(ATDensity)。已有可读性研究发现,年报的阅读难度接近高度专业化的科技与学术文献,主要原因在于其中含有大量财务会计专业术语;术语出现得越密集,缺乏专业训练的投资者越难顺畅理解。该指标以一部汉英会计专业词典的全部中文词条为术语表,同样在分词后以词为单位统计正文中落入该术语表的词次,再按上式标准化。术语表规模为五万余条,涵盖会计科目、计量属性、审计与金融工具等各类专业表述;为保证词条形态能够与分词结果相等,实际参与匹配的是其中形态为纯中文的四万六千余条,含逗号分隔同义词、方括号释义与拉丁字母的词条形态无法与任何分词结果相等,不参与匹配。 第三个指标是次常用字密度(UCDensity)。生僻字会打断阅读的连续性,迫使读者停顿辨认,从而提高理解成本。该指标以《现代汉语常用字表》中的次常用字表为准,该表收字一千,是相对于两千五百个常用字而言使用频率次一级的汉字。统计正文中属于该字表的字符数,按上式标准化。与前两个指标不同,次常用字密度是字符层面的统计,不涉及分词。 除上述三个核心指标外,数据集同时给出各指标的分子与分母,即逆接成分出现次数、会计术语出现次数、次常用字出现次数与正文中文字符总数,便于使用者按自身需要重新组合或改变标准化基准。此外还给出一组以 Loose 结尾的平行列,它们采用同样的三个公式,但在文本清洗时只施加前三条段落级规则,不施加保留成句文本行的那一条。两套口径的差别集中在表格标签等短文本是否进入正文,使用者可据此检验结论对清洗口径的敏感性。 补充说明 - 样本口径:覆盖全部可得年份、行业与板块,每家公司每个会计年度取一份年报;除沪深主板、创业板与科创板外还含 B 股与新三板主体,限定 A 股时按证券代码首位筛选即可。仅按原文做法剔除正文过短的观测(以当年正文中文字符总数的百分之一分位数为界),原文回归样本另行施加的财务与控制变量限制与指标定义无关,此处不施加。数据按原始值交付,未作缩尾。 - 可用窗口:自本世纪初起,样本对当年在册上市公司的覆盖率稳定在九成八以上,按规模分组看覆盖率平坦,无小公司系统性缺失;更早的两年只覆盖约一半公司,再往前仅有零星残片,且短文本剔除以当年样本为基准、在披露公司极少的年份会退化,极短正文因而保留、密度波动极大。数据集已给出正文中文字符总数,可按绝对长度再筛。 - 逆接成分表:廖秋忠的逆接大类下辖转折、意外、实情、让步、对立、对比六个小类,该文献未数字化,本数据集的词项逐条取自公开发表的、明确标注类别归属的二手文献与原文举例,覆盖前四类的可核查项,对立与对比无逐词记录故未纳入。其中单字「可」虽被列为转折成分,但在年报中分词后的「可」几乎全部来自「可供出售金融资产」「可转换公司债券」一类非连接用法,其频次随金融工具披露量变动,纳入会使指标转而度量披露结构,故不计入。两项取舍都使该指标的水平值低于原文报告值,企业间与年度间的相对差异不受影响;涉及水平值直接比较时建议改用组内标准化。 - 逆接成分密度的内涵:命中绝大部分来自「但」与「但是」,词表中偏口语的项目在年报语体中极少出现;「但」的用例有相当一部分来自附注固定句式(「已签订但尚未履行」「包括但不限于」「拥有权力但不控制」),其数量随子公司数与金融工具条目数变化。该指标在双向固定效应下与业绩的关系仍与文献预测一致,可作主变量,但内涵更接近转折连词密度而非完整的篇章逆接成分谱系。 - 会计术语密度的匹配范围:词典以四字及以上长术语为主,而中文分词产出以二三字词为主,实际参与匹配的主要是短词条子集;词典亦收录相当数量的通用商务词汇(公司、报告、项目、经营、交易等),贡献了可观比例的命中。已检验两种替代方案:在原文上做多模式最长匹配,其水平值显著高于文献报告值;把全部词条载入分词器用户词典,则在样本期两端与文献报告值一远一近,且同样改变不了时间趋势的形态。两者均未系统性改善贴合度,故保留现行口径;关注狭义专业术语的使用者宜自行再筛词条。 - 次常用字密度的内涵与用法:变异以企业固定成分为主(企业名称与主营产品名称用字,矿冶、化工等行业尤为明显),命中的高频字集中在「账」「赁」「履」「综」「诺」「募」这类会计常用词的构成字,与会计术语密度内涵部分重叠;新租赁准则施行后「赁」字份额出现台阶式上升,使该指标在准则变更前后口径有所不同。建议将其用作稳健性度量而非独立主变量。 - 必要的控制变量:三个指标的分母都随公司规模增长,密度因而与规模呈机械负相关,不控制规模与年度效应的无条件组间比较无法识别真实关系。建议回归设定至少包含企业固定效应、年度固定效应与公司规模,必要时再控制正文中文字符总数的对数。 - 与原文的口径差异:原文在超文本标记的表格单元格层面施加保留准则,本数据集语料为纯文本、无单元格边界,故以文本行为单位施加同一门槛,会连带删去少量被排版拆成短行的叙述文字;Loose 系列各列即为不施加该规则的平行口径,可用于检验其影响。原文使用简易中文分词系统,本数据集使用另一套开源分词器,切分差异会影响词级匹配的命中数,词表中会被默认词典切开的连接成分已注册为用户词。 - 其他局限:正文提取自年报文字层,以图片形式嵌入的表格内容不参与统计;繁简归一在字形层面进行,不改变用词习惯本身的地区差异;会计术语表反映其编纂年代的专业词汇,之后新增的会计概念不在其中。 参考文献 - 王克敏,王华杰,李栋栋,等.年报文本信息复杂性与管理者自利——来自中国上市公司的证据[J].管理世界,2018,34(12):120-132+194. - 廖秋忠.现代汉语篇章中的连接成分[J].中国语文,1986(6):413-427. - 黄理兵.中级留学生作文中句首的篇章连接成分[M]//汉语教学学刊:第2辑.北京:北京大学出版社,2006:141-154. - 国家语言文字工作委员会,国家教育委员会.现代汉语常用字表:次常用字表[S/OL].1988[2026-09-19].http://www.zdic.net/z/zb/cc2.htm. - 灵格斯词霸.灵格斯汉英会计词典[DB/OL].(2008-11-16)[2026-09-19].http://www.lingoes.cn/zh/dictionary/.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。