年报可读性(丘心颖PCA法)
「年报可读性(丘心颖PCA法)」,覆盖 2001-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 66,664。 衡量上市公司年报文本的阅读难度与理解成本。
| 时间跨度 | 2001-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 23 |
| 样本量 | 66,664 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- AvgSentLen [平均句长] — 参考丘心颖等(2020, CJAS)的方法,计算公式为:总字符数/句子数(以句号/问号/感叹号/分号/换行分句),值越大可读性越差
- RareCharRatio [生僻字比例] — 参考丘心颖等(2020, CJAS)的方法,计算公式为:(总汉字数-常用3500字内汉字数)/总汉字数,值越大可读性越差。单位:比例
- NumCharRatio [数字字符比例] — 参考丘心颖等(2020, CJAS)的方法,计算公式为:数字字符数/总字符数,值越大可读性越差。单位:比例
- ProfTermRatio [专业术语密度] — 参考丘心颖等(2020, CJAS)的方法,计算公式为:财务法律专业术语出现次数/总汉字数,值越大可读性越差。单位:比例
- ReadabilityPCA [可读性综合指标PCA] — 参考丘心颖等(2020, CJAS)的方法,计算公式为:4子指标(平均句长/生僻字比例/数字字符比例/专业术语密度)标准化后PCA第一主成分得分,值越大可读性越差。用作研究变量,建议优先使用各子指标
- MDAAvgSentLen [MD&A平均句长] — 参考丘心颖等(2020, CJAS)的方法,仅MD&A章节的平均句长,值越大可读性越差
- MDARareCharRatio [MD&A生僻字比例] — 参考丘心颖等(2020, CJAS)的方法,仅MD&A章节的生僻字比例,值越大可读性越差。单位:比例
- MDANumCharRatio [MD&A数字字符比例] — 参考丘心颖等(2020, CJAS)的方法,仅MD&A章节的数字字符比例,值越大可读性越差。单位:比例
- MDAProfTermRatio [MD&A专业术语密度] — 参考丘心颖等(2020, CJAS)的方法,仅MD&A章节的专业术语密度,值越大可读性越差。单位:比例
- MDAReadabilityPCA [MD&A可读性综合指标PCA] — 参考丘心颖等(2020, CJAS)的方法,仅MD&A章节的4子指标标准化后PCA第一主成分得分,值越大可读性越差。用作研究变量,建议优先使用各子指标
- FileLen [年报总字符数] — 参考Loughran & McDonald (2014, JF)的方法,年报全文字符数,值越大年报越长。单位:个
- MDAExtracted [MD&A提取标志] — 参考Li (2008, JAE); Donald (2014, JF)。是否成功提取管理层讨论与分析章节(0=否,1=是),MD&A提取标志=0时人工智能水平-MDA基于全文计算
常见问题
- 「年报可读性(丘心颖PCA法)」是什么数据集?
- 年报可读性(丘心颖PCA法),隶属信息环境。衡量上市公司年报文本的阅读难度与理解成本。
- 该数据集的时间范围是?
- 覆盖 2001-2025 年。
- 包含哪些变量/指标?
- 共 23 个变量。核心指标包括:平均句长、生僻字比例、数字字符比例、专业术语密度、可读性综合指标PCA、MD&A平均句长、MD&A生僻字比例、MD&A数字字符比例、MD&A专业术语密度、MD&A可读性综合指标PCA、年报总字符数、MD&A提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 66,664 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在衡量中国上市公司年度报告(年报)的文本可读性。可读性越差,意味着投资者理解信息所需付出的认知成本越高。参考Luo等(2018)和Li(2008)的研究,本数据集从多个语言学维度构建可读性指标,分别针对年报全文以及其中关键的“管理层讨论与分析”(MD&A)章节进行计算。 年报可读性的评估基于四个核心子指标,这些指标值越大,代表文本可读性越差。首先,平均句长(AvgSentLen)衡量文本的句法复杂度,计算公式为总字符数除以句子数,其中句子以句号、问号、感叹号、分号或换行符为界进行分割。其次,生僻字比例(RareCharRatio)反映词汇的常见程度,计算公式为(总汉字数 - 常用3500字内汉字数)除以总汉字数。第三,数字字符比例(NumCharRatio)衡量文本中数字信息的密集度,计算公式为数字字符数除以总字符数。第四,专业术语密度(ProfTermRatio)评估文本的专业化程度,计算公式为财务法律专业术语出现次数除以总汉字数。 为了提供一个综合的可读性度量,将上述四个子指标在年度横截面上进行标准化后,采用主成分分析(PCA)提取第一主成分,得到可读性综合指标PCA(ReadabilityPCA)。该综合指标同样遵循“值越大,可读性越差”的原则。 考虑到MD&A章节是年报中管理层对公司经营状况进行主观分析和展望的核心部分,其可读性具有特殊的研究价值。因此,本数据集单独对成功提取的MD&A章节文本,重复上述计算过程,得到对应的四个子指标(MDAAvgSentLen、MDARareCharRatio、MDANumCharRatio、MDAProfTermRatio)以及综合指标(MDAReadabilityPCA)。此外,参考Loughran和McDonald(2014)的研究,本数据集还提供了年报总字符数(FileLen)作为衡量年报长度的基础指标。 补充说明 - 数据覆盖中国A股上市公司年度报告。 - 若未能成功提取MD&A章节(即MDAExtracted标志为0),则对应的MD&A章节可读性指标(MDAAvgSentLen等)将缺失。 - 用于计算PCA综合指标的四个子指标在计算前均进行了年度横截面上的标准化处理。 参考文献 - Li F. Annual report readability, current earnings, and earnings persistence[J]. Journal of Accounting and Economics, 2008, 45(2-3): 221-247. - Loughran T, McDonald B. Measuring readability in financial disclosures[J]. The Journal of Finance, 2014, 69(4): 1643-1671. - Luo J H, Li X, Chen H Y. Annual report readability and corporate agency costs[J]. China Journal of Accounting Research, 2018, 11(3): 187-212.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。