修辞民族主义(TF-IDF加权词频)
「修辞民族主义(TF-IDF加权词频)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 67,856。 衡量上市公司年报中管理层讨论与分析(MD&A)文本的民族主义修辞倾向。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 18 |
| 样本量 | 67,856 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- RhetoricalNationalism [修辞民族主义总分] — 参考Yue, Zheng & Mao (2023, Management and Organization Review)的方法,计算公式为:四个维度得分之和。用作研究变量,越大代表企业年报中修辞民族主义水平越高
- NationalPrideScore [民族自豪得分] — 参考Yue, Zheng & Mao (2023, MOR)的方法,计算公式为:sum(TF_i*IDF_i)/D*100,其中TF_i为关键词i在MD&A中的词频,IDF_i=log(1+N/n_i),D为MD&A总词数
- NationalRevivalScore [民族复兴得分] — 参考Yue, Zheng & Mao (2023, MOR)的方法,计算公式为:sum(TF_i*IDF_i)/D*100,其中TF_i为关键词i在MD&A中的词频,IDF_i=log(1+N/n_i),D为MD&A总词数
- CorporateRoleScore [企业角色得分] — 参考Yue, Zheng & Mao (2023, MOR)的方法,计算公式为:sum(TF_i*IDF_i)/D*100,其中TF_i为关键词i在MD&A中的词频,IDF_i=log(1+N/n_i),D为MD&A总词数
- AntiForeignScore [反外得分] — 参考Yue, Zheng & Mao (2023, MOR)的方法,计算公式为:sum(TF_i*IDF_i)/D*100,其中TF_i为关键词i在MD&A中的词频,IDF_i=log(1+N/n_i),D为MD&A总词数
- MDAExtracted [MDA提取标志] — 是否成功提取MD&A章节(0=否,1=是),0表示回退使用年报全文
- MDAWordCount [MDA词数] — MD&A部分的总词数(jieba分词),用于TF-IDF计算的分母D。单位:个
常见问题
- 「修辞民族主义(TF-IDF加权词频)」是什么数据集?
- 修辞民族主义(TF-IDF加权词频),隶属信息环境。衡量上市公司年报中管理层讨论与分析(MD&A)文本的民族主义修辞倾向。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 18 个变量。核心指标包括:修辞民族主义总分、民族自豪得分、民族复兴得分、企业角色得分、反外得分、MDA提取标志、MDA词数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,856 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 修辞民族主义(Rhetorical Nationalism)衡量的是中国上市公司在年度报告的管理层讨论与分析(MD&A)部分中,通过特定修辞策略表达民族主义倾向的程度。该指标基于文本分析方法构建,旨在捕捉企业在官方沟通中如何将自身叙事与国家民族主义话语相结合。具体而言,修辞民族主义被解构为四个相互关联的维度:民族自豪(National Pride)、民族复兴(National Revival)、企业角色(Corporate Role)和反外(Anti-Foreign)。每个维度通过一组预定义的关键词来识别和度量。 计算过程首先对每份年报的MD&A部分进行文本预处理和分词。对于每个维度,计算其得分。核心方法是使用TF-IDF(词频-逆文档频率)加权技术来评估关键词的重要性,以避免常见词对结果的干扰。具体计算公式为: $$Score{dim} = \frac{\sum{i=1}^{K} (TFi \times IDFi)}{D} \times 100$$ 其中,$Score{dim}$代表某一维度的得分(如民族自豪得分),$TFi$为关键词$i$在当期公司MD&A文本中出现的词频,$IDFi = \log(1 + N / ni)$为关键词$i$的逆文档频率,$N$为样本中所有公司的文档总数,$ni$为包含关键词$i$的文档数量,$D$为当期公司MD&A文本经过分词后的总词数。该公式计算的是特定维度关键词的加权频率占文本总长度的百分比,从而实现了跨公司、跨年度的标准化比较。 最终,修辞民族主义总分(RhetoricalNationalism)由四个维度得分加总得出,即$RhetoricalNationalism = NationalPrideScore + NationalRevivalScore + CorporateRoleScore + AntiForeignScore$。该总分值越大,表明企业在年报MD&A中体现的修辞民族主义整体水平越高。 补充说明 - 文本来源优先使用年报的“管理层讨论与分析”(MD&A)部分。若该部分无法成功提取,则回退使用年报全文进行计算,并通过MDAExtracted字段进行标识(1表示成功提取MD&A,0表示回退全文)。 - 文本处理采用jieba分词工具进行中文分词,MDAWordCount字段记录了用于计算的分母$D$,即分词后的总词数。 参考文献 [1]Yue L J, Zheng Y, Mao J Y. Rhetorical nationalism among Chinese public firms[J]. Management and Organization Review, 2023, 19(5): 1003-1043.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。