中小投资者税收关注
「中小投资者税收关注」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 55,622。 参考范润等(2025, 中南财经政法大学学报)的方法,以中小投资者在深圳证券交易所互动易与上海证券交易所上证e互动两个网络互动平台上向上市公司提出的涉税提问,刻
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 55,622 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 自然年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- QuestionTotal [投资者提问总数] — 当年投资者在网络互动平台上向该企业提出的提问总条数,用作中小投资者税收关注占比口径的分母
- TaxKeywordQuestionCount [税收关键词命中提问数] — 参考范润等(2025, 中南财经政法大学学报)的方法,计算公式为:当年该企业收到的提问中,正文命中税务、税负、税款、税费、所得税、欠税、纳税、税率、避税、逃税、抵免、抵扣、减免、补税、补缴这15个税收关键词中任意一个的提问条数,为逐条甄别之前的初筛结果
- TaxQuestionCount [税收相关提问数] — 参考范润等(2025, 中南财经政法大学学报)的方法,计算公式为:在税收关键词初筛命中的提问中,剔除公司与税务机关的业务往来、股东个人所得税以及非税收语境的无关提问后,确实涉及该企业自身税收事项的提问条数;依该文的口径,询问任一税种或税收政策对该企业税负、成本与经营之影响的提问同样计入
- TaxAtt [中小投资者税收关注] — 参考范润等(2025, 中南财经政法大学学报)的方法,计算公式为:ln(1+当年该企业税收相关提问数)。用作研究变量,越大代表中小投资者对该企业税收状况的关注程度越高
- TaxAttRatio [中小投资者税收关注(占比口径)] — 参考范润等(2025, 中南财经政法大学学报)稳健性检验的替换指标,计算公式为:当年该企业税收相关提问数/投资者提问总数,当年没有任何提问时该比值无定义、记为缺失。用作研究变量,越大代表投资者提问中分配给税收议题的份额越高
常见问题
- 「中小投资者税收关注」是什么数据集?
- 中小投资者税收关注,隶属信息环境。参考范润等(2025, 中南财经政法大学学报)的方法,以中小投资者在深圳证券交易所互动易与上海证券交易所上证e互动两个网络互动平台上向上市公司提出的涉税提问,刻
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:投资者提问总数、税收关键词命中提问数、税收相关提问数、中小投资者税收关注、中小投资者税收关注(占比口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 55,622 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的税收安排既关系到现金支出与股东回报,也牵涉税务稽查风险与管理层的机会主义空间,因而长期是中小股东关心的核心问题之一。深圳证券交易所"互动易"与上海证券交易所"上证e互动"两个网络互动平台的出现,使中小投资者得以就其关心的问题直接向上市公司发问,并促使公司作出针对性答复。投资者在这两个平台上提出的涉税问题,因此可以直接观测中小投资者对特定公司税收状况的关注程度。本数据集参考范润等(2025)的做法,以企业-年度为单位刻画这一关注度。 测度分两步完成。第一步是候选提问的召回。参考文献通过浏览投资者提问文本设定了一组与税收相关的关键词,具体包括税务、税负、税款、税费、所得税、欠税、纳税、税率、避税、逃税、抵免、抵扣、减免、补税和补缴。本数据集严格采用该组关键词,对两个平台上全部投资者提问的正文做子串匹配,凡命中其中任意一词的提问即进入候选集合。 第二步是候选提问的甄别。关键词召回不可避免地会纳入与公司自身税收无关的提问:公司与税务机关之间的业务往来(例如中标税务系统的采购项目)、股东个人层面的分红所得税归属,以及"减免""抵扣""补缴"等词出现在租金、票券、社保等非税收语境之中,都会命中上述关键词。参考文献对召回结果逐条人工筛选,剔除了这一类提问。本数据集沿用同一判定标准,对每条候选提问逐条判断其是否确实涉及该公司自身的税收事项,仅保留通过判定的提问。需要说明的是,参考文献明确将投资者对增值税等其他税种的提问一并纳入关注范围,理由是间接税的变动会对企业所得税产生外溢作用;因此,询问任一税种或税收政策对该公司税负、成本与经营之影响的提问同样计入,被剔除的只是与该公司纳税确无关联的那一类。 设 $n{i,t}$ 为企业 $i$ 在第 $t$ 年经上述两步识别出的税收相关提问条数,中小投资者税收关注的主口径指标为 $$TaxAtt{i,t}=\ln\left(1+n{i,t}\right)$$ 取对数是为压缩提问条数的右偏分布,加一则使当年没有涉税提问的企业年份取值为零,从而与有提问的企业年份落在同一条连续变量上。 参考文献另给出一个替换口径,以涉税提问在全部提问中所占的比重衡量关注的相对强度: $$TaxAttRatio{i,t}=\frac{n{i,t}}{N{i,t}}$$ 其中 $N{i,t}$ 为企业 $i$ 在第 $t$ 年收到的投资者提问总条数。与取对数的计数口径相比,该比值剔除了公司整体受关注程度的影响,反映的是投资者把注意力分配到税收议题上的份额;当企业当年没有收到任何提问时该比值无定义,记为缺失。数据集同时给出提问总数、关键词召回条数与甄别后条数三个中间计数,便于使用者核验分子与分母,并对比甄别前后的口径差异。 补充说明 - 样本口径:数据集覆盖两个平台开通以来的全部A股企业-年度,未预先施加参考文献在回归中所用的剔除金融业、剔除ST公司、剔除利润总额非正、剔除实际所得税率越界等限制,也未做缩尾处理,使用者可按各自的研究设计自行施加。 - 关键词范围:参考文献在列举上述关键词后附有"等"字,未公开完整词表。本数据集只采用其明确列出的词,未自行增补。因此,仅提及其他税种名称而未同时出现上述关键词的提问不会进入候选集合,涉税提问的召回范围较参考文献可能偏窄,影响方向是计数与对数指标系统性偏低。 - 甄别环节的实现:参考文献的逐条筛选由人工完成,本数据集改由语言模型按同一标准逐条判定,判定标准直接取自参考文献列举的剔除情形。个案判断与人工判读会有出入,但保留了这一环节,使关键词召回的假阳性不会直接进入指标。 - 零值的两重含义:当年平台上没有该企业的任何提问记录时,本指标同样取零,与"有提问但其中没有涉税提问"在数值上不可区分。需要区分二者时,可用提问总数大于零来筛选样本。 - 计数类关注度的固有性质:涉税提问条数随企业当年提问总量上升,这是计数型关注度指标的构造特征。建议在回归中一并控制提问总数的对数,或改用占比口径。 - 甄别环节的技术处理:送入判定前,提问正文截断至前1500个字符,绝大多数提问远短于此长度,且主题通常在开头即可判定;个别提问若未能返回可解析的判定结果,则回退为保留,即退化到关键词召回口径,以免把服务波动固化成"非涉税"。 - 其他局限:两个平台的开通时点不同,两个市场的样本起点因而不同,且平台运行初期的提问量明显偏低;提问时间缺失的记录无法归入年度,不计入任何企业-年;提问明细中以B股代码登记的涉税提问不计入对应A股主体,因为提问总数同样只按A股代码统计,并入会造成分子与分母口径不一致。 参考文献 - 范润,甦叶,孙雪娇.中小投资者税收关注能否影响企业极端避税——来自网络互动平台的证据[J].中南财经政法大学学报,2025,(6):63-75. - 潘红波,杨海霞.利益相关者"创新关注"促进了企业创新吗——来自深交所"互动易"的证据[J].南开管理评论,2022,(3):85-96.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。