投资者互动监督(Qwen大模型标注)
「投资者互动监督(Qwen大模型标注)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 56,478。 参考樊犇等(2026,审计与经济研究)的方法,以深交所"互动易"与上交所"e互动"平台的投资者提问帖为文本对象,先用监督类拓展词汇表做关键词粗筛,再用大语言模型
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 56,478 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 自然年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NPostTotal [投资者提问帖总数] — 当年该公司在深交所互动易与上证e互动平台上收到的投资者提问帖数量。该字段为监督性判定的总体范围,取值为0表示平台当年无该公司的任何提问记录,可据此区分平台未覆盖与有互动但无监督帖两种情形。本字段为原文未直接使用的补充字段,投资者互动监督指标的构造不依赖它;但因其与核心指标高度相关,建议在回归中将其对数一并作为控制变量。单位:条
- NCandidatePost [监督相关候选帖数] — 参考樊犇等(2026,审计与经济研究)的方法,计算公式为:当年该公司的投资者提问帖中,正文命中监督类拓展词汇表任一词条的帖子数量。拓展词汇表由30个监督类种子词经Word2vec按语义相似性扩展而成,共60个词条。该字段为两阶段测度中关键词粗筛环节的结果。单位:条
- NMonitoringPost [投资者监督帖数] — 参考樊犇等(2026,审计与经济研究)的方法,计算公式为:监督相关候选帖中,经大语言模型逐帖判定确认真正反映投资者对公司行使监督的帖子数量。判定环节以数据标注员的身份请模型就该帖有无反映投资者对公司行使监督作出二元判断。该字段为投资者互动监督指标的分子。单位:条
- InvestorInteractionMonitoring [投资者互动监督] — 参考樊犇等(2026,审计与经济研究)的方法,计算公式为:ln(1+当年投资者监督帖数)。先以监督类拓展词汇表对投资者互动平台的提问帖作关键词粗筛,再由大语言模型逐帖判定是否真正反映投资者监督,取加1对数以压缩计数的右偏分布。用作研究变量,越大代表企业当年受到的投资者互动监督越强。使用时须加入年份固定效应,并建议同时控制ln(1+投资者提问帖总数)
- InvestorInteractionMonitoringKW [投资者互动监督(关键词法)] — 参考樊犇等(2026,审计与经济研究)的方法,计算公式为:ln(1+当年监督相关候选帖数)。该口径对应两阶段测度中大语言模型精筛之前的中间结果,仅依据关键词匹配认定监督帖,可用于考察大语言模型精筛环节对研究结论的边际影响。用作稳健性检验变量,越大代表企业当年受到的投资者互动监督越强
常见问题
- 「投资者互动监督(Qwen大模型标注)」是什么数据集?
- 投资者互动监督(Qwen大模型标注),隶属信息环境。参考樊犇等(2026,审计与经济研究)的方法,以深交所"互动易"与上交所"e互动"平台的投资者提问帖为文本对象,先用监督类拓展词汇表做关键词粗筛,再用大语言模型
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:投资者提问帖总数、监督相关候选帖数、投资者监督帖数、投资者互动监督、投资者互动监督(关键词法)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 56,478 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 深圳证券交易所的"互动易"与上海证券交易所的"e互动"为中小投资者提供了直接向上市公司提问的渠道。投资者在这类平台上就财务真实性、信息披露、关联交易、股东权益等事项发问、质疑与要求澄清,构成一种低成本、高频率的外部监督:提问本身把疑点置于公开可见的位置,公司需要在平台上作出回应,由此形成对管理层机会主义行为的约束。樊犇等(2026)据此提出投资者互动监督指标,用企业当年在互动平台上收到的、真正体现投资者监督意图的发帖数量来刻画该企业所受外部监督的强度。本数据集复现该文的测度方法。 测度的文本对象是投资者在两个互动平台上发布的提问帖正文,按提问时间归入相应年度。平台上大量帖子属于业绩问询、产品咨询与情绪表达,与监督无关,直接对全部提问帖逐条判读并不现实。原文因此采用"关键词粗筛加大模型精筛"的两阶段设计。 第一阶段是构建监督相关词汇表并做关键词粗筛。先设定一组直接关联"监督"概念的核心种子词,覆盖公司治理、内部控制与股东权益三个方面,包括监督、监管机制、透明度、违法、违纪、控制、风险管理、合规性、审计、股东权利、治理结构、利益冲突、绩效评估、激励机制、法律诉讼、企业社会责任、可持续发展、利益相关者管理、内部控制、风险管理框架、公司治理评价、股权结构、信息披露、投资者关系管理、合规文化、外部审计、并购监管、反舞弊机制、企业估值与资本市场监管。再以 Word2vec 算法按语义相似性从种子词出发扩展,得到一份更为全面的拓展词汇表,新增的词条包括造假、财务造假、虚假、忽悠、坑害、内幕交易、利益输送、套现、圈钱、真实性、瞒报、隐瞒、澄清、辟谣、举报、投诉、质疑、问责、解释、回应、交代、真相、查账、督查、检查、调查、监管、问询、曝光与传闻。拓展词汇表共 60 个词条,其中"企业社会责任(CSR)"一条在本数据集中按中文全称与英文缩写两个词条分别参与匹配,因原文以括号形式给出缩写而未说明其是否独立入表,而帖子中确有直接写作 CSR 的情形。用该词表对全部提问帖做匹配,命中任一词条的帖子即为监督相关候选帖。原文在其样本上由此得到 350474 条候选帖。 第二阶段是大语言模型精筛。关键词匹配只能识别帖子是否含有监督类词汇,无法判断该帖是否真的表达了监督意图——含"调查"的帖子可能是在转述监管政策,含"解释"的帖子可能只是询问产品参数。原文因此把候选帖逐条送入大语言模型,以数据标注员的身份询问该帖是否反映了投资者对公司的监督,要求模型在深入语义分析后输出二进制判断结果,是则回复 1,否则返回 0。取值为 1 的帖子被认定为投资者监督帖。原文在其样本上由 350474 条候选帖判出 310572 条监督帖。 记企业 $i$ 在第 $t$ 年被判定为监督帖的发帖数量为 $N^{mon}{i,t}$,参照丁慧等(2018)处理互动平台发帖计数的做法,对其加 1 取对数得到投资者互动监督指标: $$Iig{i,t}=\ln\left(1+N^{mon}{i,t}\right)$$ 加 1 的处理使当年没有监督帖的企业年仍可取值为 0 而非缺失,取对数则用于压缩发帖数量的右偏分布。指标数值越大,表示该企业当年在互动平台上受到的投资者监督越强。 除核心指标外,本数据集一并给出计算链上的三个计数:当年提问帖总数 $N^{post}{i,t}$、关键词粗筛得到的候选帖数 $N^{cand}{i,t}$ 与大模型判定的监督帖数 $N^{mon}{i,t}$,以及仅使用关键词粗筛口径的对照指标: $$Iig^{KW}{i,t}=\ln\left(1+N^{cand}{i,t}\right)$$ 该对照口径对应两阶段设计中大模型精筛之前的中间结果,可用于考察精筛环节对研究结论的边际影响,也便于与未引入大模型的既有测度相互比较。 补充说明 - 样本口径:骨架为上市公司年度面板并上在互动平台出现过的企业年,年份取平台数据的可得区间,不预先剔除金融业与房地产业、不剔除 ST 与 PT、不做代码段筛选、不缩尾。原文构造回归样本时施加了上述限制并作 1% 双侧缩尾,其回归样本为 25996 个企业年、指标均值 1.6927。使用者可按各自研究设计自行筛选。 - 须剔除的结构性非覆盖行:三类主体不在平台覆盖范围内,三个计数恒为 0——上交所"e互动"晚于深交所"互动易"上线,沪市在其上线前的企业年全部为 0;北交所与新三板代码段、B 股代码段的主体绝大多数为 0。全部零帖企业年中约九成属于这三类,剔除后其余企业年的零帖率降至百分之一以内。按提问帖总数是否为 0 即可识别。同理,首次公开发行当年只有部分年度暴露,其指标水平明显低于上市次年及以后。 - 跨年水平不可比,须加年份固定效应:本指标是绝对计数的对数,年度均值在平台普及期见顶后持续走低,来源有二且均与企业实际受监督程度无关。其一,上市公司数量在样本期内翻倍而平台提问总量基本持平,单家公司分得的投资者注意力被摊薄——固定同一批公司的平衡面板上该下降同样存在。其二,词表老化:控制帖子长度后关键词命中率仍逐年走低,"解释"降约七成、"澄清"与"忽悠"降约九成,而业务词"控制"基本不变。跨年度水平比较、跨上市队列比较与平行趋势检验需格外谨慎。 - 建议同时控制投资者关注度:核心指标与当年提问帖总数的对数高度相关,与企业规模的相关则很弱,说明多数变异来自该公司平台上的总提问量。不控制提问帖总数的对数时,估计到的"投资者监督效应"可能实为"投资者关注度效应";本数据集已提供该字段。 - 测度精度的两个已知边界:原文词表含"控制""解释""回应""检查"等通用词,仅命中这类词的帖子约占监督帖三分之一,其中仅命中"控制"一词的即占约一成一,使产品名称天然含"控制器""控制系统"的制造与自动化行业被系统性抬高;同时核心指标与仅用关键词粗筛的对照口径相关系数在 0.98 以上,逐词看只有"传闻""曝光""控制"等少数词被实质过滤,大模型精筛主要起剔除少数明显无关帖子的作用。词表由原文逐字给出,本数据集忠实沿用不作增删;做行业异质性分析时建议以对照口径复核。 - 判定模型:原文使用 Qwen2.5-72B,本数据集受本地单卡显存限制改用同族的较小规模开源模型,询问语句逐字沿用原文,实测候选帖被判为监督帖的比例与原文报告值相差不足两个百分点;但边界帖子的判定取决于模型,与原文不可能逐帖一致。词表拓展环节未重跑 Word2vec,直接采用原文公布的最终词表,以免引入本实现自己的语料与超参。极少数帖子正文自带"请直接回答是或否"一类要求会带偏模型输出格式,对这类帖子在末次重试改用把正文以三引号定界的提示词变体,提问语句仍为原文逐字。 - 其他局限:骨架保留了 B 股与其他非沪深 A 股代码段主体,而原文样本为沪深 A 股;极少数提问帖缺时间戳或正文为空,无法归年或无内容可判定,已在计数前剔除;送入模型的正文受服务端上下文长度上限约束而设有字符上限,超出部分截断,实测触发的仅为个别超长帖;提问帖正文自平台运行早期之后被截断在 200 字符,经反事实检验不构成上述年度趋势的成因,但使早期与后期文本口径不完全可比;上游档案在最新年度可能存在按平台与月份分布不均的缺口,使用最新年度前建议先核对帖量分布,补入增量档案后重算即可修复;未命中词表的监督性帖子不会进入候选,该漏检来自原文的两阶段设计本身。 参考文献 - 樊犇,吴燕博,刘恒源.投资者互动监督与企业真实盈余管理——基于大语言模型的证据[J].审计与经济研究,2026(4):94-104. - 丁慧,吕长江,陈运佳.投资者信息能力:意见分歧与股价崩盘风险——来自社交媒体"上证e互动"的证据[J].管理世界,2018(9):161-171.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。