中小投资者研发关注(Qwen标注+BERT分类)
「中小投资者研发关注(Qwen标注+BERT分类)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 55,622。 参考孙畅(2025,无锡商业职业技术学院学报)的方法,度量中小投资者通过交易所网络互动平台表达的对企业研发活动的关注。
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 20 |
| 样本量 | 55,622 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 投资者提问发生的自然年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- QuestionTotal [投资者提问总数] — 当年中小投资者在深圳证券交易所互动易平台与上海证券交易所上证e互动平台向该企业提出的提问总条数,用作研发关注相对值口径的分母。该值为0表示当年互动平台上没有该企业的任何提问记录。
- RDQuestionCount [研发相关提问数] — 参考孙畅(2025,无锡商业职业技术学院学报)的方法,由大语言模型标注语料微调所得的文本分类模型对投资者提问逐条判定其是否与企业研发活动有关,本字段为当年被判定为研发相关的提问条数。研发的口径取技术创新活动的广义界定,涵盖研究开发、技术、科技、创新、发明、专利、工艺、科研以及人工智能等具体技术领域。
- RDAtt [中小投资者研发关注(绝对值)] — 参考孙畅(2025,无锡商业职业技术学院学报)的方法,计算公式为:当年研发相关提问数量加1后取自然对数。用作研究变量,越大代表中小投资者对该企业研发活动的关注程度越高。
- RDRatio [中小投资者研发关注(相对值)] — 参考孙畅(2025,无锡商业职业技术学院学报)的方法,计算公式为:当年研发相关提问数量除以当年提问总数量。当年提问总数为0时该比重无定义,取空值。用作研究变量,越大代表中小投资者的关注中指向研发活动的比重越高。
- RDQuestionCountW [研发相关提问数(词集法)] — 参考孙畅(2025,无锡商业职业技术学院学报)稳健性检验所采用的词集法口径,对提问文本作中文分词后按研发词库匹配词元,词库包括研发、RD、技术、创新、科技、开发、发明、专利、工艺、科研、科学、人工智能,本字段为当年命中该词库的提问条数。
- RDAttW [中小投资者研发关注(词集法绝对值)] — 参考孙畅(2025,无锡商业职业技术学院学报)稳健性检验的方法,计算公式为:当年由词集法识别的研发相关提问数量加1后取自然对数。用作研究变量,是绝对值口径研发关注的替代度量,越大代表中小投资者对该企业研发活动的关注程度越高。
- RDRatioW [中小投资者研发关注(词集法相对值)] — 参考孙畅(2025,无锡商业职业技术学院学报)稳健性检验的方法,计算公式为:当年由词集法识别的研发相关提问数量除以当年提问总数量。当年提问总数为0时该比重无定义,取空值。用作研究变量,是相对值口径研发关注的替代度量。
- QSum [研发提问文本长度] — 参考孙畅(2025,无锡商业职业技术学院学报)的方法,计算公式为:当年全部研发相关提问的文本总字数加1后取自然对数。用作研究变量,越大代表中小投资者就企业研发活动提出的问题越详尽。
- ASum [研发回答文本长度] — 参考孙畅(2025,无锡商业职业技术学院学报)的方法,计算公式为:当年全部研发相关提问所获企业回复的文本总字数加1后取自然对数,未获回复的提问计0字。用作研究变量,越大代表企业对研发相关提问的回复越详尽。
常见问题
- 「中小投资者研发关注(Qwen标注+BERT分类)」是什么数据集?
- 中小投资者研发关注(Qwen标注+BERT分类),隶属信息环境。参考孙畅(2025,无锡商业职业技术学院学报)的方法,度量中小投资者通过交易所网络互动平台表达的对企业研发活动的关注。
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 20 个变量。核心指标包括:投资者提问总数、研发相关提问数、中小投资者研发关注(绝对值)、中小投资者研发关注(相对值)、研发相关提问数(词集法)、中小投资者研发关注(词集法绝对值)、中小投资者研发关注(词集法相对值)、研发提问文本长度、研发回答文本长度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 55,622 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在传统公司治理实践中,中小投资者因持股分散、信息劣势与行权成本高昂,往往表现出"搭便车"或"用脚投票"的倾向。交易所设立的网络互动平台改变了这一格局:它由证券交易所官方运营,投资者可以直接向上市公司提问并要求答复,公司则负有回应义务。相较于股吧、雪球等第三方社交平台,交易所互动平台的提问同时被交易所与市场公众观测,因而兼具舆论压力与监管压力两种传导渠道,为中小投资者参与公司治理提供了实质性的行权通道。 研发活动决定企业未来的可持续性与市场竞争力,也因其信息不对称程度高、专业性强而成为管理层机会主义行为的高发领域。当中小投资者在互动平台上密集追问企业的研发投入、技术路线与创新成果时,这种指向性的关注会引起交易所对该公司研发信息披露的重点关注,也会经由社交媒体放大为声誉压力,从而压缩管理层在研发投入上进行操纵与寻租的空间。本数据集据此把"中小投资者对企业研发活动的关注程度"操作化为一个企业—年度层面的可观测变量。 度量的起点是把互动平台上的每一条投资者提问判别为"与研发有关"或"与研发无关"。以关键词计数直接完成这一判别存在明显缺陷:关键词只能捕捉字面共现,无法准确刻画提问所关注的实际内容。因此本数据集采用语义判别的两阶段实现。第一阶段,由大语言模型充当标注者,对从全库中无偏随机抽取的提问逐条给出"该问题是否有关研发"的判断,据此构造"研发关注"文本数据集。此处的"研发"取企业技术创新活动的广义口径,涵盖研究开发、技术、科技、创新、发明、专利、工艺、科研以及人工智能等具体技术领域;凡提问指向本企业在这些方面的活动、能力、投入、成果或规划者均计入,而仅涉及订单产能价格等纯经营信息、股价题材等资本市场事项,或所问对象为政府、行业与同行企业者则不计入。第二阶段,用上述标注语料微调一个中文文本二分类模型,再由该模型对平台上的全部投资者提问逐条推理,将其划分为研发相关问题与其他问题。全量推理阶段不施加任何关键词过滤或长度过滤,仅排除文本缺失这类无法判别的记录。 记企业 $i$ 在第 $t$ 年获得的投资者提问总数为 $Q{i,t}$,其中被判定为研发相关者的条数为 $RDQ{i,t}$,则两个核心指标分别为绝对值口径与相对值口径: $$RDAtt{i,t}=\ln\left(1+RDQ{i,t}\right),\qquad RDRatio{i,t}=\frac{RDQ{i,t}}{Q{i,t}}$$ 绝对值口径 $RDAtt$ 以研发相关提问的数量加一后取自然对数衡量关注的规模,取值越大表明投资者就该企业研发活动发起的问询越多;相对值口径 $RDRatio$ 以研发相关提问占提问总数的比重衡量关注的结构,取值越大表明投资者对该企业的整体关注中指向研发活动的份额越高。当企业当年在平台上没有任何提问记录时,该比重在数学上无定义,取空值处理。两个口径互为补充:前者刻画绝对强度但会随平台上的总体关注度同向变动,后者已对总体关注度作了归一。 为便于稳健性检验,数据集同时提供词集法口径。该口径先构建研发词库,具体包括"研发""RD""技术""创新""科技""开发""发明""专利""工艺""科研""科学""人工智能",再借助中文分词技术对提问文本分词,凡词元命中词库者即归入研发相关问题,其余归入其他问题;随后按与主口径完全相同的方式构造 $RDAttW$ 与 $RDRatioW$ 两个替代变量。 除关注的数量与结构外,问答文本的详尽程度本身也承载信息:投资者就研发活动提出的问题越具体、企业的答复越充分,双方在研发议题上的信息交换就越深入。为此,筛选出全部研发相关的提问及其所获答复,分别累加提问文本与答复文本的字数,加一后取自然对数,得到提问文本长度与答复文本长度两个变量: $$QSum{i,t}=\ln\left(1+\sum{k\in RD{i,t}}L^{Q}{k}\right),\qquad ASum{i,t}=\ln\left(1+\sum{k\in RD{i,t}}L^{A}{k}\right)$$ 其中 $RD{i,t}$ 为企业 $i$ 在第 $t$ 年的研发相关提问集合,$L^{Q}{k}$ 与 $L^{A}{k}$ 分别为第 $k$ 条提问及其答复的文本字数,未获答复的提问其答复字数计为零。数据集另保留提问总数与两种口径下的研发相关提问条数作为中间量,供使用者自行构造其他形式的度量或用作控制变量。 补充说明 - 样本口径:覆盖全部 A 股企业—年度,不预先剔除金融业、不剔除特别处理公司、不剔除上市不足一年或营业收入低于特定门槛的公司,亦不作缩尾处理。这些均属回归样本限制,交由使用者按其研究设计施加;原始文献在构建回归样本时作了上述处理,故本数据集的描述统计不与其直接可比。 - 识别环节的实现差异:原始文献以其可及的大语言模型完成标注、并对生成式模型作微调后承担全量推理;本数据集的标注由本地部署的大语言模型完成,承担全量推理的则是用同一批标注语料微调的中文文本分类模型。两阶段架构、判定问句与两个度量公式均与原始文献一致,差异在于承担各阶段的具体模型,因此逐条判定结果不可能与原始文献完全重合。分类器在留出测试集上的召回率高于精确率,意味着其识别出的研发相关提问数相对真实值略微偏高。 - 两个口径的选用:绝对值口径与企业当年提问总数的相关程度较高,其变异有相当部分来自该公司在平台上受到的总体关注;相对值口径已对总体关注度归一,与提问总数基本无关。使用绝对值口径时建议同时控制提问总数的对数,或改用相对值口径作稳健性检验。当年提问总数很少时相对值口径的取值不稳定,建议设置最低提问数门槛。 - 跨年可比性:研发相关提问的占比在样本期内呈上升趋势,这一趋势在完全独立于分类器的标注样本中同样出现,反映的是投资者议题结构的真实变迁而非度量偏差。使用本指标应加入年份固定效应,不宜作跨年度的水平比较。 - 词集法口径的性质:词库由原始文献给出且以"等"字收尾,未完整公布,本数据集只使用其逐字列出的词条而不作扩充。按词元匹配会使被分词器并入更长复合词的词库词不予命中,同时也正确排除了跨词边界的假匹配。该词库成型较早,对近年出现的新技术词汇覆盖有限,因此词集法口径在样本期后段较主口径系统性偏低,宜作对照而非替代。 - 平台覆盖与源档案:两个交易所的互动平台上线时间不同,先行上线一方之外的公司在早期年份没有平台记录,其提问总数为零;此类企业—年反映的是平台未覆盖,可按提问总数是否为零识别并剔除。此外上游档案在最近年度可能尚未收录完整,表现为个别平台连续数月的提问量显著低于相邻月份,会同时压低该年度的提问总数与研发相关提问数且在两个交易所之间不对称;本数据集不对此作任何插补,使用最新年度数据前建议先核对提问总数按平台与月份的分布。 - 其他局限:问答文本长度两个变量依定义随研发相关提问条数增长,其相对关注度指标的独立信息在于篇均长度,使用时宜同时控制关注度指标;平台上确有提问记录但落在企业上市之前或退市之后的年度不予输出,以保证行集合与既有的投资者问答年度统计一致。 参考文献 - 孙畅.中小投资者“研发关注”与企业研发操纵行为——来自交易所互动平台的证据[J].无锡商业职业技术学院学报,2025,25(1):48-60. - 潘红波,杨海霞.利益相关者“创新关注”促进了企业创新吗——来自深交所“互动易”的证据[J].南开管理评论,2022,25(3):85-96.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。