中小投资者绿色创新关注(BERT模型测度)
「中小投资者绿色创新关注(BERT模型测度)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 55,622。 参考赵莉与胡涛(2026,科学学与科学技术管理)的方法,用微调后的中文BERT语言模型逐条判别深圳证券交易所互动易平台与上海证券交易所上证e互动平台上的中小投资
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 14 |
| 样本量 | 55,622 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年份,取投资者提问时间所属的自然年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- QuestionTotal [投资者提问总数] — 当年中小投资者通过深圳证券交易所互动易平台与上海证券交易所上证e互动平台向该公司提出的提问总条数,两个平台合并计数。为绿色创新提问数量提供基数参照,取值为0表示当年该公司在互动平台无提问记录
- GreenInnovQuestionCount [绿色创新提问数] — 参考赵莉与胡涛(2026,科学学与科学技术管理)的方法,当年被BERT语言模型分类器判定为与绿色创新相关的投资者提问条数。分类器将提问文本经BERT编码为语义向量后,由线性分类层计算类别得分并经softmax函数归一化为概率,取概率较大的类别作为判别结果;判定要求提问同时指向环境议题与技术、产品、工艺或管理的革新。全部提问逐条分类,不施加关键词筛选
- LogGreenInnovQuestion [中小投资者绿色创新关注] — 参考赵莉与胡涛(2026,科学学与科学技术管理)的方法,计算公式为:ln(1+当年绿色创新提问数量)。用作研究变量,越大代表中小投资者对该企业绿色创新的关注度越高,企业面临的绿色创新舆论压力与治理诉求越强
常见问题
- 「中小投资者绿色创新关注(BERT模型测度)」是什么数据集?
- 中小投资者绿色创新关注(BERT模型测度),隶属信息环境。参考赵莉与胡涛(2026,科学学与科学技术管理)的方法,用微调后的中文BERT语言模型逐条判别深圳证券交易所互动易平台与上海证券交易所上证e互动平台上的中小投资
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 14 个变量。核心指标包括:投资者提问总数、绿色创新提问数、中小投资者绿色创新关注。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 55,622 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在生态文明建设与"双碳"目标背景下,重污染企业的绿色转型是实现经济高质量发展的关键,而绿色创新被视为由内生创新驱动绿色转型的核心路径。与并购既有环保技术的外延式做法不同,绿色创新强调企业通过技术研发、产品优化和管理改进来减少资源负荷与环境负面影响、提升资源效率,从而同时获得环境收益与经济收益。然而绿色创新具有成本高、周期长、失败风险大的特点,企业主动实施的动力往往不足,因此外部利益相关者的监督与压力就成为推动企业绿色创新的重要力量。 深圳证券交易所"互动易"与上海证券交易所"上证e互动"平台的推出,使中小投资者得以随时随地直接向上市公司管理层提问、查阅其他投资者的提问与公司答复。凭借低成本与快速传播的优势,这类平台为中小投资者提供了发表意见、形成网络舆论的空间,使其从被动的信息接收者转变为主动的信息搜寻者与公司治理参与者。当中小投资者在平台上密集询问企业的绿色技术进展、绿色产品规划或提出绿色转型建议时,既向管理层传递了诉求、缓解了双方在环境绩效方面的信息不对称,也形成了声誉压力并有助于缓解融资约束,进而推动企业实施绿色创新。本指标即刻画这一"绿色创新关注"的强度。 测度的核心难点在于识别哪些提问真正指向绿色创新。以往研究多采用词频法,通过与创新或环保相关的关键词筛选提问,但这种做法无法有效处理一词多义与同义表达,也不能理解上下文语义——例如"生态"一词在"鸿蒙生态""安全生态"中与环境议题毫无关系,而询问电池能量密度、光伏电池片技术代际的提问虽未出现"绿色"字样,却是典型的绿色创新关注。为此,本指标采用基于 Transformer 架构的 BERT 预训练语言模型构建专用分类器。BERT 通过双向文本表示充分捕捉词汇的上下文信息,能够精准刻画词汇的复杂语义与句法关系,显著提升对文本深层含义的理解能力。 分类器的构建分为两步。第一步是构建标注语料:从投资者提问中抽取一批提问并逐条标注为"绿色创新类"与"非绿色创新类"。判定要求一条提问同时满足"绿色"与"创新"双重属性——既指向环境、生态、污染治理、节能降碳、清洁生产、循环经济或新能源等议题,又落在技术、产品、工艺、研发或管理模式的革新上。据此,询问或建议企业开展环保节能技术研发与专利布局、开发升级绿色产品并追问其技术路线与产业化进度、投资环保节能装备的研制与技术改造、在新能源与循环经济等领域进行技术布局、规划"双碳"目标下的低碳技术路径、开展绿色技术合作或绿色制造体系建设,均判为绿色创新类。反之,仅询问环保处罚与排放达标等合规事项、仅询问绿色业务的订单产能价格等纯经营信息、仅关心绿色概念带来的股价题材,以及词形相同但语境无关的表述,均判为非绿色创新类。 第二步是模型微调与全量分类。标注语料按 8:1:1 划分为训练集、验证集与测试集:训练集用于训练分类器参数,验证集用于提升模型性能,测试集用于评估模型在样本外的泛化能力与预测准确率。分类器在 BERT 之上接一个线性分类层与 softmax 函数:提问文本输入 BERT 后输出语义向量 $c$,线性分类层据此计算类别得分 $s=Wc+b$,再通过 softmax 将得分归一化为概率 $$p(k \mid c)=\frac{\exp(sk)}{\sumj \exp(sj)}$$ 取概率较大的类别作为判别结果,以此判断该条提问是否与绿色创新相关。模型训练完成后,对全部投资者提问逐条分类,不施加任何关键词预筛——这一点至关重要:关键词只用于缩小标注范围,若在全量分类阶段仍以关键词过滤,就会重新引入词频法的漏识别问题,使指标系统性偏低。 将判定为绿色创新类的提问按企业与年度汇总,得到企业 $i$ 在第 $t$ 年的绿色创新提问数量 $GreenQ{i,t}$,深交所与上交所两个平台合并计数。考虑到该计数右偏且存在零值,参考既有关于利益相关者"创新关注"的做法,对其加一后取自然对数得到核心指标 $$logquestion{i,t}=\ln\left(1+GreenQ{i,t}\right)$$ 取值越大,表明中小投资者对该企业绿色创新的关注度越高,企业面临的绿色创新舆论压力与治理诉求越强。本数据集同时给出中间量:$GreenQ{i,t}$ 即绿色创新提问数量,以及当年投资者提问总数,后者为关注度提供基数参照,便于使用者判断某一企业年的关注度是源于绿色议题的集中还是互动总量的放大。 补充说明 - 样本口径:本数据集覆盖全部 A 股上市公司的企业-年观测,不预先施加行业限定、金融业与 ST 类样本剔除或连续变量缩尾。原文针对重污染行业展开研究并作了上述处理,这些属于回归样本限制,交由使用者按研究设计自行施加。 - 标注与训练语料:原文由人工完成提问分类,本实现改由本地部署的生成式大语言模型按同一套判定规则完成标注,规则全文随代码落盘,标注一致性依赖于规则表述而非标注员训练。原文表述为随机抽取提问进行标注,但绿色创新提问在全部提问中占比很低,纯随机抽样的正类不足以训练二分类器,会使模型退化为全预测负类,故改用分层抽样:在关键词命中的提问中超额抽取以保证正类规模,同时保留一个全库无偏随机层用于估计真实先验并做无偏评估。该调整只影响训练样本构成,全量分类阶段的对象仍是全部提问。 - 模型与判别性能:原文仅说明使用 BERT 模型,未指定预训练权重,亦未披露微调超参数与模型选择准则。本实现采用通用中文 BERT 权重与常规微调配置;因训练语料经富集后正类占比高于全库真实比例,模型选择以无偏随机层的 F1 为准而非富集测试集整体,判别沿用原文取较大概率类别的做法。需要使用者知悉的是:无偏层上的查准率约五成、查全率约六成,且模型选择与性能报告用的是同一批留出样本,其中真实正例数量有限,因此报告的性能偏乐观、置信区间偏宽。误判数量近似正比于企业当年的提问总数,故计数中包含一个随互动活跃度同向变动的成分。建议在回归中同时控制提问总数的对数,并以绿色创新提问占提问总数的比率作为替代口径做稳健性检验。 - 判定口径的严格程度:原文未公布标注规则,仅表述为判断提问是否与绿色创新相关。本实现依原文对绿色创新的定义采用较严的判读,要求提问同时指向环境议题与技术、产品、工艺或管理的革新,仅询问环保合规处罚或仅询问绿色业务经营信息者不计入;若改用只要涉及环境议题即计入的宽松判读,纳入的提问会明显增多。原文的样本剔除细节亦未公布。受这两点共同影响,本指标在原文样本口径下的绝对水平低于原文报告的描述统计,而行业分布、时间趋势与企业间相对排序均与理论预期一致。需注意两种判读之间并非简单的水平平移而是阈值截断:较严的判读会抬高零值比例,使一部分企业在个体固定效应下不再贡献组内变异,因此回归系数亦可能随判读口径改变,不能简单地认为固定效应可吸收全部差异。 - 平台覆盖:输出补全了全部 A 股企业-年,当年无提问记录的企业-年两个计数列均取零,而这些零值中的绝大部分源于平台覆盖而非确无绿色创新关注:北京证券交易所的公司不在这两个平台的覆盖范围内,其提问总数恒为零;上海证券交易所的互动平台晚于深圳证券交易所推出,沪市公司在其上线之前的企业-年提问总数同样为零。此外两个平台的互动活跃度存在系统性落差,深市公司的年均提问总数明显高于沪市,尽管两市的绿色创新提问占比相近。反向地,平台上确有提问记录但落在企业-年骨架之外(上市当年之前或退市之后)的记录不予输出,占比很小。建议以提问总数大于零过滤掉平台未覆盖的企业-年;跨市或跨期比较时加入交易所与年份的交互固定效应,或改用比率口径。 - 其他局限:提问计数反映投资者的关注强度而非企业的实际绿色创新产出,两者是不同构念;同一投资者持续追问会整体计入,在关注度较高的企业年中单一账号可占相当比重,若研究关心的是投资者群体的广泛参与,宜另行按提问人数构造平行变量。互动平台的原始问答档案在最近一个年度可能尚未收录完整,会使该年度的提问总数与绿色创新提问数同时偏低,使用样本期最后一年前宜先核对提问总数的年度分布。本数据集不对缺口做任何插补,以保持提问计数的事实属性。 参考文献 - 赵莉,胡涛.中小投资者“绿色创新关注”与重污染企业绿色创新——来自BERT语言模型的证据[J].科学学与科学技术管理,2026,47(6):167-182. - 潘红波,杨海霞.利益相关者“创新关注”促进了企业创新吗——来自深交所“互动易”的证据[J].南开管理评论,2022,25(3):85-96.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。