企业包容性创新(BERT微调分类)

「企业包容性创新(BERT微调分类)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 69,680。 基于大语言模型的企业包容性创新测度。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数16
样本量69,680
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年度报告所属会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年度报告中管理层讨论与分析章节(0=否,1=是)。该章节是识别企业包容性创新语句的文本范围;定位失败时文本范围会退化为年报全文,与章节口径不可比,故此类企业年的语句数量与包容性创新各指标均记为缺失值。
  • NSentTotal [参与分类的语句总数] — 参考梁宇奇等 (2024, 科学决策)的方法,计算公式为:年度报告管理层讨论与分析章节中字符长度不小于30个字符的语句数量。该章节文本先删除空格与换行符,再以句号、分号、感叹号切分为语句。
  • InclusiveSentCount [包容性创新语句数量] — 参考梁宇奇等 (2024, 科学决策)的方法,计算公式为:年度报告管理层讨论与分析章节中被微调后的BERT模型判定为体现企业包容性创新行为的语句数量。企业包容性创新指企业为满足金字塔底层群体的基本物质文化生活需要、帮助其提升经济收入和发展能力、实现自身造血式发展所开发的产品或服务、构建的商业模式。
  • IsInclusiveInnovation [是否具备包容性创新行为] — 参考梁宇奇等 (2024, 科学决策)的方法,是否具备包容性创新行为(0=否,1=是),计算公式为:年度报告中存在被识别为包容性创新行为的语句则取1,否则取0。用作研究变量,取1代表该企业当年披露了面向金字塔底层群体的包容性创新行为。
  • LnInclusiveInnovation [企业包容性创新关注度] — 参考梁宇奇等 (2024, 科学决策)的方法,计算公式为:ln(包容性创新语句数量+1)。对语句数量加1取自然对数,反映企业对包容性创新的关注程度。用作研究变量,越大代表企业对包容性创新的关注度越高。

常见问题

「企业包容性创新(BERT微调分类)」是什么数据集?
企业包容性创新(BERT微调分类),隶属创新与知识产权。基于大语言模型的企业包容性创新测度。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 16 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、参与分类的语句总数、包容性创新语句数量、是否具备包容性创新行为、企业包容性创新关注度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,680 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业包容性创新是面向金字塔底层(bottom of the pyramid,BoP)市场展开的一种创新形态。BoP 群体长期被排斥在正规市场之外,其典型特征是贫困与低收入,主要分布于农村地区、山区与贫困地区。企业包容性创新指企业为满足 BoP 群体的基本物质文化生活需要,帮助 BoP 群体提升经济收入和发展能力、实现自身造血式发展,所开发的产品与服务或构建的商业模式。与面向中高端市场的传统创新不同,包容性创新在创造经济价值的同时创造社会价值,因而无法用专利数量、研发投入等传统创新产出指标衡量。既有研究多依赖问卷量表或人工阅读报告文本,前者受调研范围与被调查对象主观判断的限制,后者效率较低且依赖阅读者的主观判断。本数据集参考梁宇奇等(2024)的做法,借助 BERT 预训练语言模型对年度报告文本逐句判别,构建客观且可大规模复算的企业包容性创新指标。 测度的文本范围是年度报告中"管理层讨论与分析"及其同义标题(董事会报告、经营情况讨论与分析等)所辖章节,该章节集中披露企业当期的经营举措与业务进展。章节文本在删除空格与换行符后,以句号、分号和感叹号切分为语句。 识别流程分为语料构建与全文分类两个阶段。语料构建阶段的作用是缩小人工判读范围,而非限定最终的统计口径。首先围绕包容性创新的概念内涵设定一套关键词词典,共二十个词语,分属三个维度:其一定位 BoP 群体自身及其特征与聚集地区,其二定位企业满足 BoP 群体生存需求的信息,涵盖面向 BoP 群体的帮扶行为与就业保障,其三定位企业满足 BoP 群体发展需求的信息,涵盖企业进入 BoP 地区的合作形式、面向 BoP 群体的质优价廉产品与普惠性服务、以及带动 BoP 群体脱贫增收的创新成果。词典的构建经过抽样验证,选取标准与抽样语句含义大规模不符的词语不予纳入。含有词典词语的语句构成初始语句库,其中字符长度不足三十个字符者因不足以表达完整的包容性创新行为而剔除,字符长度超过两百七十个字符者因引入过多无关词向量、会削弱模型对短文本的判别能力而剔除,重复语句以及同一企业在不同年份间高度相似的语句一并剔除,相似性以字符 8-gram 集合的 Jaccard 系数超过 0.8 为准。页眉、页码等噪声文本与可读性较差的语句,以中文字符占比不低于 0.6 的门槛剔除;原文对这两项采取人工去除,此处改为规则化门槛以保证可复算。描述国家政策背景、行业发展趋势与政府行为等与企业及其产品服务无关的语句同样剔除,此举旨在排除仅因词语含义较广而被捕获、实则不反映企业行为的文本。清洗后的语句逐条标注是否体现企业包容性创新行为,构成模型训练语料。 模型微调阶段以 bert-base-chinese 为基座,将语料按 8:1:1 的比例随机划分为训练集、验证集与测试集,迭代次数设为 5,批大小设为 64,学习率设为 $5\times10^{-5}$,其余参数保持默认。以具备包容性创新行为的类别为正类,用精确度、召回率、准确率与 F1 值评估各迭代阶段模型在测试集上的分类性能,并考虑到精确度的重要性、结合各阶段模型的 F1 值选取最终模型。 全文分类阶段加载选定模型,对文本范围内每一条字符长度不小于三十个字符的语句判别其是否体现企业包容性创新行为。此阶段不再施加关键词过滤——关键词词典的作用仅在于缩小标注范围,若在此阶段沿用词典筛选,将遗漏未包含词典词语但确实体现包容性创新行为的语句。 记企业 $i$ 在第 $t$ 年被判别为体现包容性创新行为的语句数量为 $N{it}$,据此构建两个指标。其一为企业包容性创新的哑变量,反映企业是否具备包容性创新行为: $$II{it}=\begin{cases}1, & N{it}\geq 1\\[2pt] 0, & N{it}=0\end{cases}$$ 其二为企业包容性创新的连续变量,反映企业对包容性创新的关注度。考虑到语句数量只能反映企业在年度报告中对包容性创新的关注程度,并不能真实反映企业开发包容性创新产品服务或商业模式的种类,故对语句数量加一取自然对数: $$LnII{it}=\ln\left(N{it}+1\right)$$ 数据集同时给出参与分类的语句总数与被判别为包容性创新行为的语句数量,前者为文本范围的规模,后者即 $N{it}$,两者可用于自建其他形式的标准化指标。 补充说明 - 样本口径:覆盖语料库可得的全部上市公司年度报告,不预先施加行业或年份筛选。金融业不予剔除,原文的有效性检验表明金融业企业通过向 BoP 群体提供普惠金融服务而具有较高的包容性创新水平,剔除会损失构念内容。原文的样本区间为 2013 至 2022 年,使用时建议结合研究窗口自行取舍,并加入行业与年份固定效应。 - 标注环节:原文由经过培训的研究人员标注语料并由领域专家仲裁分歧,本数据集改以大语言模型依据固定的判定准则完成同一环节。判定准则依原文对包容性创新的界定及其关键词词典的三个维度内涵撰写。相较人工标注,模型标注在同一准则下的一致性更高,但语义边界由模型给定。 - 分类性能的适用范围:模型的测试集性能是在"经关键词筛选后的语句"这一分布上测得,而全文分类阶段面向全部语句。在不含词典词语的语句上,模型的精确率明显低于测试集水平,典型的误判是含数量表述的一般业务陈述。相应地,连续变量作被解释变量时该噪声主要表现为衰减偏误,而哑变量因误判方向不对称,用作 Probit 或双重差分的被解释变量时建议先做稳健性核查。 - 章节定位与早年语料:年报章节标题格式历年存在变迁,个别年度报告无法定位到目标章节,此类企业年的语句数量与两个指标均记为缺失并以标志字段标示。此外,早期年报文本由版式文件转换而来,句末标点稀疏,切句后可能退化为极少数超长语句,使语句总数异常偏低、指标取零。这类零值反映的是切句失败而非企业确无相关披露,建议以语句总数设下限过滤,或将样本起始年设在年报电子披露规范化之后。 - 披露口径的时间与板块差异:年报格式准则曾于 2015 年与 2021 年修订,管理层讨论与分析章节所辖内容随之调整,同一企业前后年份的语句总数因而出现跳变。剔除篇幅效应后,包容性创新表述的密度在近年趋于平稳,说明比例指标的时序变化中含有章节范围变动的成分,跨这些年份比较水平值时应加年份固定效应。板块方面,北京证券交易所与新三板的年报模板将乡村振兴与社会责任履行情况设为管理层讨论与分析章节内部的小节,而沪深主板置于独立章节因而不在本文本范围内,两类板块的取值水平不可直接比较,建议加交易所固定效应或分别处理。 - 计数型文本指标的性质:两个指标均由语句计数导出,年度报告篇幅较长的企业倾向于获得更高的取值,连续变量尤其如此,金融业因章节篇幅与业务量表述较多而更为明显。使用时建议控制年报文本长度或企业规模,数据集提供的语句总数字段可直接用于该项控制。另需说明,训练语料设有语句长度上限而全文分类阶段不设,超过该上限的长语句多为表格与清单,模型对其鲜有判正。 - 其他局限:关键词词典依包容性创新的概念内涵人为设定,可能遗漏其他体现包容性创新行为的表述;模型选取的工作点与原文不同,连续变量的水平值不宜与原文报告的描述统计直接对照,比例指标则复现良好;指标反映的是企业在年度报告中披露的包容性创新行为,披露意愿本身可能与企业特征相关。 参考文献 - 梁宇奇,赵云辉,付星星,等.企业包容性创新的测度:基于大语言模型的新方法[J].科学决策,2024,(12):86-99. - 金星晔,左从江,方明月,等.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,(3):34-53. - 邢小强,周平录,张竹,等.数字技术、BOP商业模式创新与包容性市场构建[J].管理世界,2019,(12):116-136. - Chen M A, Wu Q, Yang B. How valuable is FinTech innovation?[J]. The Review of Financial Studies, 2019, 32(5): 2062-2106.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。