企业研发文本信息披露(21个研发关键词)

「企业研发文本信息披露(21个研发关键词)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 67,705。 参考李岩琼(2020,会计研究)的方法,基于上市公司年度报告全文文本,统计21个R&D类关键词(研发/创新/研究/开发/技术/专利/知识产权等)的词频占比,衡量

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数18
样本量67,705
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年报对应会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • RDKeywordCount [研发关键词词数] — 参考李岩琼(2020,会计研究)的方法,计算公式为:年报全文中21个R&D类关键词(研发/创新/研究/开发/研制/科研/技术/专利/工艺/知识产权/科技成果等)出现次数的总和,为研发文本信息披露指标的分子,用作机制中间变量。
  • RDKeywordChars [研发关键词总字数] — 参考李岩琼(2020,会计研究)借鉴Campbell et al.(2014)字数法,计算公式为:年报全文中R&D类关键词命中的字符总数(各关键词出现次数乘以该关键词字数后求和),为对数稳健口径的底数,用作中间变量。
  • TotalChars [年报全文总字数] — 计算公式为:年报全文非空白字符总数(中文/标点/数字/字母,剔除空格换行等排版字符),即李岩琼(2020,会计研究)研发文本信息披露指标分母'年报全文总字数',用作中间变量。
  • RDTextDisc [研发文本信息披露] — 参考李岩琼(2020,会计研究)的方法,计算公式为:年报全文中R&D类关键词词数/年报全文总字数乘以100。衡量企业研发文本信息披露程度,用作研究变量,越大代表年报披露的研发定性信息越多。
  • LnRDTextDisc [研发文本披露字数对数] — 参考李岩琼(2020,会计研究)稳健性检验(借鉴Campbell et al.2014)的方法,计算公式为:ln(年报全文R&D类关键词总字数+1)。以关键词披露字数对数衡量研发文本信息披露,规避全文语言冗余度影响,用作稳健性研究变量,越大代表研发文本披露越多。
  • RDForDisc [管理层讨论研发文本披露] — 参考李岩琼(2020,会计研究)稳健性检验的方法,计算公式为:年报'管理层讨论与分析'部分R&D类关键词词数/该部分总字数乘以100。衡量管理层讨论与分析章节内的研发文本披露强度,用作稳健性研究变量;无法可靠提取该章节时(主要为2000年及以前年报)取空值。
  • MDAExtracted [是否成功提取MD&A] — 是否成功从年报中提取到'管理层讨论与分析'章节(0=否,1=是),否时回退全文且RDForDisc取空值;用于标识RDForDisc有效性,2001年起各年提取率均在95%以上。

常见问题

「企业研发文本信息披露(21个研发关键词)」是什么数据集?
企业研发文本信息披露(21个研发关键词),隶属信息环境。参考李岩琼(2020,会计研究)的方法,基于上市公司年度报告全文文本,统计21个R&D类关键词(研发/创新/研究/开发/技术/专利/知识产权等)的词频占比,衡量
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:研发关键词词数、研发关键词总字数、年报全文总字数、研发文本信息披露、研发文本披露字数对数、管理层讨论研发文本披露、是否成功提取MD&A。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,705 条观测。
数据是如何测算/获取的?
指标定义与计算方法 研发活动具有高度的公司特质性、结果不确定性以及较强的信息不对称,财务报表中的研发支出等定量信息往往难以完整反映企业研发活动的真实进展与价值。年度报告中的研发文本(定性)信息因而成为定量信息的重要补充,其披露的详略与信息含量蕴含着企业的披露策略。研发文本信息披露(RDTextDisc)借助文本分析技术,从上市公司年度报告全文中提取研发相关关键词的披露强度,刻画企业对外披露研发定性信息的丰富程度。 核心变量以年报全文中研发(R&D)类关键词的词频占比衡量。设企业某年度报告全文中各R&D类关键词出现的总次数为 $N{RD}$、年报全文总字数为 $L$,则研发文本信息披露的主口径为 $$RDTextDisc = \frac{N{RD}}{L}\times 100$$ 其中关键词集合涵盖研发活动各维度的代表性词汇,包括"研发""创新""研究""开发""研制""科研""预研""设计""创造""实验""试验""技术""专利""工艺""新项目""新产品""新业务""知识产权""科技成果""科技投入"以及英文缩写"R&D",共二十一个。关键词的选取一方面依据已有研发主题词汇与主题分类研究找到的中文对应词汇,另一方面通过人工阅读年报样本提取得到。分母 $L$ 取年报全文的非空白字符数(中文、标点、数字与字母,剔除空格、换行等排版字符)。该比率越大,表明企业在年报中披露的研发定性信息相对越多。其中分子 $N{RD}$ 与分母 $L$ 作为构件变量一并保留,便于机制分析。 为规避全文语言冗余度对占比指标的影响,进一步以关键词披露的字数(而非占比)衡量披露规模。设R&D类关键词命中的字符总数为 $C{RD}$(各关键词出现次数与其字数的乘积之和),则字数对数口径为 $LnRDTextDisc=\ln(C{RD}+1)$,作为稳健性度量。 考虑到研发文本信息在年报不同章节的分布,另以"管理层讨论与分析"章节内的关键词占比 $RDForDisc$ 作为章节口径,其计算方式与主口径一致,但分子与分母均限于该章节范围。当年报无法可靠识别出该章节时,该口径取空值,并由是否成功提取标志(MDAExtracted, 0=否,1=是)标识其有效性。 补充说明 关键词匹配在年报全文上以多模式字符串匹配算法一次扫描完成,英文缩写统一小写处理。由于上述关键词之间不存在子串包含关系,各关键词出现次数直接求和,不作最长匹配去重,忠实于"各关键词词频累加"的口径。 为保证测度可靠性,对样本作如下处理:剔除中文字符过少的乱码或残缺文件,并对个别因双重编码而产生的早期年报乱码进行编码修复;按报告完整性设置最小篇幅阈值,剔除仅披露"年度报告摘要"或文本明显截断的观测,以避免占比指标因分母过小而虚高。在常用研究区间内,主口径的均值与中位数与已有文献报告的描述性统计基本一致;在行业层面,科学研究与技术服务业、信息传输与软件和信息技术服务业的研发文本披露最高,住宿餐饮业与交通运输仓储业最低,与研发活动的行业分布特征相符。研究者使用占比口径作为回归变量时,可视需要对连续变量作上下分位缩尾处理。 参考文献 - 李岩琼.研发文本信息:真的多说无益吗?——基于分析师预测的文本分析[J].会计研究,2020(2):26-42.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。