企业员工数字能力(员工语境词频法)

「企业员工数字能力(员工语境词频法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 18 个变量,样本量约 69,328。 参考Diaz-Fernandez等(2026, Technovation)的方法度量企业员工数字能力。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数18
样本量69,328
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 年报对应的会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • DCHitsRaw [数字能力关键词原始命中次数] — 参考Diaz-Fernandez等(2026, Technovation)的方法,计算公式为:年报全文中数字能力关键词的命中次数合计,同一文本跨度只计一次;该字段为未施加员工语境限定与否定剔除的原始计数,是计算有效词频的中间量
  • DCHitsDroppedContext [非员工语境剔除次数] — 计算公式为:原始命中次数中,因所在语境未出现员工指代、或客户与供应商等非员工主体比员工指代更贴近关键词而被剔除的次数。对应原文剔除客户、供应商能力等非员工内容的要求
  • DCHitsDroppedNegation [否定表述剔除次数] — 计算公式为:通过员工语境判定的命中中,因关键词前6个字符内出现否定词而被剔除的次数,已排除不断、不仅、无论、未来等并非否定含义的组合
  • DCWordCount [员工数字能力关键词有效词频] — 参考Diaz-Fernandez等(2026, Technovation)的方法,计算公式为:原始命中次数减去非员工语境剔除次数再减去否定表述剔除次数,即数字能力关键词在指涉企业员工的语境中出现的有效次数
  • ReportChars [年报中文字符数] — 年报全文中的中文字符总数,用作按篇幅标准化口径的分母
  • EmpDigitalCompetency [企业员工数字能力] — 参考Diaz-Fernandez等(2026, Technovation)的方法,计算公式为:ln(1+员工数字能力关键词有效词频)。用作研究变量,越大代表年报中对员工数字能力的着墨程度越高
  • EmpDigitalCompetencyIntensity [企业员工数字能力(篇幅标准化口径)] — 计算公式为:ln(1+员工数字能力关键词有效词频/年报中文字符数×10000),即按每万中文字符的有效词频度量。原文未说明词频指绝对次数还是相对频率,本列为相对频率读法下的口径,用作核心指标的稳健性检验,越大代表单位篇幅内对员工数字能力的着墨程度越高

常见问题

「企业员工数字能力(员工语境词频法)」是什么数据集?
企业员工数字能力(员工语境词频法),隶属数字化转型与人工智能。参考Diaz-Fernandez等(2026, Technovation)的方法度量企业员工数字能力。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 18 个变量。核心指标包括:数字能力关键词原始命中次数、非员工语境剔除次数、否定表述剔除次数、员工数字能力关键词有效词频、年报中文字符数、企业员工数字能力、企业员工数字能力(篇幅标准化口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,328 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业的数字化转型能否转化为真实的组织成果,取决于员工是否具备驾驭数字技术的能力。数字能力被界定为使员工能够高效完成工作、并成功应对数字媒介环境的一组基础知识、技能与其他个体特征,涵盖信息素养、沟通、协作、问题解决与内容创造等维度。与设备和系统的投入不同,这类能力沉淀在人身上,构成企业将技术投入转化为竞争优势与社会价值的中介环节。本数据集从上市公司年报文本出发,度量企业对员工数字能力的着墨程度。 测度以数字能力关键词典为起点。该词典覆盖数据分析、编程与软件开发、云计算与数据库、网络安全与数据治理、人机交互与用户体验设计、在线学习与远程协作等领域的具体技能表述,既包含数字素养、数字技能、数字化人才这类直接指称能力的措辞,也包含数据分析师、软件工程师、数据科学家这类直接指称岗位的措辞,还包含在文本中以英文原形出现的编程语言、统计软件与数据平台名称。词典原为英文,本数据集将其逐条映射为中文年报语境中的对应表述;对在中文语境下无法与其他含义相区分的词条予以剔除,剔除依据随词典一并留存。 关键词计数并非在全文范围内不加区分地进行。指标要度量的是员工的数字能力,而非企业业务或产品中的数字技术含量,因此只有出现在指涉企业员工的语境中的关键词才被计入。具体而言,命中的关键词须与员工指代词(如员工、职工、人才、团队、技术人员、培训、岗位等)出现在同一个句子中,且两者的字符间隔不超过设定的窗口。当员工指代词恰好构成关键词自身的一部分时——例如"软件工程师"中的"工程师"、"数字化人才"中的"人才"——视为自动满足员工语境的要求,因为这类关键词本身即在指称企业的岗位与队伍。窗口上限的设定源于年报文本的一项特征:年报中存在大量没有句读的表格与列表区段,这类区段在机械切分下会形成极长的伪句子,若仅以句子为语境单元,区段内任意两个词都会被判定为"共现"。设定字符间隔上限即可在保留正常句子完整语境的同时,排除这类伪共现。 在员工语境之外,还需排除两类内容。其一是主体错位的表述:若客户、供应商、经销商、股东、学员等非员工主体比员工指代词更贴近关键词,说明该处描述的是交易对手或服务对象的能力而非本企业员工的能力,该次命中不予计入;此项判定不把构成关键词自身一部分的主体词作为排除依据,因为诸如"客户分析"中的"客户"只是方法名称的组成部分。其二是否定表述:若关键词之前紧邻否定词,则该次提及表达的是能力的缺失,同样不予计入;判定时排除了不断、不仅、无论、未来、非常等以否定字起首却并非否定含义的固定组合。 员工指代词本身还需与会计口径相区分。中文年报中若干看似指人的措辞实为记账科目:报表中的"应付职工薪酬""支付给职工以及为职工支付的现金"描述的是费用与现金流科目,关联交易表与收入确认政策中的"提供劳务""接受劳务""劳务收入"描述的是交易类型。若不加区分,这些科目名会在关联交易明细表与成本明细表中充当员工语境的锚点,把供应商名称旁的技术词汇计入指标。因此本数据集为员工指代词设置了会计科目护栏:锚词落在此类报表科目短语内部时不作为员工语境的依据,同句中其余真实的员工指代词仍然有效;"劳务"亦不单独作为指代词,只保留劳务派遣、劳务外包、劳务用工、劳务人员等确指用工的组合。 设 $f{i,t}$ 为企业 $i$ 在第 $t$ 年年报中通过上述全部判定的关键词有效出现次数,员工数字能力指标定义为 $$EmpDigitalCompetency{i,t}=\ln\left(1+f{i,t}\right)$$ 取对数是为了压缩右偏分布中长尾企业的影响,加一则用于容纳未出现任何有效命中的企业年。 考虑到年报篇幅在样本期内存在系统性增长,词频的绝对水平会同时反映披露强度与文本总量两种因素,本数据集另提供一个按篇幅标准化的稳健性口径。记 $L{i,t}$ 为该份年报的中文字符总数,则 $$EmpDigitalCompetencyIntensity{i,t}=\ln\left(1+\frac{f{i,t}}{L{i,t}}\times 10^{4}\right)$$ 即以每万中文字符的有效词频替代绝对次数。两个口径高度相关,使用者可依研究设计择一作为主口径、另一作为稳健性检验。 除两个指标外,数据集同时给出计算链上的中间量:关键词在全文中的原始命中次数、因非员工语境被剔除的次数、因否定表述被剔除的次数,以及年报中文字符数。这些字段使指标的构造过程完全可追溯,也便于使用者按自身研究需要重新组合。关键词匹配采用多模式串匹配一次扫描完成,同一段文本只计一次,以避免长短关键词相互包含时的重复计数;对以英文原形出现的词条,匹配时校验其前后字符不属于字母与数字,以防止在更长的英文串内部误命中。 补充说明 - 披露强度属性:本指标度量的是年报中对员工数字能力的着墨程度,属披露强度测度。取值为零表示该份年报未在员工语境下出现词表中的相关表述,而非企业确实不具备相关能力。零值占比随年份下降,早期年份占比较高,使用者在设定样本区间时应予考虑。 - 构念边界:通过全部过滤后,仍有相当比例的命中出自产品与业务描述、关联交易与成本明细表、行业展望套话以及董监高简历。贡献最大的关键词集中于人工智能、算法、软件开发一类的技术词汇,取值最高的企业集中于信息技术培训与软件外包行业。年报中无句读的表格区会使同句约束失效,仅靠字符间隔约束,邻接巧合无法完全排除。因此该指标更接近"年报在员工语境附近使用数字技术词汇的密度",与员工数字能力本身存在系统性偏离,宜作为机制变量或辅助变量使用;若作为核心变量,建议补充人工编码的信度检验。 - 时间变异的来源:有效命中中人工智能词族所占比例随年份大幅上升,近年已接近半数;剔除该词族后,近年的其余成分基本持平。这说明指标的时间上升趋势主要由人工智能相关披露的普及所驱动。依赖时间变异的识别策略应控制年份固定效应,并避免以该变量的原始时间趋势作为因果叙述的依据。 - 面板识别力:变量高度零膨胀且取值离散,相邻年份取值完全相同的比例很高,相当比例的企业在多年窗口内组内标准差为零、在企业固定效应下被完全吸收;双向去均值后残差变异的绝大部分来自零与非零之间的切换。其与年报篇幅的组内共动幅度,与其同企业数字化转型程度的组内共动幅度相当,而与年报披露的技术人员占比的组内共动幅度约为前者一半。收敛效度因而主要体现在横截面。建议优先采用行业—年度内的横截面设计或长差分设计;若使用企业固定效应,宜同时报告二值化与计数模型的结果,并控制年报篇幅。 - 两道剔除的实际权重:原始方法特别强调的排除客户与供应商能力这一步,在中文年报语料上实际影响的命中数量很小,否定表述的剔除更小。数据集中的非员工语境剔除列合并了"附近无员工指代词"与"非员工主体更贴近"两类,其中绝大部分属前者。引用本数据集描述方法时,不宜把后一道过滤描述为核心设计。 - 词表的有效规模与语言适配:原始词表针对英文年报构建,本数据集将其逐条映射至中文年报语境,无法在中文中与其他含义相区分的词条已剔除,映射与剔除依据随词典一并留存。纳入匹配的词条中实际产生有效命中的集中度很高,英文侧的有效命中绝大多数来自人工智能的英文缩写。中英并写的表述会被计为两次,因为原始词表同样把中英两种写法列为独立词条,这对中英双写的公司存在系统性加权。 - 语境判定的操作化:原始方法要求在指涉员工的语境中计数,但未界定语境的边界。本数据集以同句且字符间隔不超过设定窗口作为操作化方案,相较纯句内共现口径略偏保守。员工指代词、会计科目护栏与非员工主体词三张词表随数据集一并留存。 - 职业教育类企业:以数字技能培训为主营业务的企业,其年报中的相关表述部分指向学员与市场需求而非自身员工。学员与学生已作为非员工主体纳入排除,但业务描述本身仍会被计入,此类企业的取值偏高。使用者如关注一般制造与服务业企业,可按行业代码剔除教育类样本。 - 数值可比性:原始文献未说明词频指绝对次数还是相对频率,且其报告的描述统计无法由绝对计数的对数变换复现,按篇幅标准化的口径在量级上反而与之更接近。本数据集核心口径按字面读法以绝对次数实现,两种口径并列提供。跨文献比较应以指标的相对排序与变动为准,并建议同时报告两个口径。 - 样本主体与其他局限:面板覆盖全板块,B股代码与新三板、北交所代码一并保留,同时发行A、B股的公司会以两个代码各出现一次,使用者可按代码前缀自行筛选;债券与基金发行人的年度报告已按代码段剔除。语料中混有繁体年报,已作繁简归一后再行匹配。少量年报文本在语料构建阶段即已损坏,其字符无法恢复,对应企业年不产出记录而非记为零值;另有少数年报正文抽取不完整,其零值更可能源于抽取失败,数据集输出年报中文字符数供使用者自行设限筛除。 参考文献 - Diaz-Fernandez M, Rivera-Prieto J C, Lopez-Cabrales A. Digital transformation and social sustainability: the mediating role of employees' digital competencies[J]. Technovation, 2026, 156: 103607. - Shakina E, Parshakov P, Alsufiev A. Rethinking the corporate digital divide: The complementarity of technologies and the demand for digital skills[J]. Technological Forecasting and Social Change, 2021, 162: 120405. - Oberlander M, Beinicke A, Bipp T. Digital competencies: A review of the literature and applications in the workplace[J]. Computers & Education, 2020, 146: 103752.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。