数据资产概念炒作

「数据资产概念炒作」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 23 个变量,样本量约 66,344。 参考张忠杰等(2026,证券市场导报)的方法构建的企业数据资产概念炒作指标。

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数23
样本量66,344
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • DataAssetWordFreq [数据资产词频] — 参考何瑛等(2024,中国工业经济)构建的数据资产词典,统计年报全文中220个数据资产关键词的命中次数。关键词之间存在子串包含关系,采用两遍最长匹配去重以避免同一处文本被重复计数
  • Talk [数据资产文本披露水平] — 参考张忠杰等(2026,证券市场导报)的方法,衡量企业数据资产信息披露之"言",计算公式为:ln(1+年报数据资产词频)
  • MarketValue [市场价值] — 年末最后一个交易日的公司总市值(元)
  • DataAssetValue [数据资产价值] — 参考张忠杰等(2026,证券市场导报)的方法,以市场价值扣除有形资产与可辨认资产后的残值衡量企业数据资产之"行",计算公式为:ln(市场价值-固定资产-金融资产-无形资产),其中金融资产为交易性金融资产、衍生金融资产、可供出售金融资产、持有至到期投资、投资性房地产、债权投资与其他债权投资之和。市场价值不足以覆盖上述三项资产时该指标无定义
  • Concept [数据资产概念炒作] — 参考张忠杰等(2026,证券市场导报)的方法,以数据资产文本披露(言)在数据资产价值(行)中的占比衡量企业"多言寡行"式的印象管理行为,计算公式为:ln(1+年报数据资产词频)/ln(市场价值-固定资产-金融资产-无形资产)。用作研究变量,越大代表企业数据资产概念炒作程度越高
  • AdjConcept [调整后数据资产概念炒作] — 参考张忠杰等(2026,证券市场导报)排除企业刻意炒作行为的稳健性口径,对数据资产词频与市场价值残值分别取以当年为中心的三年窗口(上年、当年、次年)均值后再计算比值,计算公式为:ln(1+三年平均数据资产词频)/ln(三年平均市场价值残值)
  • AdjWindowYears [调整口径窗口年数] — 计算调整后数据资产概念炒作时实际纳入的年份数量,取值为1至3。样本首年与末年因缺少相邻年份而小于3,数值越小表示该年度的调整口径平滑程度越低
  • IsConceptHype [是否数据资产概念炒作] — 参考张忠杰等(2026,证券市场导报)替换解释变量的稳健性口径,数据资产文本披露水平高于同年度同行业中位数(多言)且数据资产价值低于同年度同行业中位数(寡行)时取1,否则取0。行业采用中国上市公司协会分类并按年度动态匹配。是否存在数据资产概念炒作行为(0=否,1=是)
  • MDAWordFreq [管理层讨论与分析数据资产词频] — 年报管理层讨论与分析章节中数据资产关键词的命中次数,所用词典与计数方法同全文口径。未能识别出该章节时为缺失
  • TalkMDA [管理层讨论与分析文本披露水平] — 衡量管理层讨论与分析章节内数据资产信息披露之"言",计算公式为:ln(1+管理层讨论与分析数据资产词频)
  • ConceptMDA [数据资产概念炒作(管理层讨论与分析口径)] — 参考张忠杰等(2026,证券市场导报)将"言"取自管理层讨论与分析章节这一字面表述构建的替代口径,计算公式为:ln(1+管理层讨论与分析数据资产词频)/ln(市场价值-固定资产-金融资产-无形资产)
  • IsMDAExtracted [是否成功提取管理层讨论与分析章节] — 年报中是否成功识别并提取到管理层讨论与分析章节(0=否,1=是)。取0时管理层讨论与分析口径的各字段均为缺失,以避免用年报全文冒充该章节

常见问题

「数据资产概念炒作」是什么数据集?
数据资产概念炒作,隶属数字化转型与人工智能。参考张忠杰等(2026,证券市场导报)的方法构建的企业数据资产概念炒作指标。
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 23 个变量。核心指标包括:数据资产词频、数据资产文本披露水平、市场价值、数据资产价值、数据资产概念炒作、调整后数据资产概念炒作、调整口径窗口年数、是否数据资产概念炒作、管理层讨论与分析数据资产词频、管理层讨论与分析文本披露水平、数据资产概念炒作(管理层讨论与分析口径)、是否成功提取管理层讨论与分析章节。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 66,344 条观测。
数据是如何测算/获取的?
指标定义与计算方法 随着数据要素市场化进程加快,数据资产的价值日益受到资本市场关注。相较于表内列示与报表附注披露,年报文本披露的门槛更低、语言弹性更大,相关规范难以对其披露角度、内容安排与表述方式实施有效约束。这使得文本披露容易成为管理层进行印象管理的工具:在数据资产规模有限、并不真正具备数据资产运营与管理能力的情况下,企业仍可能通过高频的数据资产表述塑造发展潜力强劲的形象,以迎合市场热点、获取数字经济时代的估值溢价。这种在文本上大幅渲染而在实际资产上并无对应支撑的行为,即所谓"多言寡行"式的数据资产概念炒作。 本指标从"言"与"行"两个层面刻画上述行为,核心思路是考察企业数据资产文本披露强度在其数据资产实际价值中所占的比重。比重越高,意味着企业的言语渲染越是超出其资产基础,概念炒作程度越高。 "言"的测度基于年报文本的关键词词频。所用词典以"信息""网络""数字""数据"四个词汇为种子词,通过对相关法律法规语料的语义扩展,筛选并保留与种子词相似度较高的词汇构建而成,共包含二百二十个数据资产关键词,覆盖数字治理、数据交易、信息共享、网络设施等语义范畴。计数时需要注意,这批关键词之间存在大量子串包含关系(例如较短的关键词是较长关键词的前缀或后缀),若直接累加会使同一处文本被重复计入。因此本数据集采用自动机匹配并施加两遍最长匹配去重:第一遍按匹配的起始位置保留最长词,处理前缀型包含;第二遍按结束位置保留最长词,处理后缀型包含。考虑到词频分布呈明显右偏,最终对总词频作对数化处理。由于零词频企业客观存在,对数化采用加一形式以保证该情形下取值为零。 "行"的测度采用企业市场价值中无法由传统资产解释的残值。数据资产已逐步渗透企业经营活动并成为重要资产,其价值虽难以在财务报表中直接确认,却能够体现在市场对企业的整体估值之中。据此,以公司当年市场价值扣除固定资产、金融资产与无形资产后的余额,作为数据资产价值的代理,并同样取对数。其中市场价值取年末最后一个交易日的总市值;金融资产按交易性金融资产、衍生金融资产、可供出售金融资产、持有至到期投资、投资性房地产、债权投资与其他债权投资合计,并对新旧会计准则下的科目作兼容处理。当市场价值不足以覆盖上述三类资产时,该对数无定义,相应观测记为缺失。 记企业 $i$ 在第 $t$ 年的数据资产词频为 $Freq{i,t}$,市场价值为 $MV{i,t}$,固定资产、金融资产与无形资产分别为 $FA{i,t}$、$FIN{i,t}$ 与 $IA{i,t}$,则核心指标构造如下: $$ \begin{aligned} Talk{i,t} &= \ln(1 + Freq{i,t}) \\ Act{i,t} &= \ln(MV{i,t} - FA{i,t} - FIN{i,t} - IA{i,t}) \\ Concept{i,t} &= \frac{Talk{i,t}}{Act{i,t}} \end{aligned} $$ 其中 $Talk{i,t}$ 为数据资产文本披露水平即"言",$Act{i,t}$ 为数据资产价值即"行",$Concept{i,t}$ 即数据资产概念炒作,取值越大表示概念炒作程度越高。 在核心指标之外,本数据集提供三个替代度量。第一个替代度量用于减弱个别年度刻意炒作情形的影响:对数据资产词频与市场价值残值分别取以当年为中心的三年窗口(上年、当年、次年)均值,再按上式计算比值。窗口内仅纳入真实相邻的年份,当企业在样本首年或末年、或年份序列存在中断时窗口相应收窄,本数据集同时输出该口径实际纳入的年份数量,供使用者判断其跨期可比性。第二个替代度量将连续比值离散化,以缓解连续变量在界定"是否存在炒作行为"时边界模糊的问题:将数据资产文本披露水平高于同年度同行业中位数者界定为"多言",将数据资产价值低于同年度同行业中位数者界定为"寡行",二者同时成立时取值为一,否则为零;行业采用中国上市公司协会分类并按年度动态匹配,制造业取门类下两位代码、非制造业取门类字母,行业与年度分组内样本量不足时回退至当年全样本中位数。第三个替代度量将"言"的文本范围限定于年报的管理层讨论与分析章节,其余计算与核心指标一致;当年报中未能识别出该章节时,该口径的相关字段记为缺失并单独标识,以避免用年报全文顶替章节文本。 补充说明 - 文本范围:原文在变量定义中将"言"的测度范围表述为管理层讨论与分析章节。本数据集实现时对年报全文与该章节两种范围分别测算,并与原文报告的描述统计逐项比对:全文口径在均值与标准差上均与原文接近,章节口径则明显偏离,且该差异无法由计量单位不同来解释。故核心指标采用全文口径,同时保留按字面表述计算的章节口径作为对照列,两者并存供使用者自行选择。 - 分母的作用有限:由于"言"与"行"均经对数变换,"行"的截面变异远小于"言",核心指标的截面排序主要由文本披露强度决定。使用者若需将"言"与"行"的作用分离,可利用本数据集单独提供的文本披露水平与数据资产价值两列自行构造正交残差,并建议同时报告以文本披露水平为解释变量的对照回归。 - 词典构成与跨年可比:所用词典由种子词经语义扩展得到,其中部分词汇属公司治理通用表述,在总词频中占比较高,个别年度会因年报披露模板调整而出现词频水平变动;同时原文以总词频而非词频密度构建"言",而年报篇幅在样本期内持续增长。因此该指标的绝对水平不宜跨年度直接解读,跨年度分析建议加入年份固定效应。 - 缺失的分布特征:市场价值不足以覆盖三类资产的观测集中于重资产行业、低市净率企业以及市场估值下行年份,这部分观测的"行"无定义。以股价表现为被解释变量时,建议先检验缺失与被解释变量的相关性,或改用文本披露水平作全样本对照。 - 离散口径与企业规模:由于"寡行"以数据资产价值低于行业年度中位数界定,而该阈值与企业规模高度相关,离散化的炒作标识在规模较小的企业中取值为一的比例明显更高,使用时建议控制企业规模。 - 样本口径:原文剔除金融保险类公司与被特别处理的公司,剔除已持续将数据资产列入报表的企业,并对连续变量作百分之一缩尾。本数据集交付原始值,不预先施加上述回归样本限制,由使用者按研究设计自行处理;其中持续入表企业名单出自外部机构跟踪报告,未公开发布,无法复现。需要说明的是,因财务数据按一般工商业报表模板取数,适用专用报表模板的银行、证券与保险企业实际已不在样本内。 - 其他局限:管理层讨论与分析章节的边界识别在不同年份的年报模板下稳定性不一,章节口径更适用于截面分析;部分年报文本因转换失败或抓取残缺而无法反映真实披露情况,已按替换字符占比与中文字符数两项阈值予以排除;极少数长期停牌公司的年末市值取自距年末较远的最后一个交易日。 参考文献 - 张忠杰,尉昊,赵甜甜.数据资产概念炒作与股票市场稳定——基于印象管理视角[J].证券市场导报,2026,(4):62-71+80. - 何瑛,陈丽丽,杜亚光.数据资产化能否缓解“专精特新”中小企业融资约束[J].中国工业经济,2024,(8):154-173. - 王新,郝晓蓓,孙月.绿色概念炒作与企业绩效:来自产品市场的新发现[J].经济管理,2024,46(7):190-208. - 李哲,李心武,焦焰,张文婷.“多言寡行”的数字化转型披露与分析师预测行为[J].会计研究,2024,(9):61-75. - 路征,周婷,王理,祖君.数据资产与企业发展——来自中国上市公司的经验证据[J].产业经济研究,2023,(4):128-142.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。