企业媒体关注度
「企业媒体关注度」,覆盖 2001-2024 年,频率 年度,上市公司层级,含 17 个变量,样本量约 61,972。 参考周开国等(2014,金融研究)的方法,以公司当年被媒体报道的新闻条数的自然对数衡量媒体关注度。
| 时间跨度 | 2001-2024 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 17 |
| 样本量 | 61,972 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- MediaNewsCount [网络媒体报道数量] — 当年网络媒体对该公司的新闻报道条数(含转载),计算公式为:该公司当年全部正面、中性、负面网络新闻报道篇数之和。网络与报刊两类载体当年同时无报道的公司年度,视为未被新闻收录范围覆盖而非零关注,取值为缺失。
- PressNewsCount [报刊媒体报道数量] — 当年报刊媒体对该公司的新闻报道条数(含转载),计算公式为:该公司当年全部正面、中性、负面报刊新闻报道篇数之和。
- LnMediaAttention [媒体关注度] — 参考周开国等(2014,金融研究)的方法,计算公式为:ln(当年网络媒体对该公司的新闻报道条数)。当年无网络报道时对数无定义,取值为缺失。用作研究变量,越大代表媒体对该公司的关注程度越高。
- LnMediaAttentionPlus1 [媒体关注度(含零报道)] — 媒体关注度的零报道保留口径,计算公式为:ln(1+当年网络媒体对该公司的新闻报道条数)。与核心口径的区别在于当年无网络报道的公司取值为0而非缺失。用作研究变量,越大代表媒体对该公司的关注程度越高。
- LnMediaAttentionPress [媒体关注度(报刊口径)] — 媒体关注度的报刊载体对照口径,计算公式为:ln(1+当年报刊媒体对该公司的新闻报道条数)。用作研究变量,越大代表报刊媒体对该公司的关注程度越高。
- LnMediaAttentionAll [媒体关注度(全媒体口径)] — 媒体关注度的全媒体合并对照口径,计算公式为:ln(1+当年网络媒体报道条数+当年报刊媒体报道条数)。用作研究变量,越大代表媒体整体对该公司的关注程度越高。
常见问题
- 「企业媒体关注度」是什么数据集?
- 企业媒体关注度,隶属信息环境。参考周开国等(2014,金融研究)的方法,以公司当年被媒体报道的新闻条数的自然对数衡量媒体关注度。
- 该数据集的时间范围是?
- 覆盖 2001-2024 年。
- 包含哪些变量/指标?
- 共 17 个变量。核心指标包括:网络媒体报道数量、报刊媒体报道数量、媒体关注度、媒体关注度(含零报道)、媒体关注度(报刊口径)、媒体关注度(全媒体口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 61,972 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 媒体是资本市场信息的主要搜集者、加工者与传播者。除了自身的信息挖掘功能之外,媒体还通过影响市场参与者(如分析师与投资者)对上市公司的注意力配置,进而作用于资本市场的信息环境。周开国等(2014)在研究媒体关注度、分析师关注度与盈余预测准确度的关系时指出,媒体作为上市公司信息披露的重要载体,通过提供信息与传播信息拓宽了信息使用者的信息渠道;由于个体注意力资源有限,媒体对某家公司报道的增加,往往意味着市场对该公司信息需求与信息供给的同步上升。因此,衡量媒体关注度的自然方式,就是统计一定时期内媒体对该公司的报道数量。 本数据集据此构建企业媒体关注度指标。基础变量是公司当年被媒体报道的新闻条数:设 $MEDIAAT{it}$ 为公司 $i$ 在第 $t$ 年内被媒体报道的新闻条数,它由该公司当年全部正面、中性与负面报道篇数加总得到,并包含转载稿件——这与原文以搜索平台检索结果条数计量关注度的做法在口径方向上一致,因为搜索平台同样会把同一条新闻在不同站点的转载分别计入。 原文在载体选择上作了明确论证:相较于报纸,网络平台在影响力与覆盖面上更具优势,且拥有实体报纸的媒体基本都有网络同步报道,因而仅使用代表性报纸难以全面衡量媒体对上市公司的关注。本数据集据此以网络媒体报道条数作为核心口径。核心指标为报道条数的自然对数: $$LNMEDIAAT{it}=\ln\left(MEDIAAT{it}\right)$$ 取对数既是原文回归中使用的形式,也用于压缩报道条数的右偏分布。当公司当年没有网络报道时,对数无定义,核心指标取缺失值。 围绕同一构念,本数据集另提供三个对照口径,便于使用者检验结论对载体与零值处理的敏感性。零报道保留口径为 $\ln(1+MEDIAAT{it})$,其与核心口径的唯一差别在于把当年无网络报道的公司取值为零而非缺失,从而保留这部分观测。报刊载体对照口径为 $\ln(1+\text{当年报刊报道条数})$,衡量传统纸媒对公司的关注程度。全媒体合并对照口径为 $\ln(1+\text{当年网络报道条数}+\text{当年报刊报道条数})$,把两类载体的报道量合并计算。需要说明的是,这三个口径中只有核心口径对应原文选定的载体与函数形式,其余为口径对照而非原文方法的复现。 在样本构造上,原文的研究样本限于深圳证券交易所 A 股主板公司、且剔除了盈余预测数据缺失与股票名称检索噪音较大的公司;本数据集作为通用变量库不施加这类回归样本限制,覆盖沪深主板、创业板与科创板的全部 A 股上市公司与全部可得年份,剔除 B 股代码与旧挂牌代码段,不预先剔除金融行业,报道条数保留原始值不作缩尾处理。两类载体当年同时没有报道记录的公司年度,判定为未被新闻收录范围覆盖而非零关注,全部数据列取缺失值;单一公司当年报道量占到全市场该载体报道总量一半以上的公司年度,判定为公司简称在新闻正文中被当作普通词组泛匹配所致的源数据错误,同样取缺失值。后一条规则与原文筛选原则中剔除“新闻搜索结果与上市公司相关性低的样本”的做法方向一致。 补充说明 - 数据来源与量级:原文由作者在搜索平台按公司股票名称手工分时段检索并记录结果条数,本数据集使用结构化财经新闻数据库统计的年度报道条数。搜索平台会把同一条新闻在各转载站点的副本分别计为一条,因此本指标的绝对水平明显低于原文报告的量级,其可比性仅在原文样本区间得到验证。 - 覆盖边界:新闻库对银行业与证券业公司的收录极为有限,两个行业绝大多数公司年度取值为缺失(保险业与其他金融业的覆盖则较为正常);北交所公司的新闻以旧挂牌代码记录,与本项目主档使用的代码之间不存在映射关系,旧代码行已在样本构造中剔除,其后果是北交所公司虽进入面板但基本没有报道记录。本数据集不支持以银行业、证券业或北交所为研究样本的设计。 - 公司简称的匹配噪音:简称本身是通用词组的公司会吸收大量与之无关的新闻。除已按客观阈值剔除的极端情形外,程度较轻的同类污染无法用客观规则分离,集中体现在分布右尾,且报刊载体的残留明显重于网络载体。已识别的典型公司包括线上线下(300959)、新产业(300832)、海量数据(603138)、新天地(301277)、新城市(300778)、农产品(000061)、新华网(603888)、金麒麟(603586)。原文作者以手工方式剔除了此类样本,使用者复现原文设定时宜作同样处理,或以缩尾、剔除年度内标准化取值异常偏高的观测作稳健性检验。可供自查的特征是这类公司的标题提及占比明显偏低。 - 跨年度可比性:含转载口径下,同一条真实报道被计入的次数取决于新闻库当年的转载收录强度,而原创报道占比在样本期内往复漂移。本指标的跨年度绝对水平不宜直接比较,回归中应加入年份固定效应;以媒体关注度自身的时间变化为研究对象的设计不适用本指标。 - 早期年份的区分度:网络新闻收录在样本期早期较为稀疏,相当比例的公司当年没有网络报道记录,横截面区分度有限,核心指标缺失比例较高。这与当时网络媒体尚未普及的背景一致,同期报刊载体的覆盖明显更完整。建议研究窗口起自网络新闻收录进入稳定阶段之后,或改用零报道保留口径与报刊载体口径。 - 其他局限:取缺失的公司年度并非随机分布,与公司规模负相关,建议以零报道保留口径的结果作为对照;报刊口径与网络口径在时间维度上的走势并不同步,两者不是同质替代;全媒体合并口径在数值上由网络报道量主导,不构成独立于核心口径的稳健性检验。 参考文献 - 周开国,应千伟,陈晓娴.媒体关注度、分析师关注度与盈余预测准确度[J].金融研究,2014,(2):139-152.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。