企业商业资源搜寻效率(贸易网络最短路径&数字技术TF-IDF)

「企业商业资源搜寻效率(贸易网络最短路径&数字技术TF-IDF)」,覆盖 2001-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 22,509。 衡量企业搜寻与匹配新商业资源的效率,参考包群等(2023,经济研究)的方法给出两类口径:一是基于上市公司披露的前五大供应商与客户关系逐年构建国内贸易网络,用Di

时间跨度2001-2025 年
数据频率年度
层级上市公司
变量数19
样本量22,509
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • ReachableFirms [可达贸易伙伴企业数] — 参考包群等(2023,经济研究)的方法,计算公式为:当年国内贸易网络中与该企业存在直接或间接贸易路径(即最短路径长度为有限值)的其他节点企业个数。国内贸易网络由上市公司披露的前五大供应商与前五大客户关系逐年构建。用作研究变量,越大代表该企业在贸易网络中能够触及的商业资源范围越广。
  • MeanShortestPath [贸易网络平均最短路径长度] — 参考包群等(2023,经济研究)的方法,计算公式为:该企业到国内贸易网络中全部可达节点企业的最短路径长度之和,除以可达贸易伙伴企业数。路径长度最短为1,表示两者之间存在直接贸易往来。用作研究变量,越大代表该企业与其余企业在贸易网络中的平均距离越远。
  • InvMeanShortestPath [贸易网络平均最短路径倒数] — 参考包群等(2023,经济研究)的方法,计算公式为:贸易网络平均最短路径长度的倒数。用作研究变量,越大代表该企业与其余企业的网络距离越近、获取商业信息与资源越便捷。
  • DigitalKeywordFreq [数字技术关键词总词频] — 参考包群等(2023,经济研究)的方法,计算公式为:人工智能、机器学习、云计算、物联网等24个数字技术关键词在该企业当年年度报告全文中出现次数的总和。用作研究变量,越大代表企业年报对数字技术应用的着墨越多。
  • SearchEfficiency [基于国内贸易网络的商业资源搜寻效率] — 参考包群等(2023,经济研究)的方法,计算公式为:可达贸易伙伴企业数的平方,除以该企业到全部可达节点企业最短路径长度之和;等价于贸易网络平均最短路径倒数乘以可达贸易伙伴企业数。最短路径由Dijkstra算法在当年国内贸易网络上求得,无法连通的节点不计入。用作研究变量,越大代表企业依托自身在国内贸易网络中的位置搜寻新供应关系的效率越高。
  • DigitalSearchEfficiency [基于数字技术的商业资源搜寻效率] — 参考包群等(2023,经济研究)的方法,计算公式为:24个数字技术关键词在该企业当年年报中的词频,分别乘以对应词条当年的逆文档频率后求和;逆文档频率按原文定义取当年全部上市公司年报中包含该词条的文档比例的倒数。用作研究变量,越大代表企业运用数字技术搜寻与匹配商业资源的能力越强。
  • LnSearchEfficiency [贸易网络搜寻效率对数值] — 计算公式为:基于国内贸易网络的商业资源搜寻效率加1后取自然对数,用于缓解原始指标的右偏分布。用作研究变量,含义与原始指标一致,越大代表网络搜寻效率越高。
  • DigitalSearchEfficiencyLogIDF [对数逆文档频率版数字技术搜寻效率] — 参考包群等(2023,经济研究)的方法并将逆文档频率改用信息检索领域的标准对数形式,计算公式为:24个数字技术关键词在该企业当年年报中的词频,分别乘以当年全部上市公司年报总数与包含该词条文档数之比的自然对数后求和。用作稳健性检验变量,相比原始口径大幅削弱了极稀有词条对取值的放大效应。

常见问题

「企业商业资源搜寻效率(贸易网络最短路径&数字技术TF-IDF)」是什么数据集?
企业商业资源搜寻效率(贸易网络最短路径&数字技术TF-IDF),隶属供应链。衡量企业搜寻与匹配新商业资源的效率,参考包群等(2023,经济研究)的方法给出两类口径:一是基于上市公司披露的前五大供应商与客户关系逐年构建国内贸易网络,用Di
该数据集的时间范围是?
覆盖 2001-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:可达贸易伙伴企业数、贸易网络平均最短路径长度、贸易网络平均最短路径倒数、数字技术关键词总词频、基于国内贸易网络的商业资源搜寻效率、基于数字技术的商业资源搜寻效率、贸易网络搜寻效率对数值、对数逆文档频率版数字技术搜寻效率。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 22,509 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业在更换生产基地、调整经营布局或遭遇经营环境变动时,是否替换原有供应商,本质上取决于搜寻新供应关系的成本与维系旧供应关系的成本之间的权衡。搜寻成本越低,企业越有可能放弃原有贸易伙伴、转而在新环境中寻找更适配的合作对象。本数据集刻画的正是这一权衡中的关键一侧——企业搜寻与匹配商业资源的效率。参考包群等 (2023) 的做法,搜寻效率从两个相互独立的渠道度量:一是企业内嵌于国内贸易网络的结构位置所带来的信息优势,二是企业运用数字技术获取与处理商业信息的能力。 国内贸易网络的构建 随着供应商—客户关系的不断演进,国内贸易网络已成为企业获取商业信息与资源的重要渠道,企业可以凭借自身在网络中的地位有效搜寻可供利用的商业资源。内嵌于企业自身的网络结构属性降低了建立新供应关系的额外固定成本。 网络以上市公司在定期报告中披露的前五大供应商与前五大客户关系为基础逐年构建:每一条披露记录在披露企业与其贸易对象之间生成一条边,网络设定为无向、无权,边长统一取 1,即直接贸易往来的路径长度为 1。网络逐年独立构建,不跨年累积,因而每一年的网络结构反映的是当年实际存续的贸易关系格局。 网络中的节点并不限于上市公司。贸易对象若能识别为 A 股上市公司,则归并到其股票代码所对应的节点,以免同一实体被拆分为"代码节点"与"名称节点"两个点;其余贸易对象以规范化后的企业名称各自成为独立节点。非上市贸易对象虽然不进入最终的观测面板,但它们在网络中承担着连接不同上市公司的中介角色,其存在直接决定了上市公司之间能否形成间接路径,因此完整保留在网络之中。 基于国内贸易网络的搜寻效率 对网络中的每一个企业节点,使用 Dijkstra 算法计算它与其余所有节点之间的最短路径长度。记 $H{it}$ 为第 $t$ 年与节点 $i$ 存在直接或间接路径的节点集合——与 $i$ 之间不存在任何连通路径(最短路径为无穷大)的节点被排除在外,$Q(H{it})$ 为该集合中的节点个数,$dist{ki}$ 为节点 $k$ 与节点 $i$ 之间的最短路径长度。 先计算该企业到全部可达节点的最短路径长度均值,用以刻画它在贸易网络中与其余可能与其发生关联的节点之间的平均距离;取该平均距离的倒数,即得到不考虑网络触达广度时的搜寻效率。考虑到企业在贸易网络中能接触到的节点数量本身会对搜寻效率产生影响,再将平均距离的倒数乘以当年能接触到的节点企业数,得到最终的商业资源搜寻效率: $$search{it}=\frac{Q^{2}(H{it})}{\sum{k\in H{it},\,k\neq i} dist{ki}}$$ 若某企业距其余企业的平均最短路径越短、且能够触达的节点越多,则该企业越能便捷地搜索到邻近的贸易伙伴、获取商业资源,在经营布局调整后也越容易寻找到新的贸易合作对象。 数据集同时给出该式的三个构件:可达贸易伙伴企业数 $Q(H{it})$、平均最短路径长度 $\sum dist{ki}/Q$ 及其倒数 $Q/\sum dist{ki}$。平均最短路径倒数剥离了网络触达广度的影响,单纯反映企业与其余企业在网络中的邻近程度,可与完整指标配合使用以分离两种机制。为缓解原始指标的右偏分布,另提供其加一后取自然对数的形式。 基于数字技术的搜寻效率 数字技术促进了商业信息在微观主体之间的流转与传播,缩短了企业间的贸易距离、部分缓解了信息传递摩擦,从而对商业资源的搜索效率产生重要影响。已有文献通常采用无形资产中的软件资产余额等代理指标来测度数字赋能水平,但这一做法容易低估企业应用数字技术的真实状况,因此本数据集转而从企业年度报告的文本中提取数字技术应用信息。 词典沿用包群等 (2023) 参照既有数字化研究并结合其研究需要所确定的关键词集合 $D$,共 24 个关键词,涵盖人工智能与 AI 技术、计算机技术与信息技术、智能化与自动化、神经网络、虚拟现实、数据科学与数据挖掘、数字化与信息化、信息化战略、生物识别与人脸识别、机器学习与深度学习、自然语言处理、图像识别与语音识别、云计算、云平台、云安全以及物联网等方向。 以这些关键词在年报中的逆文档概率词频衡量企业在特定年份的数字赋能程度: $$digital{it}=\sum{d\in D} TF{dit}\cdot IDF{dt}$$ 其中 $TF{dit}$ 为词条 $d$ 在企业 $i$ 第 $t$ 年年报中的词频,$IDF{dt}$ 为词条 $d$ 在第 $t$ 年语料库(该年全部上市公司年度报告构成的文档集合)中的逆文档频率。逆文档频率的计算逻辑是:某一词条在某份特定文档中的重要程度随词频增加而增加,但同时随其在语料库中出现的次数增加而下降;若某词条在一份文档中出现的频率越高、并且在其他文档中较少出现,则说明该词条对该份文档而言很重要,具有较好的区分能力。按原文定义,$IDF{dt}$ 取包含该词条的文档比例的倒数,即该年语料库文档总数与包含该词条的文档数之比。某一年语料中完全未出现的词条其词频恒为零,不参与求和。 该指数反映了上市公司依托大数据、云计算以及人工智能等数字技术高效利用商业资源和信息、拓展供应关系的能力。数据集同时给出 24 个关键词的年报词频总和,以及将逆文档频率替换为信息检索领域标准对数形式后的稳健性口径。 补充说明 - 样本口径:观测范围为当年进入国内贸易网络、且在网络中至少存在一个可达节点的 A 股上市公司,覆盖全部行业与板块,未预先施加行业或板块限制。金融业企业一并保留,使用者可按行业代码自行筛选。数字技术搜寻效率在当年无年度报告的企业年上缺失。 - 披露化名的处理:相当比例的上市公司在披露前五大供应商与客户时使用"客户一""第一名""供应商 A"一类不含身份信息的化名。这类记录无法对应到确定的实体,若将同一化名当作一个节点,会把所有使用该化名的企业虚假地连通起来,因此在建网时整条剔除,其识别口径与供应链透明度指标的实名披露判定保持一致。由此形成的网络偏向实名披露程度较高的企业,进入面板的公司在规模上也相应偏大;使用时建议加入行业与年份固定效应,必要时可将上市公司规模作为控制变量。 - 网络搜寻效率的结构性质:该指标以可达节点数的平方为分子,因而高度依赖企业所处连通分量的规模——位于巨型连通分量之中的企业与仅拥有少数孤立贸易伙伴的企业之间存在数量级上的差异。这是原始公式的固有性质而非计算处理所致。同时,逐年网络的整体规模随当年实名披露企业的多寡而变动,故该指标的跨年度绝对数值不宜直接比较,适合在年份固定效应下作横截面使用;原文的基准回归亦包含时间与行业的交叉固定效应。 - 两种逆文档频率口径:核心指标严格按原文定义采用文档比例的倒数,未取对数。这一设定会放大极稀有词条的权重——当某一前沿技术词在某年仅有个别企业提及时,该词的逆文档频率接近语料库规模,使这些企业的取值远高于同期其他企业。从构念上这与"率先应用前沿数字技术者数字赋能程度更高"的含义方向一致,但量级上被显著放大,且会使指标与关键词总词频之间出现明显分离。数据集因此并列提供采用标准对数形式的口径,其分布更为平缓、企业内变异更易识别,建议在固定效应模型中优先采用该口径或对核心指标取对数。 - 文本处理:年报语料中混有少量以繁体中文撰写的公告,简体词典在这类文本上会静默计为零值。计算时先以繁体形式的关键词作探针检测,命中后将全文转换为简体再行计数,该处理对简体文本不产生影响。关键词按全文字符串计数,词典中"信息化"与"信息化战略"存在包含关系,后者在计数时会同时计入前者。 - 其他局限:前五大供应商与客户的披露口径在样本期内存在变动,个别年份的披露覆盖面明显收窄,会同步压缩当年网络的规模与连通性;部分贸易对象为非上市挂牌企业或境外主体,它们作为网络中介参与最短路径的计算,但不进入观测面板;少量披露记录的贸易对象即披露企业自身(集团内部口径所致),这类自环边在建网时剔除,不影响任何节点对之间的路径长度;仅发行 B 股而无对应 A 股代码的公司不纳入网络,以免同一家公司被拆分为两个节点;企业注册地位于县级市时,其地级市区划代码可能缺失。 参考文献 - 包群, 但佳丽, 王云廷. 国内贸易网络、地理距离与供应商本地化[J]. 经济研究, 2023, 58(6): 102-118.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。