GDP对数
「GDP对数」,覆盖 1992-2024 年,频率 年度,省级层级,含 5 个变量,样本量约 1,023。 衡量各省份经济产出规模的对数化处理指标,通过对原始地区生产总值加1后取自然对数计算,以消除量纲差异并缓解异方差问题。
| 时间跨度 | 1992-2024 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 5 |
| 样本量 | 1,023 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份名称] — 省份的中文名称.
- ProvinceCode [省份代码] — 省份的相关统计部门代码 (6 位字符串).
- Year [年份] — 统计年份.
- Grp [地区生产总值(亿元)] — 地区生产总值指按市场价格计算的一个地区所有常住单位在一定时期内生产活动的最终成果。统计范围涵盖国民经济各行业,反映地区经济总量和规模。单位:亿元。
- GdpLog [GDP对数] — GDP对数。计算公式:log(Grp+1)。
常见问题
- 「GDP对数」是什么数据集?
- GDP对数,隶属综合经济。衡量各省份经济产出规模的对数化处理指标,通过对原始地区生产总值加1后取自然对数计算,以消除量纲差异并缓解异方差问题。
- 该数据集的时间范围是?
- 覆盖 1992-2024 年。
- 包含哪些变量/指标?
- 共 5 个变量。核心指标包括:地区生产总值(亿元)、GDP对数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 1,023 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 GDP对数(GdpLog)是对地区生产总值取自然对数后的派生指标,旨在解决原始GDP数据因量纲跨数量级(如各省份GDP从千亿元到十万亿元不等)而导致的异方差性和非线性问题。在宏观计量分析中,对数变换可将乘法关系转化为加法关系,使弹性系数(如GDP每增长1%对应的因变量变化)具有明确的经济学解释,同时缓解数据偏态分布对回归估计的干扰。该指标的引入动机在于:当原始GDP作为解释变量或被解释变量时,直接使用水平值可能导致估计结果受极端值主导,而对数化处理能有效改善模型拟合优度与稳健性。数据来源为相关统计部门年度公开数据中的地区生产总值(现价),对应源字段Grp。完整计算公式为: $$ \text{GdpLog} = \ln(\text{Grp} + 1) $$ 其中,Grp为各省份年度GDP(单位:亿元),加1处理是为了避免零值或极低值(如早期年份数据缺失或经济规模极小)导致对数无定义。关键步骤说明:首先从原始数据中提取Grp字段,检查是否存在缺失值或非正数;若存在零值,则直接应用公式;若存在缺失值,则保留为缺失。计算无需中间步骤(如PIM或Theil指数)。单位:对数(亿元),即无量纲的对数值。取值范围:对于中国省级数据,典型量级在5至12之间(对应GDP约150亿元至16万亿元),例如北京2020年GDP约36000亿元,对数值约为10.49;西藏2020年GDP约1900亿元,对数值约为7.55。 补充说明 简化假设:假设所有省份GDP数据均为正数,且加1处理对较大数值(如万亿级)的影响可忽略不计(误差小于0.0001%)。边界条件:年份覆盖范围为1992年至2022年(相关统计部门公开数据起始年份),缺失处理采用列表删除法(即不填补缺失值);单位换算无需进行,因原始数据已统一为亿元。计算粒度:以Province(省份)和Year(年份)为主键,每个观测值对应一个省-年组合。已知限制:对数变换无法处理负值(如某些年份因统计调整出现的负GDP修正值),此时需单独标记或剔除;此外,加1处理在极小值(如GDP<1亿元)时可能引入微小偏差,但中国省级数据中此类情况罕见。
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。