昆明冶金职业大学学报 ›› 2026, Vol. 42 ›› Issue (3): 81-.DOI: 10.3969/j.issn.1009-0479.2026.03.012
(a. Faculty of General and Quality Education; b. Faculty of Physical Education and Health, Kunming Metallurgy University, Kunming 650033, China)
摘要:
在数据收集过程中,数据隐私、人为疏忽、流程缺陷等因素的影响常常造成数据缺失,不仅会增加分析复杂度,还会造成系统偏差甚至错误的统计推断,故对缺失数据的处理至关重要。现实中的系统内在机制决定大多数真实数据分布呈现偏态分布而非严格正态分布。本文针对随机缺失偏正态空间数据,探究了样本量与缺失率变化对随机插补、均值插补、支持向量机、决策树、随机森林以及BP神经网络6种插补方法精度的影响,利用MSE和MAE进行量化评价;针对插补后的数据集,建立偏正态空间自回归模型,利用MCMC算法对其进行贝叶斯参数估计。模拟研究和实例分析结果表明:支持向量机和随机森林在拟合缺失空间偏态数据具有更强的适应能力和稳健表现,其对应的贝叶斯参数估计值较为准确。
中图分类号: