StatQuest:随机森林第二部分:缺失值与聚类
外来客 • 2026-08-13 12:50:09
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:StatQuest: Random Forests Part 2: Missing data and clustering)
🌲 核心观点
随机森林(Random Forest)不仅能处理分类和回归问题,还能有效应对数据缺失及样本聚类挑战。其核心逻辑在于利用“邻近度矩阵”(Proximity Matrix)量化样本间的相似性:若两个样本在树中落入同一叶节点,则视为相似。通过迭代优化填补训练集中的缺失值,并利用多数投票机制处理新样本的缺失分类变量,从而提升模型鲁棒性。
📊 关键事实与论据
- 训练集缺失数据处理(迭代法):
- 初始猜测: 对于分类变量(如“血管阻塞”),取同类别中最常见值;对于数值型变量(如“体重”),取中位数。例如,无心脏病患者中“否”最常见,体重中位数为 167.5。
- 计算邻近度: 构建随机森林后,将所有数据穿过所有树。若样本落入同一叶节点,在邻近度矩阵对应位置加 1。最终将计数除以树的总数(如 10 棵)得到平均邻近度。
- 迭代优化: 利用邻近度重新估算缺失值。分类变量比较“是”与“否”的平均邻近度,选高者;数值型变量计算加权平均值(权重基于邻近度)。重复此过程 6-7 次直至收敛。
- 新样本缺失数据处理(投票法):
- 当对新样本进行分类但存在缺失特征时,创建该特征的多个副本(如“有阻塞”和“无阻塞”两个版本)。
- 将这两个副本分别穿过森林中的树,统计哪个版本被正确分类的次数更多。例如,“是”在 3 棵树中均被正确标记,而“否”仅在 1 棵中被正确标记,则选择“是”。
- 样本聚类应用:
- 邻近度矩阵可转化为距离矩阵(距离 = 1 - 邻近度)。
- 基于此距离矩阵,无论数据类型如何(排名、多选、数值等),均可绘制热图(Heat Map)或多维尺度分析图(MDS Plot),直观展示样本间的关联结构。
🎯 结论
随机森林通过构建邻近度矩阵,实现了从“猜测”到“精确估算”的缺失值填补闭环。对于训练数据,采用迭代收敛策略;对于新预测数据,采用基于分类准确率的投票策略。此外,该方法天然支持对任意类型数据进行样本聚类可视化,极大地扩展了随机森林在探索性数据分析中的应用价值。
👤 同一博主
来自父亲的另外三条人生经验
单纯形算法的数学细节
线性规划优化与单纯形算法
假发现率(FDR)详解
线性回归的本质
用超简单的方式解释AI的工作原理
StatQuest:来自科技行业领袖的职业建议
人类反馈强化学习(RLHF)详解
基于神经网络的强化学习:数学细节
基于神经网络的强化学习:核心概念
🧭 类似博主
-
最佳顺畅稳定机场 1000多Mbps,支持Win 安卓 IOS Mac 全平台,GPT/Gemini
-
人类正式进入埃米时代?!台积电1.6nm进入量产倒计时,深度剖析A16的技术密码
-
无影无踪,核周报9.5
-
取代 OpenAI 模型的方法:我換了這套繁中字幕流程
-
苹果9月9日iPhone发布会:我们期待的一切!
-
Cassie Coppersmith(卡茜·科珀史密斯)的伪考古学谬论
-
一个视频搞懂DeepSeek Harness!
-
约翰·特纳斯(John Ternus)出任CEO、法律纠纷及iPhone Fold登上AppleIn
-
为什么 DDR5 内存的性能表现往往不如预期?
-
明天就要開會,我卻什麼都沒準備!Genspark Super Agent 能救我嗎?
0 条评论
发表评论
请先 登录 后参与讨论。