随机森林
概述
随机森林是一种集成学习方法,通过构建多个决策树并将它们的预测结果进行组合来提高预测准确性和控制过拟合。
关键内容
-
集成策略:随机森林结合了两种随机性:bootstrap采样(每棵树在不同的数据子集上训练)和特征随机选择(每个分裂节点只考虑特征的随机子集),从而降低模型的方差和过拟合风险。
-
算法流程:首先通过bootstrap采样从原始训练集中创建多个样本集,然后在每个样本集上训练一个决策树,同时在每个节点分裂时只考虑特征的随机子集,最后通过投票(分类)或平均(回归)的方式整合所有树的预测结果。
-
优势特性:随机森林不需要单独的验证集来估计泛化误差(OOB误差),能够评估特征的重要性,并且对异常值和噪声数据具有较强的鲁棒性。
-
Bagging 扩展:在 Bagging(自举聚合) 基础上,每次分裂时随机选择特征子集,降低树之间的相关性。
-
与深度学习对比:在表格数据领域至今仍与 深度学习 方法竞争,两者形成互补。
来源
- ai_papers_timeline.md — 2001年随机森林提出
- Random Forests (2001 论文) — Leo Breiman的经典论文
相关
- Random Forests (2001 论文) — described_in
- Leo Breiman — created_by
- Decision Trees — composed_of
- Bootstrap Aggregating — uses
- Ensemble Methods — instance_of
- Bagging(自举聚合) — extends
- 决策树 — uses