首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >建立机器学习模型时,先划分数据集还是先对数据进行标准化?

建立机器学习模型时,先划分数据集还是先对数据进行标准化?

作者头像
咕泡科技
发布2026-09-01 13:54:21
发布2026-09-01 13:54:21
680
举报
概述
在机器学习建模流程中,数据标准化、数据集划分是最基础的预处理步骤,但90%的新手甚至部分进阶开发者都会踩一个致命坑:颠倒二者执行顺序。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、核心结论(直接记死)
  • 二、标准正确建模流程(工业级规范)
    • 2.1 核心链路
    • 2.2 建模核心底线
    • 2.3 完整可运行代码(Sklearn)
  • 三、错误流程解析:先标准化后划分(致命数据泄露)
    • 3.1 错误代码示例
    • 3.2 问题本质
  • 四、数据泄露的三大严重后果
    • 4.1 模型离线评估指标严重虚高
    • 4.2 交叉验证场景隐蔽泄露(最难排查)
    • 4.3 小数据集场景危害呈指数级放大
  • 五、通用规则:所有预处理操作均适用
  • 六、举个栗子,助力吃透核心逻辑
  • 七、流程对比总结
  • 八、多说一句:如果数据量极大时,训练集分布和全量数据几乎一致,能否先标准化再划分?
  • 九、建模铁律
  • 结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档