MLA-C01 Udemy Companion

第 05 章 · PDF 第 420-532 页

模型训练、调优与评估

本章目标是把“训练曲线和业务错误成本”转换为动作:调数据、调容量、调正则化、调超参数,或换指标;同时用 SageMaker 的实验、调优、诊断和注册能力保持可重复性。

优先级:高 D2.2、D2.3 建议 75 分钟 练习 12 题

1. Epoch、step、batch 和 learning rate

概念含义改变后的典型影响
Epoch模型完整看过训练集一次太少欠拟合;太多可能过拟合
Batch size一次参数更新使用的样本数大 batch 吞吐高、梯度稳但占内存;小 batch 噪声大
Step/iteration完成一次参数更新每 epoch 的 steps 约为样本数 / batch size
Learning rate每次更新的步长过大震荡/发散;过小收敛慢或停在平台

增大 batch size 往往需要重新调整 learning rate。看训练速度时要区分“每 step 更快”“每 epoch 更少 step”和“最终达到目标指标所需时间”。

2. 深度学习结构只记任务边界

结构/概念擅长考试辨识
Feed-forward / MLP一般表格或固定向量层间前向连接,无时序状态
CNN图像和局部空间模式卷积核、共享权重、平移局部特征
RNN/LSTM/GRU序列与时间依赖循环状态;长序列可能有梯度问题
Transformer文本和长距离依赖,亦扩展到多模态self-attention、并行训练;下一章展开
Transfer Learning小型领域数据复用预训练表示,冻结部分层或微调

激活函数

3. 先看训练/验证曲线,再谈过拟合

现象判断优先动作
训练和验证都差欠拟合/高偏差增加容量或有效特征、训练更久、减弱正则化
训练很好、验证明显差过拟合/高方差更多数据、增强、正则化、早停、简化模型
训练继续改善、验证开始恶化过拟合拐点在最佳验证点早停并保存 checkpoint
训练/验证都好、生产差分布变化或泄漏检查 split、特征一致性、漂移和指标定义

正则化工具

方法机制辨识点
L1惩罚权重绝对值促进稀疏,部分权重变为零
L2 / weight decay惩罚权重平方/收缩权重平滑降低权重,不强调稀疏
Dropout训练时随机关闭神经元减少共同适应,推理时关闭 dropout
Early stopping验证指标不再改善时停止节约训练并减少过拟合
Data augmentation生成保持标签的训练变化图像翻转/裁剪、文本或音频增强

4. 收敛问题按曲线和资源分层

症状可能原因动作
loss 在高值震荡或 NaNlearning rate 过大、数值溢出、坏数据降低 LR、gradient clipping、检查输入/混合精度
loss 几乎不变LR 太小、梯度消失、冻结错层、数据管道错误调 LR/初始化/激活,检查梯度与标签
梯度爆炸深层/循环网络累乘gradient clipping、归一化、较小 LR
梯度消失饱和激活、深链式乘积ReLU 族、残差连接、归一化、LSTM/Transformer
GPU 利用率低、I/O wait 高数据加载/网络瓶颈优化输入、prefetch、文件格式、并行数据加载

SageMaker Debugger 的 debugging 能力分析张量和不收敛问题,profiler 能力分析 CPU/GPU、I/O 和框架操作。CloudWatch 日志告诉你训练程序发生了什么;Debugger 更靠近训练内部状态和性能瓶颈。

5. 指标由错误成本决定

分类

指标公式/含义优先场景
Accuracy正确预测 / 全部样本类别平衡且错误成本接近
PrecisionTP / (TP + FP)误报代价高,如错误封禁正常用户
RecallTP / (TP + FN)漏报代价高,如漏诊或漏欺诈
F1precision 与 recall 的调和平均需要单值平衡两者
ROC-AUC跨阈值的 TPR/FPR 排序能力一般二分类排序比较
PR-AUC跨阈值的 precision-recall 权衡正类极少时更有解释力

改变分类阈值会沿曲线移动 precision/recall,但不会重新训练模型。先选业务可接受的错误成本,再定阈值;不要默认 0.5。

回归

指标特点注意
MAE绝对误差平均,单位与目标相同对极端误差相对稳健
MSE平方误差平均更重罚大误差,单位平方
RMSEMSE 的平方根重罚大误差,恢复目标单位
相对均值基线解释的方差比例可为负;不能单独说明业务误差大小
MAPE绝对百分比误差平均目标接近 0 时不稳定

6. Bagging、boosting 与 stacking

方法训练关系主要效果
Bagging多个模型并行在 bootstrap 样本上训练平均预测,降低方差;Random Forest 是代表
Boosting模型序列地关注前一轮错误/残差组合弱学习器,降低偏差;XGBoost/LightGBM
Stacking元模型学习组合基础模型输出利用异构模型互补,但需严格 out-of-fold 防泄漏

7. Automatic Model Tuning (AMT)

AMT 运行多个训练任务,在你定义的超参数范围内搜索,以最大化或最小化一个明确的 objective metric。先确保单个训练任务能成功并正确上报指标,再启动调优。

策略适合权衡
Grid离散、较小搜索空间,需要穷举维度增加后成本快速爆炸
Random高维空间、强并行、稳健基线不利用已有试验反馈
Bayesian单次训练昂贵,希望根据历史结果智能选点并行度过高会减少序列学习优势
Hyperband迭代算法按 epoch 报告中间指标早停差配置并重分配资源;不适合无中间结果任务

8. Autopilot、Experiments、Debugger 与 TensorBoard

能力解决的问题输出/价值
SageMaker Autopilot自动探索表格数据的候选管道和模型候选模型、排行榜、notebook、解释性报告
SageMaker Experiments组织和比较多次 ML run参数、指标、工件和 lineage
SageMaker Debugger训练张量异常和资源瓶颈规则状态、profiling report、调试洞察
TensorBoard on SageMaker可视化深度学习训练指标和图loss/metric 曲线、分布、图结构
Model Registry模型版本、元数据、审批和发布门禁model package group 与 version

状态提示:Debugger 将于 2026-07-30 后停止新客户接入,但当前 MLA-C01 D2.3 仍明确要求用它调试收敛。考试掌握“张量/收敛/Profiler”边界,现实新架构同时评估框架原生 profiler、CloudWatch 和开源工具。

9. Model Registry 是版本与审批系统

训练和评估模型,保存指标、数据/代码 lineage 与模型工件。
把模型注册为 Model Package Group 中的新 version。
状态先设为 PendingManualApproval,或由 Pipeline 条件判断。
评审通过后改为 Approved,触发 CI/CD 部署。
若失败则 Rejected;保留版本用于审计和回滚。

Model Registry 不保存训练数据本身,也不自动代表模型安全。它集中模型包、推理容器、指标、元数据、版本和审批状态,让发布流程可重复、可审计。

10. 加速、容错与成本

能力作用线索
Managed Spot Training使用可中断 Spot 容量降低训练成本配 checkpoint;max_wait 要覆盖等待/中断
Checkpointing定期把训练状态写到 S3Spot 恢复、长训练容错、从中断继续
Warm Pools训练后保留已初始化实例供后续 job 复用减少重复容器启动/下载延迟;闲置仍可能收费
Data Parallel每个 worker 有完整模型,处理不同数据 mini-batch模型放得下单设备,数据/吞吐需要扩展
Model Parallel把模型切到多个设备模型无法放入单 GPU/单节点内存
EFA低延迟高吞吐的实例间网络分布式训练通信瓶颈
MiCS / sharding切分参数、梯度和优化器状态超大模型内存效率
Training Compiler图和硬件优化以加速 GPU 训练现有 DLC 可用,但已无新版本/补丁
诊断顺序:先确认瓶颈是数据、计算、内存还是网络,再选 FastFile/FSx、GPU、model parallel 或 EFA。堆更多实例可能放大通信开销。

章节练习

这些题要求把训练曲线、错误成本和 AWS 能力连接起来。

第 1 题 · 单选

训练 loss 持续下降,但验证 loss 在第 8 个 epoch 后上升。最直接的解释和动作是什么?

第 2 题 · 单选

癌症筛查中漏掉阳性病例的代价远高于误报。首要优化哪项指标?

第 3 题 · 匹配

把方法与主要效果匹配。

第 4 题 · 单选

极度不平衡的欺诈模型需要比较排序质量。哪个指标通常比 accuracy 更有信息?

第 5 题 · 单选

AMT 要调一个每个 epoch 都上报验证指标的神经网络,希望快速停止差配置并把资源给更好配置。应选什么策略?

第 6 题 · 排序

排列受控模型发布的基本顺序。

第 7 题 · 多选

长时间训练要使用 Managed Spot Training,并在中断后尽量从近期状态继续。需要哪些措施?选择两项。

第 8 题 · 单选

模型无法放入单张 GPU 显存,但训练数据可正常分片。最直接的并行方向是什么?

第 9 题 · 单选

训练作业出现 GPU 利用率低、CPU 高和 I/O wait 高。哪项工具最适合分析训练资源瓶颈?

第 10 题 · 多选

哪些现象更可能来自 learning rate 过大?选择两项。

第 11 题 · 单选

回归业务特别不能接受少量非常大的误差,并希望指标保留目标变量的单位。应优先什么?

第 12 题 · 单选

同类短训练任务频繁执行,每次容器和依赖初始化占用大量时间。哪项能力可复用已初始化训练实例?

本章掌握线:80%

尚未提交

主来源与复习动作

找一条你工作中的训练曲线,尝试用本章四层语言描述:拟合状态、优化状态、资源状态、业务指标。说不清的层就是下一次追问重点。