第 1 题 · 单选
训练 loss 持续下降,但验证 loss 在第 8 个 epoch 后上升。最直接的解释和动作是什么?
第 05 章 · PDF 第 420-532 页
本章目标是把“训练曲线和业务错误成本”转换为动作:调数据、调容量、调正则化、调超参数,或换指标;同时用 SageMaker 的实验、调优、诊断和注册能力保持可重复性。
| 概念 | 含义 | 改变后的典型影响 |
|---|---|---|
| Epoch | 模型完整看过训练集一次 | 太少欠拟合;太多可能过拟合 |
| Batch size | 一次参数更新使用的样本数 | 大 batch 吞吐高、梯度稳但占内存;小 batch 噪声大 |
| Step/iteration | 完成一次参数更新 | 每 epoch 的 steps 约为样本数 / batch size |
| Learning rate | 每次更新的步长 | 过大震荡/发散;过小收敛慢或停在平台 |
增大 batch size 往往需要重新调整 learning rate。看训练速度时要区分“每 step 更快”“每 epoch 更少 step”和“最终达到目标指标所需时间”。
| 结构/概念 | 擅长 | 考试辨识 |
|---|---|---|
| Feed-forward / MLP | 一般表格或固定向量 | 层间前向连接,无时序状态 |
| CNN | 图像和局部空间模式 | 卷积核、共享权重、平移局部特征 |
| RNN/LSTM/GRU | 序列与时间依赖 | 循环状态;长序列可能有梯度问题 |
| Transformer | 文本和长距离依赖,亦扩展到多模态 | self-attention、并行训练;下一章展开 |
| Transfer Learning | 小型领域数据 | 复用预训练表示,冻结部分层或微调 |
| 现象 | 判断 | 优先动作 |
|---|---|---|
| 训练和验证都差 | 欠拟合/高偏差 | 增加容量或有效特征、训练更久、减弱正则化 |
| 训练很好、验证明显差 | 过拟合/高方差 | 更多数据、增强、正则化、早停、简化模型 |
| 训练继续改善、验证开始恶化 | 过拟合拐点 | 在最佳验证点早停并保存 checkpoint |
| 训练/验证都好、生产差 | 分布变化或泄漏 | 检查 split、特征一致性、漂移和指标定义 |
| 方法 | 机制 | 辨识点 |
|---|---|---|
| L1 | 惩罚权重绝对值 | 促进稀疏,部分权重变为零 |
| L2 / weight decay | 惩罚权重平方/收缩权重 | 平滑降低权重,不强调稀疏 |
| Dropout | 训练时随机关闭神经元 | 减少共同适应,推理时关闭 dropout |
| Early stopping | 验证指标不再改善时停止 | 节约训练并减少过拟合 |
| Data augmentation | 生成保持标签的训练变化 | 图像翻转/裁剪、文本或音频增强 |
| 症状 | 可能原因 | 动作 |
|---|---|---|
| loss 在高值震荡或 NaN | learning rate 过大、数值溢出、坏数据 | 降低 LR、gradient clipping、检查输入/混合精度 |
| loss 几乎不变 | LR 太小、梯度消失、冻结错层、数据管道错误 | 调 LR/初始化/激活,检查梯度与标签 |
| 梯度爆炸 | 深层/循环网络累乘 | gradient clipping、归一化、较小 LR |
| 梯度消失 | 饱和激活、深链式乘积 | ReLU 族、残差连接、归一化、LSTM/Transformer |
| GPU 利用率低、I/O wait 高 | 数据加载/网络瓶颈 | 优化输入、prefetch、文件格式、并行数据加载 |
SageMaker Debugger 的 debugging 能力分析张量和不收敛问题,profiler 能力分析 CPU/GPU、I/O 和框架操作。CloudWatch 日志告诉你训练程序发生了什么;Debugger 更靠近训练内部状态和性能瓶颈。
| 指标 | 公式/含义 | 优先场景 |
|---|---|---|
| Accuracy | 正确预测 / 全部样本 | 类别平衡且错误成本接近 |
| Precision | TP / (TP + FP) | 误报代价高,如错误封禁正常用户 |
| Recall | TP / (TP + FN) | 漏报代价高,如漏诊或漏欺诈 |
| F1 | precision 与 recall 的调和平均 | 需要单值平衡两者 |
| ROC-AUC | 跨阈值的 TPR/FPR 排序能力 | 一般二分类排序比较 |
| PR-AUC | 跨阈值的 precision-recall 权衡 | 正类极少时更有解释力 |
改变分类阈值会沿曲线移动 precision/recall,但不会重新训练模型。先选业务可接受的错误成本,再定阈值;不要默认 0.5。
| 指标 | 特点 | 注意 |
|---|---|---|
| MAE | 绝对误差平均,单位与目标相同 | 对极端误差相对稳健 |
| MSE | 平方误差平均 | 更重罚大误差,单位平方 |
| RMSE | MSE 的平方根 | 重罚大误差,恢复目标单位 |
| R² | 相对均值基线解释的方差比例 | 可为负;不能单独说明业务误差大小 |
| MAPE | 绝对百分比误差平均 | 目标接近 0 时不稳定 |
| 方法 | 训练关系 | 主要效果 |
|---|---|---|
| Bagging | 多个模型并行在 bootstrap 样本上训练 | 平均预测,降低方差;Random Forest 是代表 |
| Boosting | 模型序列地关注前一轮错误/残差 | 组合弱学习器,降低偏差;XGBoost/LightGBM |
| Stacking | 元模型学习组合基础模型输出 | 利用异构模型互补,但需严格 out-of-fold 防泄漏 |
AMT 运行多个训练任务,在你定义的超参数范围内搜索,以最大化或最小化一个明确的 objective metric。先确保单个训练任务能成功并正确上报指标,再启动调优。
| 策略 | 适合 | 权衡 |
|---|---|---|
| Grid | 离散、较小搜索空间,需要穷举 | 维度增加后成本快速爆炸 |
| Random | 高维空间、强并行、稳健基线 | 不利用已有试验反馈 |
| Bayesian | 单次训练昂贵,希望根据历史结果智能选点 | 并行度过高会减少序列学习优势 |
| Hyperband | 迭代算法按 epoch 报告中间指标 | 早停差配置并重分配资源;不适合无中间结果任务 |
| 能力 | 解决的问题 | 输出/价值 |
|---|---|---|
| SageMaker Autopilot | 自动探索表格数据的候选管道和模型 | 候选模型、排行榜、notebook、解释性报告 |
| SageMaker Experiments | 组织和比较多次 ML run | 参数、指标、工件和 lineage |
| SageMaker Debugger | 训练张量异常和资源瓶颈 | 规则状态、profiling report、调试洞察 |
| TensorBoard on SageMaker | 可视化深度学习训练指标和图 | loss/metric 曲线、分布、图结构 |
| Model Registry | 模型版本、元数据、审批和发布门禁 | model package group 与 version |
状态提示:Debugger 将于 2026-07-30 后停止新客户接入,但当前 MLA-C01 D2.3 仍明确要求用它调试收敛。考试掌握“张量/收敛/Profiler”边界,现实新架构同时评估框架原生 profiler、CloudWatch 和开源工具。
PendingManualApproval,或由 Pipeline 条件判断。Approved,触发 CI/CD 部署。Rejected;保留版本用于审计和回滚。Model Registry 不保存训练数据本身,也不自动代表模型安全。它集中模型包、推理容器、指标、元数据、版本和审批状态,让发布流程可重复、可审计。
| 能力 | 作用 | 线索 |
|---|---|---|
| Managed Spot Training | 使用可中断 Spot 容量降低训练成本 | 配 checkpoint;max_wait 要覆盖等待/中断 |
| Checkpointing | 定期把训练状态写到 S3 | Spot 恢复、长训练容错、从中断继续 |
| Warm Pools | 训练后保留已初始化实例供后续 job 复用 | 减少重复容器启动/下载延迟;闲置仍可能收费 |
| Data Parallel | 每个 worker 有完整模型,处理不同数据 mini-batch | 模型放得下单设备,数据/吞吐需要扩展 |
| Model Parallel | 把模型切到多个设备 | 模型无法放入单 GPU/单节点内存 |
| EFA | 低延迟高吞吐的实例间网络 | 分布式训练通信瓶颈 |
| MiCS / sharding | 切分参数、梯度和优化器状态 | 超大模型内存效率 |
| Training Compiler | 图和硬件优化以加速 GPU 训练 | 现有 DLC 可用,但已无新版本/补丁 |
这些题要求把训练曲线、错误成本和 AWS 能力连接起来。
第 1 题 · 单选
训练 loss 持续下降,但验证 loss 在第 8 个 epoch 后上升。最直接的解释和动作是什么?
第 2 题 · 单选
癌症筛查中漏掉阳性病例的代价远高于误报。首要优化哪项指标?
第 3 题 · 匹配
把方法与主要效果匹配。
第 4 题 · 单选
极度不平衡的欺诈模型需要比较排序质量。哪个指标通常比 accuracy 更有信息?
第 5 题 · 单选
AMT 要调一个每个 epoch 都上报验证指标的神经网络,希望快速停止差配置并把资源给更好配置。应选什么策略?
第 6 题 · 排序
排列受控模型发布的基本顺序。
第 7 题 · 多选
长时间训练要使用 Managed Spot Training,并在中断后尽量从近期状态继续。需要哪些措施?选择两项。
第 8 题 · 单选
模型无法放入单张 GPU 显存,但训练数据可正常分片。最直接的并行方向是什么?
第 9 题 · 单选
训练作业出现 GPU 利用率低、CPU 高和 I/O wait 高。哪项工具最适合分析训练资源瓶颈?
第 10 题 · 多选
哪些现象更可能来自 learning rate 过大?选择两项。
第 11 题 · 单选
回归业务特别不能接受少量非常大的误差,并希望指标保留目标变量的单位。应优先什么?
第 12 题 · 单选
同类短训练任务频繁执行,每次容器和依赖初始化占用大量时间。哪项能力可复用已初始化训练实例?
尚未提交
找一条你工作中的训练曲线,尝试用本章四层语言描述:拟合状态、优化状态、资源状态、业务指标。说不清的层就是下一次追问重点。