MLA-C01 Udemy Companion

第 11 章 · PDF 第 806-838 页

ML 最佳实践

把模型从“离线分数不错”推进到“持续创造业务价值、可安全运行、可审计和可恢复”。本章用生命周期、Well-Architected 六支柱与 Responsible AI 三层视角组织所有判断。

优先级:高 贯穿 D1-D4 建议 65 分钟 练习 12 题

1. 六阶段生命周期:不是一次性流水线

阶段核心问题可验证产物常见 AWS 能力
业务目标识别为什么做,成功给谁带来什么价值?业务 KPI、ROI、风险与负责人成本工具、Model Cards 的业务信息
ML 问题框定ML 是否合适,属于什么任务?标签、预测单元、基线、ML 指标和约束SageMaker Canvas/Studio、Experiments
数据处理数据是否可用、代表性足够且不泄漏?版本化数据、质量报告、特征定义S3、Glue、Data Wrangler、Feature Store
模型开发哪种方案在约束下优于基线?训练工件、评估、偏差/解释报告Training、AMT、Clarify、Experiments
模型部署如何以可控方式服务并回退?已批准模型、部署配置、回滚门槛Model Registry、Pipelines、deployment guardrails
模型监控模型、数据、系统和业务是否仍健康?告警、漂移报告、反馈与再训练决策Model Monitor、CloudWatch、EventBridge

生命周期是反馈环:监控发现真实分布和业务目标变化,可能回到数据处理、问题框定,甚至重新判断 ML 是否仍值得使用。自动再训练也不代表自动发布;高风险场景通常保留评估和审批门。

官方框架:Best practices by ML lifecycle

2. 从业务目标到可训练问题

先判断 ML 是否是正确工具

用四层指标防止“优化错目标”

示例考试中的作用
业务 KPI减少欺诈损失、提高留存、缩短处理时间最终是否值得上线
模型指标PR-AUC、recall、RMSE、NDCG与业务错误成本相匹配
系统 SLOp99 延迟、吞吐、可用性、恢复时间决定推理与部署架构
Responsible AI 门槛群体 FNR 差距、解释覆盖率、隐私与安全测试不能被总体 accuracy 抵消

考试判断:“最佳模型”不是分数最高的模型,而是在业务、技术、风险和成本约束下满足发布条件的模型。

3. 端到端架构应保留四条链

链路要保留的证据失效时的典型症状
数据链来源、schema、质量、标签、特征、版本和许可泄漏、偏差、训练/推理不一致
模型链代码、镜像、参数、数据、实验、模型版本和评估无法复现、无法解释版本差异
发布链审批、部署策略、流量、alarm、回滚和责任人坏版本全量上线且无法恢复
反馈链线上输入、预测、ground truth、漂移、业务结果只知道 endpoint 在线,不知道模型已失效

模块化的数据、训练、评估和部署步骤应有清晰输入输出,并通过版本与 lineage 连接。Feature Store 可减少训练/服务特征不一致,Model Registry 管理候选模型与批准状态,Pipelines 编排可复现步骤,但每项能力都需要 IAM、加密、监控和生命周期策略配套。

4. Well-Architected 六支柱在 ML 中问什么

支柱ML 关键问题典型措施
卓越运营谁负责,变更是否自动、可观察、可复现?IaC、Pipelines、runbook、指标和反馈环
安全性数据、模型、镜像、凭证和 endpoint 如何保护?最小权限、KMS、VPC endpoint、扫描和审计
可靠性依赖或模型版本失败后如何恢复?多 AZ 托管能力、版本、重试、回滚、降级路径
性能效率资源、算法和推理形态是否匹配工作负载?基准测试、AMT、Inference Recommender、自动扩缩
成本优化价值是否覆盖全生命周期成本?Spot、按需推理、rightsize、tag、预算和清理
可持续性能否减少不必要的计算、存储和数据移动?复用模型/特征、合适 Region、生命周期和弹性资源

同一个设计通常影响多支柱。例如训练 Spot 降低成本和资源浪费,但必须 checkpoint 才能保持可靠性;增加超大实例可能降低单次延迟,却提高成本与环境负担。题目问“最符合要求”时要识别它优先优化哪个约束。

5. ML 设计原则

官方来源:Well-Architected ML design principles

6. Responsible AI:把风险变成可测试要求

AWS 当前 Responsible AI Lens 分列十个维度;较早材料常把“隐私与安全”“真实性与鲁棒性”各合并,因此会看到八组表述。概念没有冲突,考试时按题干语义选择措施。

维度核心问题可观测证据
可控性能否监控、限制、暂停或纠正行为?guardrail、人工复核、kill switch、升级流程
隐私数据是否被合法、必要且适度地获取和使用?最小化、保留策略、脱敏、同意与用途记录
安全数据和模型是否抵御泄露及对抗输入?IAM、加密、隔离、扫描、审计和红队测试
安全性是否阻止有害输出和误用?内容过滤、拒绝主题、测试集和应急处置
真实性输出在事实层面是否正确?groundedness、来源引用、事实核验
鲁棒性预期外、噪声或对抗输入下是否仍可靠?压力、边缘、扰动和 adversarial 测试
公平性不同利益相关群体受到的影响是否可接受?分群指标、偏差报告、缓解与持续监控
可解释性能否理解和评估模型行为或单次输出?特征归因、局部/全局解释、解释验证
透明度利益相关者能否知情选择是否使用系统?预期用途、限制、数据来源和 AI 使用披露
治理供应链、角色、政策和决策是否可问责?审批、lineage、Model Card、审计和定期复核

关键区别:公平性看群体影响;可解释性解释行为;透明度向利益相关者披露能力与限制;治理确保组织持续执行这些要求。

当前定义:AWS Well-Architected Responsible AI Lens

7. AWS 工具不是维度本身,而是控制措施

能力最直接的作用不能单独保证
SageMaker Clarify训练前/后偏差、特征归因和解释自动决定何种公平标准适合业务
Model Cards记录预期/非预期用途、风险、训练和评估详情模型实际符合文档中的承诺
Model Dashboard集中查看模型、endpoint、监控和风险信息替代所有审批与事故流程
Model Registry版本、元数据、状态和部署审批候选模型本身质量足够
Model Monitor数据/模型质量、偏差和特征归因漂移没有 ground truth 时凭空得出真实 accuracy
CloudTrail/Lineage追踪 API 动作与 ML 工件关系解释某个预测为何产生
Bedrock Guardrails过滤有害内容、拒绝主题和敏感信息等消除所有 hallucination 和业务风险
IAM/KMS/VPC/Macie访问、加密、网络和敏感数据发现数据用途本身合法、必要且公平

延伸阅读:SageMaker Clarify · SageMaker Model Cards

8. 发布条件必须可判定

“模型表现不错”无法作为质量门。有效发布条件包含指标、阈值、评估数据、置信要求、责任人和失败动作,例如:

上线后继续比较业务 KPI、模型质量、分群影响和系统 SLO。只有在新数据通过质量与评估门后才进入发布;不要把“检测到漂移”直接等同于“立刻自动部署新模型”。

官方方法:Responsible AI release criteria

9. 高频反模式

反模式为什么危险更好的做法
从算法开始,而没有业务 KPI可能优化无业务价值的代理指标先定义动作、基线、价值和错误成本
只看总体 accuracy掩盖类别不平衡和群体差异选择任务指标并做分群评估
一次性 notebook 手工上线不可复现、不可审计、难以回滚版本化 pipeline、registry 和 IaC
离线测试通过就全量替换线上流量和依赖与测试环境不同shadow/canary/linear + alarm rollback
只监控 CPU 和 endpoint 200系统在线时模型仍可能漂移或伤害业务系统、数据、模型、Responsible AI、业务五层监控
用工具名称代替治理报告存在不等于有人决策和行动定义 owner、阈值、审批、响应和证据保留

10. 场景题的十问检查表

  1. 业务动作和 KPI 是什么,当前非 ML 基线是什么?
  2. 这是分类、回归、排序、聚类还是生成任务?ML 真的是必要的吗?
  3. 哪种错误最贵,哪个模型指标能反映它?
  4. 训练数据是否代表生产,是否存在泄漏、偏差、许可或隐私问题?
  5. 延迟、吞吐、可用性、成本和 Region 有什么硬约束?
  6. 哪个 Responsible AI 维度正面临风险?
  7. 需要什么证据,以及哪个 AWS 能力收集它?
  8. 谁批准模型,发布门槛能否明确判定?
  9. 如何逐步发布、告警、回滚或降级?
  10. 何时监控、再训练、重新框定或停用模型?

答题时先圈出“必须”“最低运维”“最具成本效益”“近实时”“可审计”等约束,再用这十问排除只解决局部问题的选项。

章节练习

每题先定位生命周期阶段、主要风险或优先支柱,再选服务与控制。

第 1 题 · 匹配

把活动匹配到最直接的 ML 生命周期阶段。

第 2 题 · 单选

税率由一组稳定、公开且必须精确执行的规则决定。团队没有历史标签,却计划训练分类模型。最佳建议是什么?

第 3 题 · 多选

在开始模型开发前,哪些信息最能形成可执行的问题定义?选择三项。

第 4 题 · 匹配

把措施匹配到它最直接优化的 Well-Architected 支柱。

第 5 题 · 多选

贷款模型上线前,哪些做法直接支持公平性、可解释性和透明度?选择三项。

第 6 题 · 单选

总体 recall 稳定,但一个关键群体的 false negative rate 明显上升。主要涉及哪个 Responsible AI 维度?

第 7 题 · 排序

按主要生命周期顺序排列六个阶段。

第 8 题 · 单选

审查人员需要理解单次高风险预测中各输入特征的贡献。哪项能力最直接?

第 9 题 · 多选

哪些是可执行的模型发布门?选择三项。

第 10 题 · 单选

团队想验证模型在拼写错误、缺失字段、极端值和刻意扰动输入下是否仍可靠。主要测试什么?

第 11 题 · 单选

夜间没有请求,但一个超配 GPU endpoint 始终运行。业务允许首个请求等待。哪个改进最符合成本和可持续性目标?

第 12 题 · 多选

Model Monitor 报告数据漂移,同时业务转化下降。哪些下一步最合理?选择三项。

本章掌握线:80%

尚未提交

主来源与复习动作

选一个你工作中的 SageMaker Pipeline:分别写出业务 KPI、最贵错误、一个 Responsible AI 风险、发布门和回滚条件。若其中任意项无法明确回答,它就是本周最值得补的工程工作。