第 1 题 · 匹配
把活动匹配到最直接的 ML 生命周期阶段。
第 11 章 · PDF 第 806-838 页
把模型从“离线分数不错”推进到“持续创造业务价值、可安全运行、可审计和可恢复”。本章用生命周期、Well-Architected 六支柱与 Responsible AI 三层视角组织所有判断。
| 阶段 | 核心问题 | 可验证产物 | 常见 AWS 能力 |
|---|---|---|---|
| 业务目标识别 | 为什么做,成功给谁带来什么价值? | 业务 KPI、ROI、风险与负责人 | 成本工具、Model Cards 的业务信息 |
| ML 问题框定 | ML 是否合适,属于什么任务? | 标签、预测单元、基线、ML 指标和约束 | SageMaker Canvas/Studio、Experiments |
| 数据处理 | 数据是否可用、代表性足够且不泄漏? | 版本化数据、质量报告、特征定义 | S3、Glue、Data Wrangler、Feature Store |
| 模型开发 | 哪种方案在约束下优于基线? | 训练工件、评估、偏差/解释报告 | Training、AMT、Clarify、Experiments |
| 模型部署 | 如何以可控方式服务并回退? | 已批准模型、部署配置、回滚门槛 | Model Registry、Pipelines、deployment guardrails |
| 模型监控 | 模型、数据、系统和业务是否仍健康? | 告警、漂移报告、反馈与再训练决策 | Model Monitor、CloudWatch、EventBridge |
生命周期是反馈环:监控发现真实分布和业务目标变化,可能回到数据处理、问题框定,甚至重新判断 ML 是否仍值得使用。自动再训练也不代表自动发布;高风险场景通常保留评估和审批门。
| 层 | 示例 | 考试中的作用 |
|---|---|---|
| 业务 KPI | 减少欺诈损失、提高留存、缩短处理时间 | 最终是否值得上线 |
| 模型指标 | PR-AUC、recall、RMSE、NDCG | 与业务错误成本相匹配 |
| 系统 SLO | p99 延迟、吞吐、可用性、恢复时间 | 决定推理与部署架构 |
| Responsible AI 门槛 | 群体 FNR 差距、解释覆盖率、隐私与安全测试 | 不能被总体 accuracy 抵消 |
考试判断:“最佳模型”不是分数最高的模型,而是在业务、技术、风险和成本约束下满足发布条件的模型。
| 链路 | 要保留的证据 | 失效时的典型症状 |
|---|---|---|
| 数据链 | 来源、schema、质量、标签、特征、版本和许可 | 泄漏、偏差、训练/推理不一致 |
| 模型链 | 代码、镜像、参数、数据、实验、模型版本和评估 | 无法复现、无法解释版本差异 |
| 发布链 | 审批、部署策略、流量、alarm、回滚和责任人 | 坏版本全量上线且无法恢复 |
| 反馈链 | 线上输入、预测、ground truth、漂移、业务结果 | 只知道 endpoint 在线,不知道模型已失效 |
模块化的数据、训练、评估和部署步骤应有清晰输入输出,并通过版本与 lineage 连接。Feature Store 可减少训练/服务特征不一致,Model Registry 管理候选模型与批准状态,Pipelines 编排可复现步骤,但每项能力都需要 IAM、加密、监控和生命周期策略配套。
| 支柱 | ML 关键问题 | 典型措施 |
|---|---|---|
| 卓越运营 | 谁负责,变更是否自动、可观察、可复现? | IaC、Pipelines、runbook、指标和反馈环 |
| 安全性 | 数据、模型、镜像、凭证和 endpoint 如何保护? | 最小权限、KMS、VPC endpoint、扫描和审计 |
| 可靠性 | 依赖或模型版本失败后如何恢复? | 多 AZ 托管能力、版本、重试、回滚、降级路径 |
| 性能效率 | 资源、算法和推理形态是否匹配工作负载? | 基准测试、AMT、Inference Recommender、自动扩缩 |
| 成本优化 | 价值是否覆盖全生命周期成本? | Spot、按需推理、rightsize、tag、预算和清理 |
| 可持续性 | 能否减少不必要的计算、存储和数据移动? | 复用模型/特征、合适 Region、生命周期和弹性资源 |
同一个设计通常影响多支柱。例如训练 Spot 降低成本和资源浪费,但必须 checkpoint 才能保持可靠性;增加超大实例可能降低单次延迟,却提高成本与环境负担。题目问“最符合要求”时要识别它优先优化哪个约束。
AWS 当前 Responsible AI Lens 分列十个维度;较早材料常把“隐私与安全”“真实性与鲁棒性”各合并,因此会看到八组表述。概念没有冲突,考试时按题干语义选择措施。
| 维度 | 核心问题 | 可观测证据 |
|---|---|---|
| 可控性 | 能否监控、限制、暂停或纠正行为? | guardrail、人工复核、kill switch、升级流程 |
| 隐私 | 数据是否被合法、必要且适度地获取和使用? | 最小化、保留策略、脱敏、同意与用途记录 |
| 安全 | 数据和模型是否抵御泄露及对抗输入? | IAM、加密、隔离、扫描、审计和红队测试 |
| 安全性 | 是否阻止有害输出和误用? | 内容过滤、拒绝主题、测试集和应急处置 |
| 真实性 | 输出在事实层面是否正确? | groundedness、来源引用、事实核验 |
| 鲁棒性 | 预期外、噪声或对抗输入下是否仍可靠? | 压力、边缘、扰动和 adversarial 测试 |
| 公平性 | 不同利益相关群体受到的影响是否可接受? | 分群指标、偏差报告、缓解与持续监控 |
| 可解释性 | 能否理解和评估模型行为或单次输出? | 特征归因、局部/全局解释、解释验证 |
| 透明度 | 利益相关者能否知情选择是否使用系统? | 预期用途、限制、数据来源和 AI 使用披露 |
| 治理 | 供应链、角色、政策和决策是否可问责? | 审批、lineage、Model Card、审计和定期复核 |
关键区别:公平性看群体影响;可解释性解释行为;透明度向利益相关者披露能力与限制;治理确保组织持续执行这些要求。
| 能力 | 最直接的作用 | 不能单独保证 |
|---|---|---|
| SageMaker Clarify | 训练前/后偏差、特征归因和解释 | 自动决定何种公平标准适合业务 |
| Model Cards | 记录预期/非预期用途、风险、训练和评估详情 | 模型实际符合文档中的承诺 |
| Model Dashboard | 集中查看模型、endpoint、监控和风险信息 | 替代所有审批与事故流程 |
| Model Registry | 版本、元数据、状态和部署审批 | 候选模型本身质量足够 |
| Model Monitor | 数据/模型质量、偏差和特征归因漂移 | 没有 ground truth 时凭空得出真实 accuracy |
| CloudTrail/Lineage | 追踪 API 动作与 ML 工件关系 | 解释某个预测为何产生 |
| Bedrock Guardrails | 过滤有害内容、拒绝主题和敏感信息等 | 消除所有 hallucination 和业务风险 |
| IAM/KMS/VPC/Macie | 访问、加密、网络和敏感数据发现 | 数据用途本身合法、必要且公平 |
“模型表现不错”无法作为质量门。有效发布条件包含指标、阈值、评估数据、置信要求、责任人和失败动作,例如:
上线后继续比较业务 KPI、模型质量、分群影响和系统 SLO。只有在新数据通过质量与评估门后才进入发布;不要把“检测到漂移”直接等同于“立刻自动部署新模型”。
| 反模式 | 为什么危险 | 更好的做法 |
|---|---|---|
| 从算法开始,而没有业务 KPI | 可能优化无业务价值的代理指标 | 先定义动作、基线、价值和错误成本 |
| 只看总体 accuracy | 掩盖类别不平衡和群体差异 | 选择任务指标并做分群评估 |
| 一次性 notebook 手工上线 | 不可复现、不可审计、难以回滚 | 版本化 pipeline、registry 和 IaC |
| 离线测试通过就全量替换 | 线上流量和依赖与测试环境不同 | shadow/canary/linear + alarm rollback |
| 只监控 CPU 和 endpoint 200 | 系统在线时模型仍可能漂移或伤害业务 | 系统、数据、模型、Responsible AI、业务五层监控 |
| 用工具名称代替治理 | 报告存在不等于有人决策和行动 | 定义 owner、阈值、审批、响应和证据保留 |
答题时先圈出“必须”“最低运维”“最具成本效益”“近实时”“可审计”等约束,再用这十问排除只解决局部问题的选项。
每题先定位生命周期阶段、主要风险或优先支柱,再选服务与控制。
第 1 题 · 匹配
把活动匹配到最直接的 ML 生命周期阶段。
第 2 题 · 单选
税率由一组稳定、公开且必须精确执行的规则决定。团队没有历史标签,却计划训练分类模型。最佳建议是什么?
第 3 题 · 多选
在开始模型开发前,哪些信息最能形成可执行的问题定义?选择三项。
第 4 题 · 匹配
把措施匹配到它最直接优化的 Well-Architected 支柱。
第 5 题 · 多选
贷款模型上线前,哪些做法直接支持公平性、可解释性和透明度?选择三项。
第 6 题 · 单选
总体 recall 稳定,但一个关键群体的 false negative rate 明显上升。主要涉及哪个 Responsible AI 维度?
第 7 题 · 排序
按主要生命周期顺序排列六个阶段。
第 8 题 · 单选
审查人员需要理解单次高风险预测中各输入特征的贡献。哪项能力最直接?
第 9 题 · 多选
哪些是可执行的模型发布门?选择三项。
第 10 题 · 单选
团队想验证模型在拼写错误、缺失字段、极端值和刻意扰动输入下是否仍可靠。主要测试什么?
第 11 题 · 单选
夜间没有请求,但一个超配 GPU endpoint 始终运行。业务允许首个请求等待。哪个改进最符合成本和可持续性目标?
第 12 题 · 多选
Model Monitor 报告数据漂移,同时业务转化下降。哪些下一步最合理?选择三项。
尚未提交
选一个你工作中的 SageMaker Pipeline:分别写出业务 KPI、最贵错误、一个 Responsible AI 风险、发布门和回滚条件。若其中任意项无法明确回答,它就是本周最值得补的工程工作。