MLA-C01 Udemy Companion

第 10 章 · PDF 第 734-805 页

管理与治理

本章训练“证据路由”:性能指标去 CloudWatch,跨服务请求路径去 X-Ray,API 操作去 CloudTrail,资源配置与合规去 Config,分析与成本再进入 Quick 和成本工具。

优先级:高 D4.1、D4.2、D4.3 建议 60 分钟 练习 12 题

1. CloudWatch Metrics:时间序列,不是日志行

概念含义ML 例子
Namespace指标的顶层容器AWS/SageMaker
Metric随时间变化的数值ModelLatency、Invocations、CPUUtilization
Dimension标识不同时间序列的键值EndpointName、VariantName、InstanceId
Statistic时间窗口内的聚合Average、Sum、Min、Max、p95/p99
Period聚合时间粒度1 分钟或更长窗口

平均延迟可能掩盖长尾,应根据 SLA 监控 p95/p99。错误计数通常看 Sum,资源利用率常看 Average/Max,不能机械地对所有指标使用同一 statistic。

Metric Streams 把近实时指标持续传给 Firehose/外部监控;GetMetricData/仪表盘用于查询和展示。它们解决的是指标分发与观察,不替代原始应用日志。

2. CloudWatch Logs:事件文本与结构化记录

能力用途注意
Log group / stream组织来源和实例的日志事件设置 retention,避免无限存储
Logs Insights交互查询、解析、聚合日志按扫描数据收费,缩小时间/组范围
Metric filter把匹配日志模式转成指标可进一步创建 alarm
Subscription filter近实时发送日志到 Lambda/Kinesis/Firehose与一次性 S3 export 不同
Export to S3归档或离线分析不是连续实时流式导出
Unified Agent从 EC2/on-prem 收集 logs 和额外系统指标内存/磁盘指标通常需 agent

多账户/多 Region 环境可集中日志和指标到观测账户。集中化不等于所有团队都应拥有原始敏感 payload;仍需最小权限和日志脱敏。

3. Alarm 把观察转为动作

类型作用例子
Metric alarm一个指标/metric math 超过阈值p95 ModelLatency 高于 SLA
Composite alarm组合多个 alarm 状态减少噪声高延迟 AND 高错误率才通知
Anomaly detection alarm基于历史模式生成动态预期带季节性流量的异常变化

状态包括 OK、ALARM、INSUFFICIENT_DATA。Alarm 可通知 SNS、触发 Auto Scaling 或自动化动作;部署 guardrails 用 alarm 决定是否回滚。合理设置 evaluation periods 和 datapoints to alarm,避免单点毛刺。

4. SageMaker endpoint 指标如何定位延迟

指标解释高值时先看
ModelLatency模型容器处理请求的时间模型计算、batching、实例、容器代码
OverheadLatencySageMaker 平台传送请求/响应增加的时间payload、冷启动、认证/路由、请求频率
Invocation4XXErrors客户端/请求类错误schema、content type、权限、payload
Invocation5XXErrors服务/模型容器错误容器日志、超时、内存、依赖
InvocationsPerInstance每个 variant 实例归一化的调用量target tracking auto scaling
ModelSetupTime启动新计算并准备模型的时间Serverless 冷启动、模型大小、容器初始化

客户端端到端延迟还包括客户端到 SageMaker Runtime API 的网络延迟。不要把所有延迟都归咎于模型:先分解 network、overhead、model 三段。

主来源:SageMaker metrics in CloudWatch

5. AWS X-Ray:一次请求经过了哪里

概念含义
Trace一次请求跨组件的完整路径
Segment一个服务对请求完成的工作
Subsegmentsegment 内的下游调用或局部工作
Service map服务依赖、延迟和错误的可视拓扑
Annotation可索引/过滤的键值
Metadata附加上下文,通常不可索引

X-Ray 适合 API Gateway → Lambda → 推理 endpoint → 数据库的跨服务延迟定位。它不替代模型质量/漂移监控,也不会自动收集未 instrument 的所有内部逻辑。

6. Amazon Quick(原 Amazon QuickSight)

2026 年 Amazon QuickSight 已重命名并扩展为 Amazon Quick。课件和考试题仍可能使用 QuickSight 名称;把它们视为同一产品演进。

能力用途权衡
Direct query直接查询来源数据新鲜,性能受来源影响
SPICE内存式列存储引擎交互快、减轻来源压力,但要刷新和容量
Dashboard/visual共享 KPI、时间趋势、分布和模型运营视图读者/作者权限与 row-level security
ML/GenAI insights异常、预测、自然语言和生成式分析能力功能随 Quick 平台演进

图表按问题选:时间变化用 line,类别比较用 bar,相关性用 scatter/heat map,目标对比用 KPI/gauge,层级占比用 tree map。饼图不适合大量类别和细微比较。

7. CloudTrail:谁在何时调用了哪个 API

事件覆盖例子
Management events控制面资源操作CreateEndpoint、UpdateModelPackage、PutRolePolicy
Data events高容量资源级数据操作,需显式配置并付费S3 GetObject、Lambda Invoke
Insights events识别异常 API 调用率/错误率突然大量失败的 endpoint 更新 API

Event history 提供近期 management events;需要长期、跨账户审计时创建 trail,把事件送到 S3,并可接 CloudWatch Logs/EventBridge。CloudTrail 记录 API 活动,不记录模型内部预测内容。

8. AWS Config:资源现在和以前是怎么配置的

Config 回答“这个 security group 何时变成不合规、当时配置是什么”;CloudTrail 回答“谁调用 API 改了它”。二者结合才形成完整调查。

9. 四种证据对照

问题首选
endpoint p99 延迟何时超过阈值?CloudWatch Metrics/Alarm
某次请求在哪个微服务最慢?AWS X-Ray trace
谁批准/更新了模型或 IAM policy?AWS CloudTrail
资源配置何时偏离合规基线?AWS Config
容器为什么抛出 stack trace?CloudWatch Logs

记忆:CloudWatch 看运行,X-Ray 看路径,CloudTrail 看动作,Config 看状态。

主来源:AWS CloudTrail or Amazon CloudWatch?

10. 成本工具按动作分层

工具主要动作题干线索
Cost Explorer分析历史成本/使用并预测趋势按服务、tag、account 分组,找花在哪里
AWS Budgets设置成本/使用/覆盖率阈值并通知或执行动作达到实际/预测预算时告警
Billing and Cost Management账单、成本类别、分摊、CUR 等总入口详细账务和成本治理
Trusted Advisor基于检查给出成本、性能、安全等建议闲置/低利用资源建议
Compute Optimizer基于使用指标推荐资源规格rightsize 支持的计算资源
Inference Recommender针对模型进行实例与 endpoint 负载测试延迟/吞吐/成本的模型推理选择

章节练习

每题先问:我要的是指标、日志、trace、API 审计、配置历史还是成本动作?

第 1 题 · 匹配

把问题与证据服务匹配。

第 2 题 · 单选

SageMaker endpoint 的 ModelLatency 正常,但 OverheadLatency 只在 serverless 扩容时飙升。最可能是什么?

第 3 题 · 单选

要在高延迟且高错误率同时发生时才通知,以减少单一告警噪声。应使用什么?

第 4 题 · 单选

需要近实时把日志持续发送到 Kinesis Data Streams 供检测系统消费。应使用什么?

第 5 题 · 单选

要查询某 IAM principal 在过去一年调用过哪些 SageMaker 控制面 API。最佳数据源是什么?

第 6 题 · 单选

资源必须持续检查“所有 SageMaker endpoint 都启用指定 tag”,并自动修复不合规项。应使用什么?

第 7 题 · 匹配

把成本动作与工具匹配。

第 8 题 · 多选

哪些做法能降低 CloudWatch Logs 成本?选择两项。

第 9 题 · 单选

分析团队希望仪表盘交互快,并避免每次点击都查询 Redshift。应使用什么?

第 10 题 · 单选

CloudWatch 中某 endpoint 的 5XX 错误增加。下一步最直接查看什么?

第 11 题 · 多选

哪些指标更适合为 endpoint 自动扩缩提供直接负载信号?选择两项。

第 12 题 · 单选

平均延迟满足 SLA,但少量用户经常超时。下一步应重点查看什么?

本章掌握线:80%

尚未提交

主来源与复习动作

从最近一次生产事件中各找一条 metric、log、trace、CloudTrail event 和配置状态。缺少哪种证据,就写下它本来能回答什么问题。