第 1 题 · 匹配
把问题与证据服务匹配。
第 10 章 · PDF 第 734-805 页
本章训练“证据路由”:性能指标去 CloudWatch,跨服务请求路径去 X-Ray,API 操作去 CloudTrail,资源配置与合规去 Config,分析与成本再进入 Quick 和成本工具。
| 概念 | 含义 | ML 例子 |
|---|---|---|
| Namespace | 指标的顶层容器 | AWS/SageMaker |
| Metric | 随时间变化的数值 | ModelLatency、Invocations、CPUUtilization |
| Dimension | 标识不同时间序列的键值 | EndpointName、VariantName、InstanceId |
| Statistic | 时间窗口内的聚合 | Average、Sum、Min、Max、p95/p99 |
| Period | 聚合时间粒度 | 1 分钟或更长窗口 |
平均延迟可能掩盖长尾,应根据 SLA 监控 p95/p99。错误计数通常看 Sum,资源利用率常看 Average/Max,不能机械地对所有指标使用同一 statistic。
Metric Streams 把近实时指标持续传给 Firehose/外部监控;GetMetricData/仪表盘用于查询和展示。它们解决的是指标分发与观察,不替代原始应用日志。
| 能力 | 用途 | 注意 |
|---|---|---|
| Log group / stream | 组织来源和实例的日志事件 | 设置 retention,避免无限存储 |
| Logs Insights | 交互查询、解析、聚合日志 | 按扫描数据收费,缩小时间/组范围 |
| Metric filter | 把匹配日志模式转成指标 | 可进一步创建 alarm |
| Subscription filter | 近实时发送日志到 Lambda/Kinesis/Firehose | 与一次性 S3 export 不同 |
| Export to S3 | 归档或离线分析 | 不是连续实时流式导出 |
| Unified Agent | 从 EC2/on-prem 收集 logs 和额外系统指标 | 内存/磁盘指标通常需 agent |
多账户/多 Region 环境可集中日志和指标到观测账户。集中化不等于所有团队都应拥有原始敏感 payload;仍需最小权限和日志脱敏。
| 类型 | 作用 | 例子 |
|---|---|---|
| Metric alarm | 一个指标/metric math 超过阈值 | p95 ModelLatency 高于 SLA |
| Composite alarm | 组合多个 alarm 状态减少噪声 | 高延迟 AND 高错误率才通知 |
| Anomaly detection alarm | 基于历史模式生成动态预期带 | 季节性流量的异常变化 |
状态包括 OK、ALARM、INSUFFICIENT_DATA。Alarm 可通知 SNS、触发 Auto Scaling 或自动化动作;部署 guardrails 用 alarm 决定是否回滚。合理设置 evaluation periods 和 datapoints to alarm,避免单点毛刺。
| 指标 | 解释 | 高值时先看 |
|---|---|---|
| ModelLatency | 模型容器处理请求的时间 | 模型计算、batching、实例、容器代码 |
| OverheadLatency | SageMaker 平台传送请求/响应增加的时间 | payload、冷启动、认证/路由、请求频率 |
| Invocation4XXErrors | 客户端/请求类错误 | schema、content type、权限、payload |
| Invocation5XXErrors | 服务/模型容器错误 | 容器日志、超时、内存、依赖 |
| InvocationsPerInstance | 每个 variant 实例归一化的调用量 | target tracking auto scaling |
| ModelSetupTime | 启动新计算并准备模型的时间 | Serverless 冷启动、模型大小、容器初始化 |
客户端端到端延迟还包括客户端到 SageMaker Runtime API 的网络延迟。不要把所有延迟都归咎于模型:先分解 network、overhead、model 三段。
| 概念 | 含义 |
|---|---|
| Trace | 一次请求跨组件的完整路径 |
| Segment | 一个服务对请求完成的工作 |
| Subsegment | segment 内的下游调用或局部工作 |
| Service map | 服务依赖、延迟和错误的可视拓扑 |
| Annotation | 可索引/过滤的键值 |
| Metadata | 附加上下文,通常不可索引 |
X-Ray 适合 API Gateway → Lambda → 推理 endpoint → 数据库的跨服务延迟定位。它不替代模型质量/漂移监控,也不会自动收集未 instrument 的所有内部逻辑。
2026 年 Amazon QuickSight 已重命名并扩展为 Amazon Quick。课件和考试题仍可能使用 QuickSight 名称;把它们视为同一产品演进。
| 能力 | 用途 | 权衡 |
|---|---|---|
| Direct query | 直接查询来源 | 数据新鲜,性能受来源影响 |
| SPICE | 内存式列存储引擎 | 交互快、减轻来源压力,但要刷新和容量 |
| Dashboard/visual | 共享 KPI、时间趋势、分布和模型运营视图 | 读者/作者权限与 row-level security |
| ML/GenAI insights | 异常、预测、自然语言和生成式分析能力 | 功能随 Quick 平台演进 |
图表按问题选:时间变化用 line,类别比较用 bar,相关性用 scatter/heat map,目标对比用 KPI/gauge,层级占比用 tree map。饼图不适合大量类别和细微比较。
| 事件 | 覆盖 | 例子 |
|---|---|---|
| Management events | 控制面资源操作 | CreateEndpoint、UpdateModelPackage、PutRolePolicy |
| Data events | 高容量资源级数据操作,需显式配置并付费 | S3 GetObject、Lambda Invoke |
| Insights events | 识别异常 API 调用率/错误率 | 突然大量失败的 endpoint 更新 API |
Event history 提供近期 management events;需要长期、跨账户审计时创建 trail,把事件送到 S3,并可接 CloudWatch Logs/EventBridge。CloudTrail 记录 API 活动,不记录模型内部预测内容。
Config 回答“这个 security group 何时变成不合规、当时配置是什么”;CloudTrail 回答“谁调用 API 改了它”。二者结合才形成完整调查。
| 问题 | 首选 |
|---|---|
| endpoint p99 延迟何时超过阈值? | CloudWatch Metrics/Alarm |
| 某次请求在哪个微服务最慢? | AWS X-Ray trace |
| 谁批准/更新了模型或 IAM policy? | AWS CloudTrail |
| 资源配置何时偏离合规基线? | AWS Config |
| 容器为什么抛出 stack trace? | CloudWatch Logs |
记忆:CloudWatch 看运行,X-Ray 看路径,CloudTrail 看动作,Config 看状态。
| 工具 | 主要动作 | 题干线索 |
|---|---|---|
| Cost Explorer | 分析历史成本/使用并预测趋势 | 按服务、tag、account 分组,找花在哪里 |
| AWS Budgets | 设置成本/使用/覆盖率阈值并通知或执行动作 | 达到实际/预测预算时告警 |
| Billing and Cost Management | 账单、成本类别、分摊、CUR 等总入口 | 详细账务和成本治理 |
| Trusted Advisor | 基于检查给出成本、性能、安全等建议 | 闲置/低利用资源建议 |
| Compute Optimizer | 基于使用指标推荐资源规格 | rightsize 支持的计算资源 |
| Inference Recommender | 针对模型进行实例与 endpoint 负载测试 | 延迟/吞吐/成本的模型推理选择 |
每题先问:我要的是指标、日志、trace、API 审计、配置历史还是成本动作?
第 1 题 · 匹配
把问题与证据服务匹配。
第 2 题 · 单选
SageMaker endpoint 的 ModelLatency 正常,但 OverheadLatency 只在 serverless 扩容时飙升。最可能是什么?
第 3 题 · 单选
要在高延迟且高错误率同时发生时才通知,以减少单一告警噪声。应使用什么?
第 4 题 · 单选
需要近实时把日志持续发送到 Kinesis Data Streams 供检测系统消费。应使用什么?
第 5 题 · 单选
要查询某 IAM principal 在过去一年调用过哪些 SageMaker 控制面 API。最佳数据源是什么?
第 6 题 · 单选
资源必须持续检查“所有 SageMaker endpoint 都启用指定 tag”,并自动修复不合规项。应使用什么?
第 7 题 · 匹配
把成本动作与工具匹配。
第 8 题 · 多选
哪些做法能降低 CloudWatch Logs 成本?选择两项。
第 9 题 · 单选
分析团队希望仪表盘交互快,并避免每次点击都查询 Redshift。应使用什么?
第 10 题 · 单选
CloudWatch 中某 endpoint 的 5XX 错误增加。下一步最直接查看什么?
第 11 题 · 多选
哪些指标更适合为 endpoint 自动扩缩提供直接负载信号?选择两项。
第 12 题 · 单选
平均延迟满足 SLA,但少量用户经常超时。下一步应重点查看什么?
尚未提交
从最近一次生产事件中各找一条 metric、log、trace、CloudTrail event 和配置状态。缺少哪种证据,就写下它本来能回答什么问题。