第 1 题 · D1 · 单选
数据湖保存数 TB 的历史交易。分析人员经常按日期和国家过滤,当前 CSV 查询扫描成本很高。哪项改动最直接降低 Athena 扫描量并提升性能?
综合模拟 1 · 覆盖面诊断
25 道原创场景题,覆盖 D1-D4 和单选、多选、排序、匹配四种题型。按正式考试平均速度,建议限时 50 分钟。
第 1 题 · D1 · 单选
数据湖保存数 TB 的历史交易。分析人员经常按日期和国家过滤,当前 CSV 查询扫描成本很高。哪项改动最直接降低 Athena 扫描量并提升性能?
第 2 题 · D1 · 多选
团队需要摄取可重放的点击流,并按用户维护状态、执行 5 分钟窗口聚合。哪些服务最直接组成该方案?选择两项。
第 3 题 · D1 · 匹配
把存储需求与首选 AWS 服务匹配。
第 4 题 · D1 · 单选
实时欺诈 endpoint 需要毫秒级读取客户最新特征,数据科学家还要查询历史特征用于训练。哪项设计最合适?
第 5 题 · D1 · 排序
排列避免预处理数据泄漏的正确顺序。
第 6 题 · D1 · 单选
ETL pipeline 必须在每次运行时验证列完整性、值范围和唯一性规则,并输出质量结果。最直接使用什么?
第 7 题 · D1 · 多选
二分类数据严重不平衡,同时团队要避免评估泄漏。哪些做法合理?选择三项。
第 8 题 · D2 · 单选
团队要对包含数值和类别特征的表格数据预测客户流失,希望使用高性能的 SageMaker 内置监督算法。首选是什么?
第 9 题 · D2 · 单选
市场团队没有标签,希望按购买行为自动发现客户群组。哪种算法最合适?
第 10 题 · D2 · 多选
训练损失持续下降,但验证损失开始上升。哪些措施可直接缓解这种情况?选择三项。
第 11 题 · D2 · 匹配
把任务与最相关的评估指标匹配。
第 12 题 · D2 · 单选
每次训练成本较高,团队希望后续超参数试验利用之前结果,更快搜索有希望的区域。AMT 应优先考虑哪种策略?
第 13 题 · D2 · 排序
排列受治理模型进入部署前的主要顺序。
第 14 题 · D3 · 单选
单个推理请求包含 200 MB 文件,可排队,结果应在 20 分钟内返回,流量会长时间归零。哪种 SageMaker 推理方式最合适?
第 15 题 · D3 · 单选
模型仅需 CPU,请求小于 3 MB,每次必须在 60 秒内完成,流量稀疏且不可预测。团队希望最低运维和空闲成本。首选什么?
第 16 题 · D3 · 多选
哪些做法直接提升 ML workflow 的可复现性和受控发布?选择三项。
第 17 题 · D3 · 匹配
把部署策略与描述匹配。
第 18 题 · D3 · 单选
团队自带推理容器部署到 SageMaker real-time endpoint。容器应实现哪些 HTTP 路径以满足基本服务契约?
第 19 题 · D3 · 排序
排列一次受控模型发布的主要顺序。
第 20 题 · D4 · 单选
安全团队需要确定是谁在昨晚调用了 UpdateEndpoint,并记录源 IP 和请求时间。首选什么?
第 21 题 · D4 · 匹配
把排障问题与最直接的证据来源匹配。
第 22 题 · D4 · 多选
训练作业处理敏感数据,必须私网访问依赖并采用最小权限。哪些措施合理?选择三项。
第 23 题 · D4 · 单选
公司需要自动发现并报告 S3 数据湖中的个人身份信息等敏感数据。应使用什么?
第 24 题 · D4 · 单选
生产 endpoint 暂时拿不到 ground truth,但团队要检测输入特征分布是否偏离训练 baseline。最直接配置什么?
第 25 题 · D4 · 多选
哪些措施能降低 ML 成本,同时保留合理可靠性?选择三项。
尚未提交
先补低于 75% 的 Domain;若多个 Domain 接近,优先修复重复出现的需求漏读、服务比较和时间错误。至少间隔 48 小时后再重做本卷,避免短期答案记忆造成虚高。