MLA-C01 Udemy Companion

综合模拟 1 · 覆盖面诊断

MLA-C01 综合模拟题 1

25 道原创场景题,覆盖 D1-D4 和单选、多选、排序、匹配四种题型。按正式考试平均速度,建议限时 50 分钟。

目标:80%+ D1 7 · D2 6 · D3 6 · D4 6 25 题 建议 50 分钟

使用方法

  1. 启动计时器后连续完成,不查资料,不使用单题“检查答案”。
  2. 不确定时先做最佳选择并记录题号,不留空题。
  3. 完成后点击底部“提交整套模拟”,查看总分和 Domain 分项。
  4. 复盘时再逐题检查,把错误归为 K/R/C/M/O/T。
剩余时间
50:00

模拟题

第 1 题 · D1 · 单选

数据湖保存数 TB 的历史交易。分析人员经常按日期和国家过滤,当前 CSV 查询扫描成本很高。哪项改动最直接降低 Athena 扫描量并提升性能?

第 2 题 · D1 · 多选

团队需要摄取可重放的点击流,并按用户维护状态、执行 5 分钟窗口聚合。哪些服务最直接组成该方案?选择两项。

第 3 题 · D1 · 匹配

把存储需求与首选 AWS 服务匹配。

第 4 题 · D1 · 单选

实时欺诈 endpoint 需要毫秒级读取客户最新特征,数据科学家还要查询历史特征用于训练。哪项设计最合适?

第 5 题 · D1 · 排序

排列避免预处理数据泄漏的正确顺序。

第 6 题 · D1 · 单选

ETL pipeline 必须在每次运行时验证列完整性、值范围和唯一性规则,并输出质量结果。最直接使用什么?

第 7 题 · D1 · 多选

二分类数据严重不平衡,同时团队要避免评估泄漏。哪些做法合理?选择三项。

第 8 题 · D2 · 单选

团队要对包含数值和类别特征的表格数据预测客户流失,希望使用高性能的 SageMaker 内置监督算法。首选是什么?

第 9 题 · D2 · 单选

市场团队没有标签,希望按购买行为自动发现客户群组。哪种算法最合适?

第 10 题 · D2 · 多选

训练损失持续下降,但验证损失开始上升。哪些措施可直接缓解这种情况?选择三项。

第 11 题 · D2 · 匹配

把任务与最相关的评估指标匹配。

第 12 题 · D2 · 单选

每次训练成本较高,团队希望后续超参数试验利用之前结果,更快搜索有希望的区域。AMT 应优先考虑哪种策略?

第 13 题 · D2 · 排序

排列受治理模型进入部署前的主要顺序。

第 14 题 · D3 · 单选

单个推理请求包含 200 MB 文件,可排队,结果应在 20 分钟内返回,流量会长时间归零。哪种 SageMaker 推理方式最合适?

第 15 题 · D3 · 单选

模型仅需 CPU,请求小于 3 MB,每次必须在 60 秒内完成,流量稀疏且不可预测。团队希望最低运维和空闲成本。首选什么?

第 16 题 · D3 · 多选

哪些做法直接提升 ML workflow 的可复现性和受控发布?选择三项。

第 17 题 · D3 · 匹配

把部署策略与描述匹配。

第 18 题 · D3 · 单选

团队自带推理容器部署到 SageMaker real-time endpoint。容器应实现哪些 HTTP 路径以满足基本服务契约?

第 19 题 · D3 · 排序

排列一次受控模型发布的主要顺序。

第 20 题 · D4 · 单选

安全团队需要确定是谁在昨晚调用了 UpdateEndpoint,并记录源 IP 和请求时间。首选什么?

第 21 题 · D4 · 匹配

把排障问题与最直接的证据来源匹配。

第 22 题 · D4 · 多选

训练作业处理敏感数据,必须私网访问依赖并采用最小权限。哪些措施合理?选择三项。

第 23 题 · D4 · 单选

公司需要自动发现并报告 S3 数据湖中的个人身份信息等敏感数据。应使用什么?

第 24 题 · D4 · 单选

生产 endpoint 暂时拿不到 ground truth,但团队要检测输入特征分布是否偏离训练 baseline。最直接配置什么?

第 25 题 · D4 · 多选

哪些措施能降低 ML 成本,同时保留合理可靠性?选择三项。

模拟目标线:80%

尚未提交

复盘规则

先补低于 75% 的 Domain;若多个 Domain 接近,优先修复重复出现的需求漏读、服务比较和时间错误。至少间隔 48 小时后再重做本卷,避免短期答案记忆造成虚高。