第 1 题 · 单选
数据集有明显右偏的收入字段,少量极高值是真实记录。需要填补该字段的缺失值并减少离群值影响。最合理的简单基线是什么?
第 02 章 · PDF 第 137-258 页
本章的可迁移技能是:先判断数据问题,再选择转换方法和执行工具,最后验证转换没有制造数据泄漏、训练/推理偏差或新的合规风险。
| 需求 | 优先工具 | 决定性线索 |
|---|---|---|
| 可视化、低代码、面向 ML 的数据流 | SageMaker Data Wrangler | 分析、Quick Model、特征转换、导出 Pipelines/Feature Store |
| 业务分析师无代码清洗和可复用 recipe | AWS Glue DataBrew | profile、250+ 点选转换、输出回 S3 |
| 托管无服务器 ETL、Crawler、Catalog | AWS Glue | 发现 schema、Spark ETL、job、Data Catalog |
| 大规模 Spark/Hadoop,需选框架和集群形态 | Amazon EMR | 更多控制、开源生态、长作业或特殊依赖 |
| 独立的托管预处理或后处理容器 | SageMaker Processing | 自定义脚本/镜像、短期计算资源、Pipeline step |
| S3 上交互式 SQL,不管理集群 | Amazon Athena | serverless、按扫描量计费、Glue Catalog |
当前名称:SageMaker Data Wrangler 已集成到 SageMaker Canvas,但 MLA-C01 考纲和许多题目仍使用 Data Wrangler 名称。遇到旧界面措辞时,考它的能力边界,不考菜单位置。
Amazon EMR 托管 Hadoop、Spark 等大数据框架。它适合需要分布式处理、大量依赖、长时间作业或对运行环境有较多控制的场景。Spark 把转换表示为分布式数据操作,执行器并行处理分区,driver 负责计划和协调。
| 运行形态 | 适合 | 权衡 |
|---|---|---|
| EMR on EC2 | 长期或可预测负载、完整集群控制、广泛 Hadoop 组件 | 要选择节点类型、容量和扩缩策略 |
| EMR Serverless | 间歇性 Spark/Hive 作业、希望免管集群并按使用付费 | 控制面更少,仍需配置应用和容量边界 |
| EMR on EKS | 组织已有 EKS,希望多个团队共享 Kubernetes 资源 | 需要 Kubernetes 平台能力和配额治理 |
| 方法 | 适合 | 风险 |
|---|---|---|
| 删除行/列 | 缺失极少、近似随机,或字段几乎全空 | 损失样本并可能引入选择偏差 |
| 均值/中位数/众数填补 | 需要简单稳定基线;中位数对偏态/离群值更稳健 | 压缩方差,可能扭曲关系 |
| 常量 + 缺失指示器 | “是否缺失”本身有预测信息 | 常量可能被模型误解,需要配套指示特征 |
| 模型或时序填补 | 关系复杂或时间序列具有上下文 | 复杂、昂贵,错误填补会传播 |
不要在完整数据集上计算填充值再切分。应先切分,然后只在训练集拟合 imputer/scaler/encoder,再把同一参数应用到验证、测试和线上数据。
不平衡分类不要只看 accuracy。优先根据业务错误成本选择 precision、recall、F1、PR-AUC 或 ROC-AUC。
| 问题/目标 | 方法 | 判断点 |
|---|---|---|
| 错误离群值 | 修复、删除或按规则拒绝 | 先确认是错误,不要删除真实罕见事件 |
| 长尾数值 | log/Box-Cox、截尾、稳健缩放 | 注意零值、负值和解释性 |
| 尺度不同 | 标准化或归一化 | 距离/梯度模型敏感;树模型通常不敏感 |
| 类别变量 | one-hot、ordinal、target/binary encoding | 高基数与未知类别;target encoding 防泄漏 |
| 连续值分段 | binning | 减少噪声但丢失细节 |
| 文本 | tokenization、TF-IDF、embedding | 词表只能在训练数据拟合 |
TF-IDF 提高在某文档中频繁、但在整个语料中不常见词的权重。n-gram 能保留局部词序,但会迅速增加维度和稀疏性,这就是“维度灾难”在文本特征中的常见表现。
| 能力 | 何时使用 | 人力来源 |
|---|---|---|
| SageMaker Ground Truth | 创建高质量训练标签,可结合自动标注 | 私有 workforce、供应商、Mechanical Turk |
| Ground Truth Plus | 希望 AWS 管理端到端标注项目和质量 | AWS 管理的人力与工作流 |
| Amazon Mechanical Turk | 适合公开、可拆分的大规模微任务 | 公共众包 |
| Amazon Augmented AI (A2I) | 对低置信度或敏感预测触发人工复核 | 私有、供应商或公共 workforce |
Data Wrangler 提供导入、数据流、转换、可视化、Data Insights、target leakage 分析和 Quick Model。数据流可导出到 S3、SageMaker Pipelines、Feature Store 或 Python 脚本,适合把交互式探索变成可重复流程。
Processing job 启动临时托管计算来运行预处理、后处理和评估代码。它能使用预构建或自定义容器,并自然作为 SageMaker Pipeline 的 ProcessingStep。题干强调“自定义 Python/容器、可重复批处理”时,比 Data Wrangler 更直接。
| 阶段 | 能力 | 关键词 |
|---|---|---|
| 训练前 | 分析数据偏差 | Class Imbalance (CI)、Difference in Proportions of Labels (DPL) |
| 训练后 | 解释模型和评估预测偏差 | SHAP、feature attribution、PDP |
| 生产 | Model Monitor + Clarify 监控偏差漂移 | baseline、constraint、schedule、violation |
SHAP 为单次或整体预测分配特征贡献;Partial Dependence Plot 展示目标特征变化与平均预测之间的关系。相关特征很强时,两者都要谨慎解释。
| 存储 | 数据 | 用途 | 读取模式 |
|---|---|---|---|
| Online store | 每个记录的最新特征值 | 实时推理 | 毫秒级低延迟、高吞吐 API |
| Offline store | 追加式历史特征记录 | 探索、训练、批推理、时间点正确数据集 | S3 Parquet + Athena |
| Online + Offline | 同时维护最新值和历史 | 减少 training-serving skew | 流式或批量摄取 |
Feature Group 需要 record identifier 和 event time。event time 支持按事件发生时间组织历史,并帮助创建 point-in-time correct 训练集。在线存储只保留最新记录,不能替代离线历史。
Pipeline 负责步骤依赖和可重复执行;Feature Store 负责特征的存储、发现、共享与训练/服务一致性。二者解决的问题不同,常常一起使用。
| 组件 | 职责 | 高频线索 |
|---|---|---|
| Glue Crawler | 扫描数据源并推断 schema/分区 | 自动发现 S3 数据 |
| Glue Data Catalog | 集中保存表、列、分区等元数据 | Athena/EMR/Glue 共享 catalog |
| Glue ETL / Studio | 无服务器 Spark ETL 与可视化作业 | 转换、job bookmark、最低集群运维 |
| Glue Data Quality | 用 DQDL ruleset 计算质量分数和定位坏记录 | Data Catalog 或 ETL job 质量门禁 |
| Glue DataBrew | 无代码 profile、清洗、recipe | 分析师、点选转换、PII mask |
| Athena | 对 S3/数据湖运行 serverless SQL | 按扫描量计费、workgroup、CTAS、分区 |
SELECT *。Glue Data Quality 使用 DQDL;质量分数是通过规则数占总规则数的比例。它可以在 Data Catalog 上评估静态数据,也能嵌入 Glue ETL job,在装载前隔离失败记录。
| 失败 | 症状 | 预防 |
|---|---|---|
| 数据泄漏 | 离线指标异常高,生产崩溃 | 先切分再拟合转换;移除未来信息和目标代理 |
| 训练/服务偏差 | 同一记录离线与线上特征不同 | 共享转换代码/Feature Store;记录特征版本 |
| schema/质量漂移 | 缺失率、类型、范围或分布改变 | Glue DQ/Data Wrangler insights/Model Monitor baseline |
| 偏差与合规 | 受保护群体表现差、PII 暴露、驻留违规 | Clarify、mask/anonymize、加密、最小权限、区域控制 |
本章题目故意混合“处理方法”和“AWS 工具”。先回答数据科学问题,再回答服务问题。
第 1 题 · 单选
数据集有明显右偏的收入字段,少量极高值是真实记录。需要填补该字段的缺失值并减少离群值影响。最合理的简单基线是什么?
第 2 题 · 单选
团队希望为 Glue Data Catalog 中的表定义 DQDL ruleset,定期计算质量分数并通过 EventBridge 响应失败。应使用什么?
第 3 题 · 单选
数据科学家希望可视化构建 ML 数据准备流,运行 Quick Model 检查特征,并把流程导出到 SageMaker Pipelines。最佳工具是什么?
第 4 题 · 匹配
把需求与最适合的能力匹配。
第 5 题 · 多选
欺诈样本只占 0.2%,漏报代价远高于误报。哪些做法合理?选择两项。
第 6 题 · 单选
公司已有一个长期运行、包含自定义 Hadoop 组件和特殊 Spark 依赖的处理平台,需要最大运行时控制。首选什么?
第 7 题 · 排序
排列无泄漏数据预处理的正确顺序。
第 8 题 · 单选
模型离线表现良好,但线上因同一客户特征的计算逻辑不同而下降。哪项能力最直接降低这种风险?
第 9 题 · 多选
哪些做法能直接减少 Athena 对 S3 数据的扫描量或控制查询成本?选择三项。
第 10 题 · 单选
受监管的医疗图像需要人工创建边界框标签,数据不得交给公众。最佳配置是什么?
尚未提交
合上笔记,画出“原始数据 → 转换 → 质量门禁 → Feature Store → 训练/推理”的流程,并给每一步写一个 AWS 服务。画不顺的部分直接发给教师追问。