MLA-C01 Udemy Companion

第 02 章 · PDF 第 137-258 页

数据转换、完整性与特征工程

本章的可迁移技能是:先判断数据问题,再选择转换方法和执行工具,最后验证转换没有制造数据泄漏、训练/推理偏差或新的合规风险。

优先级:高 D1.2、D1.3 建议 60 分钟 练习 10 题

1. 工具不是同义词:按控制程度和使用者选择

需求优先工具决定性线索
可视化、低代码、面向 ML 的数据流SageMaker Data Wrangler分析、Quick Model、特征转换、导出 Pipelines/Feature Store
业务分析师无代码清洗和可复用 recipeAWS Glue DataBrewprofile、250+ 点选转换、输出回 S3
托管无服务器 ETL、Crawler、CatalogAWS Glue发现 schema、Spark ETL、job、Data Catalog
大规模 Spark/Hadoop,需选框架和集群形态Amazon EMR更多控制、开源生态、长作业或特殊依赖
独立的托管预处理或后处理容器SageMaker Processing自定义脚本/镜像、短期计算资源、Pipeline step
S3 上交互式 SQL,不管理集群Amazon Athenaserverless、按扫描量计费、Glue Catalog

当前名称:SageMaker Data Wrangler 已集成到 SageMaker Canvas,但 MLA-C01 考纲和许多题目仍使用 Data Wrangler 名称。遇到旧界面措辞时,考它的能力边界,不考菜单位置。

2. EMR 与 Spark:何时需要更大的处理引擎

Amazon EMR 托管 Hadoop、Spark 等大数据框架。它适合需要分布式处理、大量依赖、长时间作业或对运行环境有较多控制的场景。Spark 把转换表示为分布式数据操作,执行器并行处理分区,driver 负责计划和协调。

运行形态适合权衡
EMR on EC2长期或可预测负载、完整集群控制、广泛 Hadoop 组件要选择节点类型、容量和扩缩策略
EMR Serverless间歇性 Spark/Hive 作业、希望免管集群并按使用付费控制面更少,仍需配置应用和容量边界
EMR on EKS组织已有 EKS,希望多个团队共享 Kubernetes 资源需要 Kubernetes 平台能力和配额治理
Glue 还是 EMR:“无服务器 ETL、最低运维、Catalog 集成”偏 Glue;“特定 Spark/Hadoop 版本、长集群、复杂依赖、更多底层控制”偏 EMR。

3. 先理解数据问题,再应用转换

缺失值

方法适合风险
删除行/列缺失极少、近似随机,或字段几乎全空损失样本并可能引入选择偏差
均值/中位数/众数填补需要简单稳定基线;中位数对偏态/离群值更稳健压缩方差,可能扭曲关系
常量 + 缺失指示器“是否缺失”本身有预测信息常量可能被模型误解,需要配套指示特征
模型或时序填补关系复杂或时间序列具有上下文复杂、昂贵,错误填补会传播

不要在完整数据集上计算填充值再切分。应先切分,然后只在训练集拟合 imputer/scaler/encoder,再把同一参数应用到验证、测试和线上数据。

类别不平衡

不平衡分类不要只看 accuracy。优先根据业务错误成本选择 precision、recall、F1、PR-AUC 或 ROC-AUC。

离群值与常见转换

问题/目标方法判断点
错误离群值修复、删除或按规则拒绝先确认是错误,不要删除真实罕见事件
长尾数值log/Box-Cox、截尾、稳健缩放注意零值、负值和解释性
尺度不同标准化或归一化距离/梯度模型敏感;树模型通常不敏感
类别变量one-hot、ordinal、target/binary encoding高基数与未知类别;target encoding 防泄漏
连续值分段binning减少噪声但丢失细节
文本tokenization、TF-IDF、embedding词表只能在训练数据拟合

TF-IDF 提高在某文档中频繁、但在整个语料中不常见词的权重。n-gram 能保留局部词序,但会迅速增加维度和稀疏性,这就是“维度灾难”在文本特征中的常见表现。

4. 标注服务:创建标签与复核预测是两件事

能力何时使用人力来源
SageMaker Ground Truth创建高质量训练标签,可结合自动标注私有 workforce、供应商、Mechanical Turk
Ground Truth Plus希望 AWS 管理端到端标注项目和质量AWS 管理的人力与工作流
Amazon Mechanical Turk适合公开、可拆分的大规模微任务公共众包
Amazon Augmented AI (A2I)对低置信度或敏感预测触发人工复核私有、供应商或公共 workforce
隐私线索:医疗图像、客户身份数据或受监管内容通常选择 private workforce,并配置最小权限与加密;不要把敏感数据发给公共众包。

5. SageMaker 数据工具各自负责什么

Data Wrangler

Data Wrangler 提供导入、数据流、转换、可视化、Data Insights、target leakage 分析和 Quick Model。数据流可导出到 S3、SageMaker Pipelines、Feature Store 或 Python 脚本,适合把交互式探索变成可重复流程。

SageMaker Processing

Processing job 启动临时托管计算来运行预处理、后处理和评估代码。它能使用预构建或自定义容器,并自然作为 SageMaker Pipeline 的 ProcessingStep。题干强调“自定义 Python/容器、可重复批处理”时,比 Data Wrangler 更直接。

Clarify 与 Model Monitor

阶段能力关键词
训练前分析数据偏差Class Imbalance (CI)、Difference in Proportions of Labels (DPL)
训练后解释模型和评估预测偏差SHAP、feature attribution、PDP
生产Model Monitor + Clarify 监控偏差漂移baseline、constraint、schedule、violation

SHAP 为单次或整体预测分配特征贡献;Partial Dependence Plot 展示目标特征变化与平均预测之间的关系。相关特征很强时,两者都要谨慎解释。

6. Feature Store 的价值是复用与一致性

存储数据用途读取模式
Online store每个记录的最新特征值实时推理毫秒级低延迟、高吞吐 API
Offline store追加式历史特征记录探索、训练、批推理、时间点正确数据集S3 Parquet + Athena
Online + Offline同时维护最新值和历史减少 training-serving skew流式或批量摄取

Feature Group 需要 record identifier 和 event time。event time 支持按事件发生时间组织历史,并帮助创建 point-in-time correct 训练集。在线存储只保留最新记录,不能替代离线历史。

与你的 Pipelines 经验连接:

Pipeline 负责步骤依赖和可重复执行;Feature Store 负责特征的存储、发现、共享与训练/服务一致性。二者解决的问题不同,常常一起使用。

主来源:SageMaker Feature Store

7. Glue 生态与 Athena

组件职责高频线索
Glue Crawler扫描数据源并推断 schema/分区自动发现 S3 数据
Glue Data Catalog集中保存表、列、分区等元数据Athena/EMR/Glue 共享 catalog
Glue ETL / Studio无服务器 Spark ETL 与可视化作业转换、job bookmark、最低集群运维
Glue Data Quality用 DQDL ruleset 计算质量分数和定位坏记录Data Catalog 或 ETL job 质量门禁
Glue DataBrew无代码 profile、清洗、recipe分析师、点选转换、PII mask
Athena对 S3/数据湖运行 serverless SQL按扫描量计费、workgroup、CTAS、分区

Athena 的考试优化顺序

改成 Parquet/ORC 等列式格式并压缩。
按高频过滤条件合理分区,避免过度小分区。
只选择需要的列,避免 SELECT *
用 workgroup 隔离查询、设置扫描限制和结果位置。
需要重写数据时用 CTAS/INSERT INTO 生成优化后的表。

Glue Data Quality 使用 DQDL;质量分数是通过规则数占总规则数的比例。它可以在 Data Catalog 上评估静态数据,也能嵌入 Glue ETL job,在装载前隔离失败记录。

主来源:AWS Glue Data QualityAthena performance tuning

8. 数据完整性最终看四类失败

失败症状预防
数据泄漏离线指标异常高,生产崩溃先切分再拟合转换;移除未来信息和目标代理
训练/服务偏差同一记录离线与线上特征不同共享转换代码/Feature Store;记录特征版本
schema/质量漂移缺失率、类型、范围或分布改变Glue DQ/Data Wrangler insights/Model Monitor baseline
偏差与合规受保护群体表现差、PII 暴露、驻留违规Clarify、mask/anonymize、加密、最小权限、区域控制
正确处理顺序:定义 split → 在训练集拟合转换 → 应用到验证/测试 → 保存转换工件 → 线上复用 → 监控质量和分布。任何一步在全量数据上偷看未来,都会污染评估。

章节练习

本章题目故意混合“处理方法”和“AWS 工具”。先回答数据科学问题,再回答服务问题。

第 1 题 · 单选

数据集有明显右偏的收入字段,少量极高值是真实记录。需要填补该字段的缺失值并减少离群值影响。最合理的简单基线是什么?

第 2 题 · 单选

团队希望为 Glue Data Catalog 中的表定义 DQDL ruleset,定期计算质量分数并通过 EventBridge 响应失败。应使用什么?

第 3 题 · 单选

数据科学家希望可视化构建 ML 数据准备流,运行 Quick Model 检查特征,并把流程导出到 SageMaker Pipelines。最佳工具是什么?

第 4 题 · 匹配

把需求与最适合的能力匹配。

第 5 题 · 多选

欺诈样本只占 0.2%,漏报代价远高于误报。哪些做法合理?选择两项。

第 6 题 · 单选

公司已有一个长期运行、包含自定义 Hadoop 组件和特殊 Spark 依赖的处理平台,需要最大运行时控制。首选什么?

第 7 题 · 排序

排列无泄漏数据预处理的正确顺序。

第 8 题 · 单选

模型离线表现良好,但线上因同一客户特征的计算逻辑不同而下降。哪项能力最直接降低这种风险?

第 9 题 · 多选

哪些做法能直接减少 Athena 对 S3 数据的扫描量或控制查询成本?选择三项。

第 10 题 · 单选

受监管的医疗图像需要人工创建边界框标签,数据不得交给公众。最佳配置是什么?

本章掌握线:80%

尚未提交

主来源与复习动作

合上笔记,画出“原始数据 → 转换 → 质量门禁 → Feature Store → 训练/推理”的流程,并给每一步写一个 AWS 服务。画不顺的部分直接发给教师追问。