有标签吗?
有目标值是监督学习;没有目标值才进入聚类、降维、异常或主题模型。
D2.1 核心参考 · 2026-09-13 官方清单校准
业务词只是背景,不是答案。先确定有没有标签、要输出什么,再看数据结构、不平衡和错误代价,算法通常会缩小到两三个候选。
01
考试中按顺序划题干,先不要看算法选项。
有目标值是监督学习;没有目标值才进入聚类、降维、异常或主题模型。
类别、连续值、未来序列、异常分数、主题、embedding、边界框或像素标签。
普通表格、高维稀疏交互、相关序列、对象对、文本、图像,还是实体-IP 配对。
非线性交互、类别特征、规模、延迟、解释性、缺失值、少量标注或概率预测。
类别不平衡时,明确 FP/FN 成本,再决定权重、阈值、采样和评估指标。
考纲证据:MLA-C01 D2.1 明确要求理解算法能力与适用场景,并依据数据、问题、性能和成本比较模型;D2.3 要求按场景选择混淆矩阵、F1、precision、recall、ROC/AUC 等指标。
02
先改写成“输入 → 输出”,再路由。
| 题干业务词 | 真正问题 | 优先候选 | 决定性线索 |
|---|---|---|---|
| 欺诈 / 流失 / 购买 / 违约 | 已有正负标签的表格二分类 | XGBoost、LightGBM、CatBoost、Linear Learner、AutoGluon | 不平衡不改变“监督分类”;它改变样本权重、阈值与指标。 |
| 欺诈 / 异常交易 | 没有欺诈标签,只找偏离正常模式的数据点 | Random Cut Forest | 输出是 anomaly score,不是预定义类别。 |
| 可疑登录 | 用户或账号与 IPv4 的异常关联 | IP Insights | 题干出现 entity-IP pair 是专用信号。 |
| 预测性维护 | 无标签传感器异常 | Random Cut Forest | 目标是尽早发现异常行为或突变。 |
| 预测性维护 | 预测未来传感器标量轨迹 | DeepAR | 多台设备的相关序列、未来窗口和分位数。 |
| 预测性维护 | 预测是否故障 / 故障类型 / 剩余寿命 | 表格分类器 / 表格回归器 | 已有 fail/no-fail、类别或连续目标标签。 |
| 推荐 / 点击率 | 超高维稀疏特征的二阶交互 | Factorization Machines | 用户、物品、上下文 one-hot 交互。 |
| 相似商品 / 句子对 | 学习两个对象的关系或低维表示 | Object2Vec | 训练单元是 object pair,而非普通行分类。 |
| 需求 / 销量预测 | 大量相关的一维时间序列概率预测 | DeepAR | 多个 SKU/门店共享模式,输出 P10/P50/P90。 |
| 文档归类 | 有预定义标签的文本分类 | BlazingText 或 Text Classification - TensorFlow | 前者强调大规模快速训练;后者强调预训练模型迁移学习。 |
| 文档主题发现 | 无标签词袋语料的 topic modeling | LDA 或 NTM | 主题事先未知;不是文本分类。 |
| 视觉识别 | 整图 / 对象位置 / 每像素 | Image Classification / Object Detection / Semantic Segmentation | 看输出粒度,不看“识别”这个笼统动词。 |
03
不平衡是一组训练与评估策略,不是一种模型。
scale_pos_weight 或实例权重;Linear Learner 二分类可用 positive_example_weight_mult。漏掉正类代价高
欺诈漏报、严重疾病漏诊。可用 F-beta 且 beta > 1 强调 recall,同时监控误报。
误报代价高
误封正常交易、把正常邮件拦截。需要在目标 precision 下最大化 recall。
两者都重要
F1 给单值平衡,混淆矩阵保留 TP/FP/FN/TN 的业务含义。
比较全部阈值
ROC-AUC 衡量跨阈值排序能力;稀有正类还应查看 precision-recall 曲线,最终阈值仍由成本决定。
| 实现 | 不平衡抓手 | 考试级理解 |
|---|---|---|
| XGBoost | scale_pos_weight;csv_weights | 前者平衡正负类,常从负样本数/正样本数试起;后者为每个样本提供实例权重。 |
| Linear Learner | positive_example_weight_mult | 二分类正例权重可设 balanced、auto 或数值;还能按 F-beta、目标 recall 下的 precision 等标准选模型。 |
| Linear Learner | balance_multiclass_weights | 只适用于 multiclass_classifier,不要拿它解释二分类流失题。 |
| 任意概率分类器 | 采样、阈值、成本敏感指标 | 模型输出概率后,阈值不是固定真理;业务成本往往比默认 0.5 更重要。 |
一句话记忆:先选“能做这个监督任务”的模型,再处理不平衡。不要因为少数类很少就从二分类跳到 RCF。
04
点击算法展开。多个条目可以同时打开,便于横向比较。
结构化表格、有标签、关系非线性,或需要成熟梯度提升树。欺诈、流失、信用风险、转化率都常是候选,但业务名称本身不构成选择理由。
顺序叠加弱树修正残差;支持正则化、缺失值处理、多种目标与排序。eta、max_depth、min_child_weight、subsample 和早停控制容量。
scale_pos_weight 和实例权重是关键抓手。它不是无标签异常检测;没有欺诈标签且只需异常分数时看 RCF。
表格数据需要高效 GBDT,题干强调训练速度、内存效率或大规模稀疏特征。
GOSS 保留大梯度样本,EFB 捆绑互斥特征以提升效率。核心复杂度抓手是叶子数、学习率和 boosting rounds。
与 XGBoost 同属 boosting,不是 bagging。官方 SageMaker 内置实现使用 CSV、File mode、单实例 CPU,题目若强调分布式输入先核对具体实现。
表格数据含大量高基数 categorical features,希望减少手工 one-hot 与目标编码工作。
梯度提升树,使用 ordered boosting,并提供专门的类别特征处理方法。
“类别特征”指输入列类型,不等于“分类任务”;CatBoost 也可回归。当前 SageMaker 内置实现为 CSV、File mode、单实例 CPU。
题干强调最少模型开发工作、混合列类型、快速达到较高表格精度,且可接受模型组合带来的资源成本。
自动识别列类型、预处理,并训练树模型与神经网络等多个模型;通过 bagging 和多层 stacking 组合预测。
它是表格 AutoML 算法实现,不等于整个 SageMaker Autopilot 服务。准确率可能强,但解释、延迟和成本需单独验证。
决策边界近似线性、需要快速可解释基线,或题目候选中只有它能处理带标签分类。输入特征尺度通常值得标准化。
并行探索多个损失和模型;支持 L1/L2、自动归一化、二分类正例权重,以及按 F-beta、precision/recall 目标选择模型。
它不会自动学习复杂非线性交互。流失题若同时强调强类别-数值交互,XGBoost/CatBoost 通常更自然;若选项只有 Linear Learner、RCF、K-Means、NTM,则 Linear Learner 因监督分类边界胜出。
CTR、广告或推荐场景,用户、物品和上下文经过 one-hot 后极度稀疏,并且需要学习特征两两交互。
在线性项之外,用低维因子经济地估计 pairwise interactions;num_factors 控制交互表示容量。
它不只是用户-物品矩阵分解,还能加入上下文特征。SageMaker 训练常用稀疏 RecordIO-protobuf,支持 File/Pipe 和并行训练。
局部邻域结构可靠,数据规模和延迟允许在索引中搜索邻居;无需假设线性边界。
非参数方法:分类取邻居标签,回归聚合邻居目标。可进行样本和特征维度缩减。
对特征尺度与高维距离退化敏感;预测成本通常高于训练成本。K-Means 是无标签分群,k-NN 是有标签预测。
表格任务含类别特征,希望用深度学习的上下文表示捕获类别列之间的关系。
使用 Transformer self-attention 生成 contextual embeddings,再与连续特征结合预测。
不要仅因看到“Transformer”就用于任意文本任务。它面向 tabular data;小数据或严格低成本时树模型/线性基线常更直接。
有数百到数万条相关的一维序列,要预测未来窗口并得到概率分布或 P10/P50/P90。
RNN 全局模型跨序列共享信息;prediction_length 定义预测范围,context_length 定义历史上下文。
它预测未来 scalar series,不直接等于异常检测或 fail/no-fail 分类。单纯给当前传感器点打异常分用 RCF。
训练样本天然是对象对,例如句子-句子、用户-商品、商品-商品,并有关系标签或可从行为构造的标签。
两个可配置 encoder 将高维对象编码为 dense embedding,可输出关系分数或把表示交给下游模型。
与 Word2Vec 不同,它不局限于词与上下文;与 FM 不同,它强调对象对编码,不是普通稀疏表格的二阶项。
没有异常标签,需要从有规律的数值数据中找到尖峰、突变或难以归类的数据点。
通过随机切割树隔离数据点,异常点更容易被少量切割分离;输出连续 anomaly score,阈值需按业务校准。
有可靠欺诈/故障标签时优先监督分类;多条序列的未来值预测用 DeepAR。RCF 训练不因 GPU 获益。
数据是 entity identifier 与 IPv4 address 配对,要识别某个实体不常使用的 IP。
学习实体和 IP 的向量表示及正常关联模式,为配对产生 anomaly score,可作为下游安全模型特征。
一般设备/交易数值异常用 RCF;已有恶意登录标签则可训练监督分类器。
没有标签,要做客户分群、样本探索或构造 cluster 特征,且距离到质心有意义。
反复分配最近 centroid 并更新中心;k 决定分群粒度,初始化与特征缩放影响结果。
不能直接预测已定义的 churn/fraud 标签;k-NN 才是利用带标签邻居做分类/回归。
高维连续特征需要压缩、去相关、可视化前处理,或降低下游训练成本。
主成分是原始特征的线性组合并彼此不相关;regular 模式适合稀疏中等数据,randomized 模式适合观测和特征都很大。
PCA 是 feature extraction,不是按标签挑列的 feature selection,也不产生 cluster assignment。
要训练 CBOW/skip-gram 词表示,或对分词后的文本做高效多类、多标签监督分类。
CBOW 通常更快;skip-gram 更适合从较少数据学习稀有词;batch skip-gram 面向更快训练。
没有预定义类别而要发现主题时用 LDA/NTM;输入输出都是 token sequence 时用 Seq2Seq。
文本已有类别标签,题干强调用预训练模型进行 transfer learning 或 fine-tuning。
基于可用预训练 TensorFlow 模型微调,减少从零训练所需数据与时间。
BlazingText 的核心识别词是 Word2Vec 和高效文本分类;本算法的核心识别词是预训练模型迁移学习。
没有文档标签,要把语料表示成若干潜在主题的混合,并希望使用经典、概率可解释的词袋模型。
每个文档是主题概率混合,每个主题是词概率分布;忽略词序,词形还原通常有帮助。
LDA 在这里指 Latent Dirichlet Allocation,不是 Linear Discriminant Analysis。已有类别标签时不是主题模型问题。
无标签文档主题发现,题干明确 neural topic modeling,或希望把文档潜在表示交给下游分类/检索。
从词分布推断文档的 latent representation;支持 validation loss 与 early stopping。
NTM 与 LDA 解决同类问题但算法不同,结果不保证一致;它不是 churn/fraud 的表格分类器。
有配对序列训练数据,例如翻译、摘要、语音 token 到文本 token。
encoder-decoder RNN/CNN 加 attention;训练要求 RecordIO-Protobuf 与源/目标词表,只支持单机多 GPU。
输出一个固定类别时是文本分类,不是 Seq2Seq;输出未来连续数值序列时看 DeepAR。
问题是“整张图是什么”。MXNet 实现支持 multi-label;TensorFlow 实现强调使用预训练 TensorFlow Hub 模型迁移学习。
MXNet 可从零训练或迁移学习;标注只需要图像级类别,成本低于框或像素 mask。
需要物体位置用 Object Detection;需要精确形状与每像素类别用 Semantic Segmentation。
一张图中可能有多个对象,要知道每个对象是什么以及在哪里。
输出对象标签、置信度与矩形框;TensorFlow 实现支持预训练模型迁移学习。
框只给粗位置,不给精确轮廓;若每个像素都要分类,选择 Semantic Segmentation。
自动驾驶道路区域、医学影像组织或遥感土地覆盖,需要对象形状和像素级 mask。
可选 FCN、PSP 或 DeepLabV3,使用 ResNet50/101 backbone;训练标注是与图像对应的像素 mask。
标注成本最高;如果边界框足够就用 Object Detection,如果只要整图类别就用 Image Classification。
05
错题第 15 题考的是组合机制,不是某个 AWS 服务。
| 方法 | 如何训练 | 主要作用 | 题干信号 |
|---|---|---|---|
| Bagging | 同类基学习器在不同 bootstrap 子集上并行训练,再平均/投票 | 降低方差、提高稳定性 | 并行、重采样、同一模型族、Random Forest |
| Boosting | 弱学习器顺序训练,后续模型修正前面错误/残差 | 降低偏差,构造强学习器 | sequential、focus on errors、XGBoost/LightGBM/CatBoost |
| Stacking | 不同基础模型的预测作为 meta-model 输入 | 学习如何组合异质模型优势 | logistic + tree + SVM,再用二级模型融合 |
| Voting | 直接多数投票或概率平均,没有学习二级组合器 | 简单稳健的融合 | majority vote、weighted average |
第 15 题:“多个不同类型模型的预测作为另一个模型的输入”是 stacking。Bagging 的关键不是“用了多个模型”,而是 bootstrap + 并行 + 通常同类学习器。
06
重点修正能迁移到新题的判断规则,而不是背原题答案。
Q27 · 欺诈 + 极端不平衡 + boosting
它满足“监督二分类 + 非线性表格 + boosting”,并提供 scale_pos_weight 与实例权重。XGBoost 不会仅因名称自动解决不平衡;仍需设置权重、选指标和调阈值。
Q28 · 流失 + 四个候选
RCF、K-Means、NTM 都不使用 churn 标签。Linear Learner 可用 positive_example_weight_mult 处理二分类正例权重,但题干的“强类别-数值交互”并不是线性模型优势;若 XGBoost/CatBoost 在选项中,应重新比较。
Q48 · 预测性维护
无标签传感器异常分数选 RCF;大量设备未来标量轨迹选 DeepAR;已有故障标签选分类器;剩余寿命是回归。不能从“预测性维护”四个字直接跳到 DeepAR。
Q50 · 不平衡二分类指标
若题目要求直接理解 FP/FN,precision/recall 与 confusion matrix 最贴切。ROC-AUC 仍是有效的跨阈值排序指标,并非错误概念;只是该题限定选择两项且强调具体错误类型。
| 错题 | 实际考点 | 一句纠偏 |
|---|---|---|
| Q13 | Pipelines 编排 | CallbackStep 让管道等待外部 Glue 工作流完成;它不是模型选择。 |
| Q18 | 可解释性 | 单样本 Shapley 是 local;PDP 展示数据集层面的边际趋势,是 global。 |
| Q25 | 优化稳定性 | 训练与验证损失都高且振荡,先怀疑 learning rate 过高并降低它。 |
| Q32 | 模型改进优先级 | 先诊断数据/特征和训练问题,再扩大昂贵的 HPO 搜索。 |
| Q37 | 模型治理 | Model Registry 用 model group 与 model version 管理模型,不用 S3/ECR/tags 代替。 |
| Q46 | IAM | SageMaker notebook 使用 IAM role;IAM group 只能包含用户,不能附给计算资源。 |
| Q59 | Clarify 偏差 | CDD 比较给定条件下不同群组标签结果的差异。 |
| Q60 | 训练输入模式 | FastFile 是 S3 输入模式,不能与 FSx 路径组合;给定选项中 Pipe 才成立。 |
07
算法清单与关键参数以 AWS 当前文档为准。
说明:本页把 MXNet/TensorFlow 的图像实现合并成三个视觉任务族来记忆,但在详情中保留实现差异。SageMaker JumpStart 的预训练模型范围更广,不应与“经典内置算法目录”混为一张死记清单。