MLA-C01 Udemy Companion

第 06 章 · PDF 第 533-556 页

生成式 AI 模型基础

MLA-C01 不要求推导 Transformer 数学,但你需要理解 token、embedding、attention、context、推理参数和迁移方式,才能判断 RAG、微调或托管基础模型是否合适。

优先级:中 D2.1、D2.2 建议 35 分钟 练习 8 题

1. Transformer 解决什么

Transformer 使用 attention 直接建立序列中任意 token 的关系,训练时比传统 RNN 更容易并行,也更能捕获长距离依赖。典型流程是:

Tokenizer 把文本转换为 token ID。
Embedding 把离散 token 映射为稠密向量,并加入位置信息。
多层 self-attention 和前馈网络产生上下文化表示。
输出层产生下一个 token 或任务输出的概率分布。
架构主要用途训练信号
Encoder-only理解、分类、检索 embedding从双向上下文学习表示
Decoder-only自回归文本/代码生成预测下一个 token,使用因果 mask
Encoder-decoder翻译、摘要、序列转换编码输入,解码目标序列

2. Self-attention 的考试级理解

每个 token 产生 Query、Key、Value。Query 与所有 Key 的相似度决定注意力权重,再对 Value 加权求和,得到包含上下文的新表示。

概念作用辨识点
Query当前 token 在寻找什么信息与 Key 计算相关性
Key每个 token 能被匹配的索引表示决定注意力分数
Value真正被加权汇总的内容产生上下文表示
Multi-head attention并行学习多种关系不同 head 可关注语法、指代或位置
Causal mask阻止看到未来 token用于自回归生成

Embedding 是向量表示;attention 是根据当前上下文动态组合表示。向量数据库存 embedding,不存 attention 权重作为主要检索键。

3. 自回归生成是反复预测下一个 token

把 system/user prompt token 化,并放入 context window。
模型计算下一个 token 的概率分布。
按 decoding 参数选择一个 token。
把新 token 加回上下文,重复直到停止条件。

生成不是从数据库“取出完整答案”,也不保证事实正确。模型根据训练与当前上下文产生高概率序列,因此需要 grounding、评估、guardrails 和业务验证。

4. 关键术语与参数

术语含义常见权衡
Token模型处理的文本单位,不等同于单词输入 + 输出 token 影响上下文与成本
Context window一次推理可考虑的 token 范围过长增加延迟/成本,超出部分无法直接使用
Embedding语义对象的稠密向量表示相似度检索、聚类、推荐
Temperature调整概率分布随机性低值更稳定,高值更多样;不等于事实开关
Top-p从累计概率质量达到 p 的候选集中采样与 temperature 都控制生成随机性
Hallucination流畅但缺乏依据或错误的输出用 RAG、引用、验证、限制任务降低风险
Foundation Model在大规模通用数据上预训练、可适配多任务的模型模型大小、能力、延迟、成本和许可

5. Prompt、RAG 与微调解决不同问题

方式改变模型参数适合不擅长
Prompt / few-shot明确任务、格式、语气和少量示例稳定注入大量动态私有知识
RAG最新/私有知识、引用、可更新文档永久改变模型行为或领域风格
Supervised fine-tuning稳定任务行为、格式、语气、领域映射频繁变化的事实库
Continued pre-training大量无标签领域语料,强化领域语言少量明确输入输出任务
Distillation训练学生模型接近教师质量但更低延迟/成本直接增加最新知识来源
一问定方向:缺的是“知识”通常先 RAG;缺的是“行为/格式”通常考虑 fine-tuning;只是任务描述不清先改 prompt。

6. Bedrock、JumpStart 与自建训练

选择适合控制与运维
Amazon Bedrock通过托管 API 使用多家基础模型,构建 RAG、Guardrails、Agents最低基础设施运维,模型/区域能力依供应商
SageMaker JumpStart在 SageMaker 中发现、微调和部署预训练模型/方案更接近 SageMaker 训练和 endpoint 控制
SageMaker 自定义训练自定义架构、训练循环、容器和分布式策略控制最高,工程与成本最高

选择基础模型时比较任务能力、模态、上下文长度、延迟、吞吐、成本、定制支持、区域和合规,而不是只比较参数量。

主来源:SageMaker JumpStartAmazon Bedrock Overview

章节练习

不要计算公式,重点判断每个组件负责什么。

第 1 题 · 单选

Decoder-only 语言模型在生成时使用 causal mask 的主要原因是什么?

第 2 题 · 匹配

把 self-attention 组件与直觉匹配。

第 3 题 · 单选

公司知识库每天更新,回答必须引用最新内部文档。首选哪种适配方式?

第 4 题 · 单选

模型知道所需事实,但输出始终不符合企业固定 JSON schema。大量高质量输入输出示例可用。最合适的下一步是什么?

第 5 题 · 多选

提高 temperature 通常会带来哪些变化?选择两项。

第 6 题 · 单选

哪项最准确地区分 embedding 与 attention?

第 7 题 · 单选

团队希望通过托管 API 快速比较多家基础模型,并尽量少管理推理基础设施。优先选择什么?

第 8 题 · 匹配

把问题与首个适配方向匹配。

本章掌握线:80%

尚未提交

主来源与复习动作

用自己的话解释:“为什么最新公司政策适合 RAG,而固定 JSON 输出可能适合 fine-tuning?”解释发给教师,可以继续追问边界条件。