第 1 题 · 单选
Decoder-only 语言模型在生成时使用 causal mask 的主要原因是什么?
第 06 章 · PDF 第 533-556 页
MLA-C01 不要求推导 Transformer 数学,但你需要理解 token、embedding、attention、context、推理参数和迁移方式,才能判断 RAG、微调或托管基础模型是否合适。
Transformer 使用 attention 直接建立序列中任意 token 的关系,训练时比传统 RNN 更容易并行,也更能捕获长距离依赖。典型流程是:
| 架构 | 主要用途 | 训练信号 |
|---|---|---|
| Encoder-only | 理解、分类、检索 embedding | 从双向上下文学习表示 |
| Decoder-only | 自回归文本/代码生成 | 预测下一个 token,使用因果 mask |
| Encoder-decoder | 翻译、摘要、序列转换 | 编码输入,解码目标序列 |
每个 token 产生 Query、Key、Value。Query 与所有 Key 的相似度决定注意力权重,再对 Value 加权求和,得到包含上下文的新表示。
| 概念 | 作用 | 辨识点 |
|---|---|---|
| Query | 当前 token 在寻找什么信息 | 与 Key 计算相关性 |
| Key | 每个 token 能被匹配的索引表示 | 决定注意力分数 |
| Value | 真正被加权汇总的内容 | 产生上下文表示 |
| Multi-head attention | 并行学习多种关系 | 不同 head 可关注语法、指代或位置 |
| Causal mask | 阻止看到未来 token | 用于自回归生成 |
Embedding 是向量表示;attention 是根据当前上下文动态组合表示。向量数据库存 embedding,不存 attention 权重作为主要检索键。
生成不是从数据库“取出完整答案”,也不保证事实正确。模型根据训练与当前上下文产生高概率序列,因此需要 grounding、评估、guardrails 和业务验证。
| 术语 | 含义 | 常见权衡 |
|---|---|---|
| Token | 模型处理的文本单位,不等同于单词 | 输入 + 输出 token 影响上下文与成本 |
| Context window | 一次推理可考虑的 token 范围 | 过长增加延迟/成本,超出部分无法直接使用 |
| Embedding | 语义对象的稠密向量表示 | 相似度检索、聚类、推荐 |
| Temperature | 调整概率分布随机性 | 低值更稳定,高值更多样;不等于事实开关 |
| Top-p | 从累计概率质量达到 p 的候选集中采样 | 与 temperature 都控制生成随机性 |
| Hallucination | 流畅但缺乏依据或错误的输出 | 用 RAG、引用、验证、限制任务降低风险 |
| Foundation Model | 在大规模通用数据上预训练、可适配多任务的模型 | 模型大小、能力、延迟、成本和许可 |
| 方式 | 改变模型参数 | 适合 | 不擅长 |
|---|---|---|---|
| Prompt / few-shot | 否 | 明确任务、格式、语气和少量示例 | 稳定注入大量动态私有知识 |
| RAG | 否 | 最新/私有知识、引用、可更新文档 | 永久改变模型行为或领域风格 |
| Supervised fine-tuning | 是 | 稳定任务行为、格式、语气、领域映射 | 频繁变化的事实库 |
| Continued pre-training | 是 | 大量无标签领域语料,强化领域语言 | 少量明确输入输出任务 |
| Distillation | 训练学生模型 | 接近教师质量但更低延迟/成本 | 直接增加最新知识来源 |
| 选择 | 适合 | 控制与运维 |
|---|---|---|
| Amazon Bedrock | 通过托管 API 使用多家基础模型,构建 RAG、Guardrails、Agents | 最低基础设施运维,模型/区域能力依供应商 |
| SageMaker JumpStart | 在 SageMaker 中发现、微调和部署预训练模型/方案 | 更接近 SageMaker 训练和 endpoint 控制 |
| SageMaker 自定义训练 | 自定义架构、训练循环、容器和分布式策略 | 控制最高,工程与成本最高 |
选择基础模型时比较任务能力、模态、上下文长度、延迟、吞吐、成本、定制支持、区域和合规,而不是只比较参数量。
不要计算公式,重点判断每个组件负责什么。
第 1 题 · 单选
Decoder-only 语言模型在生成时使用 causal mask 的主要原因是什么?
第 2 题 · 匹配
把 self-attention 组件与直觉匹配。
第 3 题 · 单选
公司知识库每天更新,回答必须引用最新内部文档。首选哪种适配方式?
第 4 题 · 单选
模型知道所需事实,但输出始终不符合企业固定 JSON schema。大量高质量输入输出示例可用。最合适的下一步是什么?
第 5 题 · 多选
提高 temperature 通常会带来哪些变化?选择两项。
第 6 题 · 单选
哪项最准确地区分 embedding 与 attention?
第 7 题 · 单选
团队希望通过托管 API 快速比较多家基础模型,并尽量少管理推理基础设施。优先选择什么?
第 8 题 · 匹配
把问题与首个适配方向匹配。
尚未提交
用自己的话解释:“为什么最新公司政策适合 RAG,而固定 JSON 输出可能适合 fine-tuning?”解释发给教师,可以继续追问边界条件。