第 1 题 · 单选
应用要用统一消息结构在多个支持的 Bedrock 模型之间切换。首选哪个原生 API?
第 07 章 · PDF 第 557-585 页
本章把生成式 AI 组件变成架构决策:直接调用模型、检索企业知识、定制模型行为、过滤输入输出,或让 Agent 调用工具完成动作。
| 能力 | 用途 | 典型接口 |
|---|---|---|
| Bedrock control plane | 列模型、管理定制、知识库、Agent、Guardrail 等资源 | bedrock、bedrock-agent 等 API |
| Bedrock Runtime | 向基础模型发出推理请求 | Converse/ConverseStream、InvokeModel |
| Agent Runtime | 调用 Agent 或 Knowledge Base 的运行时能力 | InvokeAgent、Retrieve、RetrieveAndGenerate |
Converse 为支持消息的模型提供统一对话接口;InvokeModel 提供更直接、模型特定的请求控制。当前 Bedrock 还支持开放兼容 API 和额外 endpoint,但 MLA-C01 的稳定知识是:控制面管理资源,runtime 执行推理。
| 模式 | 适合 | 权衡 |
|---|---|---|
| On-demand | 流量不稳定、快速开始、按使用付费 | 共享容量,吞吐和可用模型依区域 |
| Provisioned Throughput | 稳定高吞吐、购买专用 Model Units、定制模型 | 按小时和承诺期计费,需容量规划 |
| Cross-Region inference profile | 跨允许区域路由以提升吞吐/韧性 | 必须满足数据驻留、SCP 和 IAM 的目的区域约束 |
| 方法 | 训练数据 | 目标 |
|---|---|---|
| Supervised fine-tuning | 标注的 prompt-response 对 | 学习特定任务、格式和行为 |
| Reinforcement fine-tuning | prompt/log + reward function | 通过反馈得分优化复杂目标 |
| Distillation | prompt;教师生成响应,可带标注对 | 把大模型能力迁移到更小、更快、更便宜的学生模型 |
| Continued pre-training | 大量无标签领域语料 | 强化领域语言分布;旧课件常见,支持情况按模型核对 |
定制支持高度依赖模型、Region 和配额。不要假设所有基础模型都支持所有方法。训练成本通常与处理 token 数和 epoch 相关,定制模型还会产生存储与推理容量成本。
| 选择 | 太小 | 太大 |
|---|---|---|
| Chunk size | 缺少上下文、语义碎裂 | 噪声多、占 context、检索不精确 |
| Overlap | 边界信息丢失 | 重复结果和 token 成本提高 |
| Top-k | 可能漏掉证据 | 增加无关上下文和成本 |
RAG 质量要分段测:先测 retrieval 是否找对文档,再测 generation 是否忠实使用证据。只看最终回答无法定位是检索错还是生成错。
| 模式 | AWS 管理 | 适合 |
|---|---|---|
| Managed Knowledge Base | 摄取、索引、存储、检索以及部分 embedding/reranking | 最低运维、企业连接器、权限过滤和托管扩缩 |
| Customer-managed Knowledge Base | 你管理 vector store、解析、索引和更多配置 | 已有 OpenSearch/Aurora/Neptune 等存储或需完整控制 |
Knowledge Bases 支持 Retrieve 只返回文档,也支持 RetrieveAndGenerate 直接检索后生成。向量存储候选与功能会变化,稳定判断点是:需要托管 RAG 就选 Knowledge Bases;需要完全自定义索引/检索层则管理自己的管道。
| 策略 | 目的 | 例子 |
|---|---|---|
| Content filters | 过滤有害文本/图像与 prompt attack | 仇恨、暴力、性、侮辱、行为不当 |
| Denied topics | 阻止特定业务主题 | 金融应用不提供非法投资建议 |
| Sensitive information | 检测、阻止或 mask PII | 身份证号、邮箱、账号 |
| Word filters | 阻止自定义词或短语 | 竞争品牌、内部代号 |
| Contextual grounding checks | 检查回答与来源相关/有依据 | RAG 回答是否忠实于检索内容 |
Guardrail 先评估输入;若通过再调用模型并评估输出。也可以用 ApplyGuardrail 独立评估文本。Guardrails 是策略层,不替代 IAM、KMS、VPC、数据权限或完整的事实评估。
| 组件 | 职责 |
|---|---|
| Foundation model | 理解、规划和生成响应 |
| Instructions | 定义角色、目标与限制 |
| Action group | 定义可调用 API/函数及参数 schema |
| Knowledge Base | 提供私有知识和检索证据 |
| Version + alias | 把稳定 Agent 配置发布给应用 |
| Trace | 观察预处理、编排、工具选择和结果 |
只回答文档问题通常 Knowledge Base 足够;需要调用订单、预订、工单等业务 API 才进入 Agent/action group 场景。
先区分“知识、行为、安全、动作、容量”五类需求。
第 1 题 · 单选
应用要用统一消息结构在多个支持的 Bedrock 模型之间切换。首选哪个原生 API?
第 2 题 · 排序
排列基础 RAG 流程。
第 3 题 · 单选
聊天应用需要阻止特定话题,并在输入和输出中 mask PII。最直接使用什么?
第 4 题 · 单选
客服助手除了回答政策问题,还必须调用内部 API 创建退货单。最合适的 Bedrock 能力是什么?
第 5 题 · 匹配
把需求与能力匹配。
第 6 题 · 多选
跨区域 inference profile 用于受监管工作负载时,哪些检查必要?选择两项。
第 7 题 · 单选
RAG 回答错误。检索结果根本没有包含正确政策,但模型忠实总结了检索内容。首要修复哪一层?
第 8 题 · 单选
需要把大模型的能力迁移到更小模型以降低延迟和 token 成本。应选择什么?
第 9 题 · 多选
评估企业 RAG 应用时,哪些维度应分开监控?选择三项。
第 10 题 · 单选
应用位于私有子网,希望调用 Bedrock 而不经过 Internet Gateway 或 NAT Gateway。应配置什么?
尚未提交
用一个你熟悉的公司知识问答场景,分别写出 RAG、Guardrail 和 Agent 的职责。若某组件删掉后场景仍完全不变,你可能还没抓到它的边界,可以发给教师一起拆。