MLA-C01 Udemy Companion

第 07 章 · PDF 第 557-585 页

使用 Bedrock 构建生成式 AI 应用

本章把生成式 AI 组件变成架构决策:直接调用模型、检索企业知识、定制模型行为、过滤输入输出,或让 Agent 调用工具完成动作。

优先级:中 D2.1、D2.2、D4.3 建议 50 分钟 练习 10 题

1. 控制面与推理面

能力用途典型接口
Bedrock control plane列模型、管理定制、知识库、Agent、Guardrail 等资源bedrockbedrock-agent 等 API
Bedrock Runtime向基础模型发出推理请求Converse/ConverseStream、InvokeModel
Agent Runtime调用 Agent 或 Knowledge Base 的运行时能力InvokeAgent、Retrieve、RetrieveAndGenerate

Converse 为支持消息的模型提供统一对话接口;InvokeModel 提供更直接、模型特定的请求控制。当前 Bedrock 还支持开放兼容 API 和额外 endpoint,但 MLA-C01 的稳定知识是:控制面管理资源,runtime 执行推理。

推理容量

模式适合权衡
On-demand流量不稳定、快速开始、按使用付费共享容量,吞吐和可用模型依区域
Provisioned Throughput稳定高吞吐、购买专用 Model Units、定制模型按小时和承诺期计费,需容量规划
Cross-Region inference profile跨允许区域路由以提升吞吐/韧性必须满足数据驻留、SCP 和 IAM 的目的区域约束

2. 定制方法按训练信号区分

方法训练数据目标
Supervised fine-tuning标注的 prompt-response 对学习特定任务、格式和行为
Reinforcement fine-tuningprompt/log + reward function通过反馈得分优化复杂目标
Distillationprompt;教师生成响应,可带标注对把大模型能力迁移到更小、更快、更便宜的学生模型
Continued pre-training大量无标签领域语料强化领域语言分布;旧课件常见,支持情况按模型核对

定制支持高度依赖模型、Region 和配额。不要假设所有基础模型都支持所有方法。训练成本通常与处理 token 数和 epoch 相关,定制模型还会产生存储与推理容量成本。

3. RAG 的完整数据流

摄取:从 S3、企业连接器或数据库读取文档。
解析与切块:保留有意义的上下文边界和 metadata。
向量化:embedding model 把 chunk 转为向量,写入 vector store。
检索:把用户 query 向量化,执行相似度/混合搜索和可选 reranking。
增强:把最相关 chunk、指令和问题组合进 prompt。
生成与引用:基础模型回答,并返回来源以便验证。

切块和检索的权衡

选择太小太大
Chunk size缺少上下文、语义碎裂噪声多、占 context、检索不精确
Overlap边界信息丢失重复结果和 token 成本提高
Top-k可能漏掉证据增加无关上下文和成本

RAG 质量要分段测:先测 retrieval 是否找对文档,再测 generation 是否忠实使用证据。只看最终回答无法定位是检索错还是生成错。

4. Bedrock Knowledge Bases

模式AWS 管理适合
Managed Knowledge Base摄取、索引、存储、检索以及部分 embedding/reranking最低运维、企业连接器、权限过滤和托管扩缩
Customer-managed Knowledge Base你管理 vector store、解析、索引和更多配置已有 OpenSearch/Aurora/Neptune 等存储或需完整控制

Knowledge Bases 支持 Retrieve 只返回文档,也支持 RetrieveAndGenerate 直接检索后生成。向量存储候选与功能会变化,稳定判断点是:需要托管 RAG 就选 Knowledge Bases;需要完全自定义索引/检索层则管理自己的管道。

5. Guardrails 在模型前后做策略检查

策略目的例子
Content filters过滤有害文本/图像与 prompt attack仇恨、暴力、性、侮辱、行为不当
Denied topics阻止特定业务主题金融应用不提供非法投资建议
Sensitive information检测、阻止或 mask PII身份证号、邮箱、账号
Word filters阻止自定义词或短语竞争品牌、内部代号
Contextual grounding checks检查回答与来源相关/有依据RAG 回答是否忠实于检索内容

Guardrail 先评估输入;若通过再调用模型并评估输出。也可以用 ApplyGuardrail 独立评估文本。Guardrails 是策略层,不替代 IAM、KMS、VPC、数据权限或完整的事实评估。

主来源:Amazon Bedrock Guardrails

6. Agents:从回答问题到执行动作

用户提出目标,Agent 分解任务并判断缺少的信息。
需要知识时查询关联 Knowledge Base。
需要动作时选择 action group,并生成 API 参数。
Lambda 或返回控制的应用执行操作,把结果交回 Agent。
Agent 汇总结果;用 trace 排查编排步骤。
组件职责
Foundation model理解、规划和生成响应
Instructions定义角色、目标与限制
Action group定义可调用 API/函数及参数 schema
Knowledge Base提供私有知识和检索证据
Version + alias把稳定 Agent 配置发布给应用
Trace观察预处理、编排、工具选择和结果

只回答文档问题通常 Knowledge Base 足够;需要调用订单、预订、工单等业务 API 才进入 Agent/action group 场景。

7. 安全、成本与可观测性

不要只监控模型:RAG 应用至少有四层:检索质量、生成忠实度、安全策略、系统延迟/成本。

章节练习

先区分“知识、行为、安全、动作、容量”五类需求。

第 1 题 · 单选

应用要用统一消息结构在多个支持的 Bedrock 模型之间切换。首选哪个原生 API?

第 2 题 · 排序

排列基础 RAG 流程。

第 3 题 · 单选

聊天应用需要阻止特定话题,并在输入和输出中 mask PII。最直接使用什么?

第 4 题 · 单选

客服助手除了回答政策问题,还必须调用内部 API 创建退货单。最合适的 Bedrock 能力是什么?

第 5 题 · 匹配

把需求与能力匹配。

第 6 题 · 多选

跨区域 inference profile 用于受监管工作负载时,哪些检查必要?选择两项。

第 7 题 · 单选

RAG 回答错误。检索结果根本没有包含正确政策,但模型忠实总结了检索内容。首要修复哪一层?

第 8 题 · 单选

需要把大模型的能力迁移到更小模型以降低延迟和 token 成本。应选择什么?

第 9 题 · 多选

评估企业 RAG 应用时,哪些维度应分开监控?选择三项。

第 10 题 · 单选

应用位于私有子网,希望调用 Bedrock 而不经过 Internet Gateway 或 NAT Gateway。应配置什么?

本章掌握线:80%

尚未提交

主来源与复习动作

用一个你熟悉的公司知识问答场景,分别写出 RAG、Guardrail 和 Agent 的职责。若某组件删掉后场景仍完全不变,你可能还没抓到它的边界,可以发给教师一起拆。