ARTICLE · 1101736
系统架构设计师 AI 大模型02:案例模拟题,大模型训练、企业知识、数字员工、端边云协同
案例模拟一:大模型训练平台的质量属性
某公司开发在线大模型训练平台,用户提交模型代码后由系统自动解析并分配算力资源训练,用户无需关心底层硬件。需求描述如下:
a. 用户提交任务后 1 分钟内完成资源分配并启动训练b. 数据库故障时 20 分钟内自动切换到备用库c. 训练服务器故障时,任务自动迁移到其他节点继续运行d. 系统故障期间正常功能不受影响,并上报故障信息,提供训练日志与资源日志e. 界面适配不同分辨率的终端,支持多语言与快捷键f. 远程自动化测试仅对注册用户开放g. 功能修改须在 3 天内完成上线h. 一周内完成新功能模块的开发集成
问题:(1)将 a 至 g 归类到对应的质量属性;(2)指出 h 属于什么、为什么不能算质量属性;(3)给出一个敏感点与一个权衡点并说明理由。
参考答案要点。(1)a 性能(资源分配时延);b 可用性(故障切换时限);c 可用性或容错(任务迁移保连续);d 可靠性与可维护性(故障隔离、日志上报支撑维护);e 易用性(适配、多语言、快捷键);f 安全性(访问控制);g 可修改性(变更时限)。(2)h 是设计约束,不是质量属性:它约束的是开发过程的时间,不是系统运行时的可观察质量,质量属性题里它是常设干扰项。(3)敏感点示例:GPU 资源调度算法,改变它会直接影响"1 分钟内分配资源"这一性能指标;权衡点示例:任务迁移策略,迁移粒度越细可用性越高,但状态保存与恢复的开销越大,性能与可用性在此相互制约。
案例模拟二:企业知识问答平台的 RAG 架构
某集团建设企业智能知识问答平台,接入制度、合同、产品文档约二十万份,供全体员工与客服使用。试点暴露四个问题:检索结果不相关;答案不附引用来源,员工不敢用;高峰期响应超过十秒;制度每月更新,知识库滞后。
问题:(1)写出平台总体架构的核心组件及各自职责;(2)针对四个问题逐一给出成因与改进措施;(3)列出至少三个架构风险点及对策。
(1)组件与职责。接入层:网关、认证、限流;编排层:查询改写、意图路由、多轮上下文管理;知识加工层:文档清洗、语义切片、向量化、增量更新;检索层:嵌入模型、向量库(近似最近邻索引)、关键词与向量混合检索、重排、权限过滤;生成层:模型服务、上下文拼装、引用注入、拒答控制;治理层:评测集、审计日志、用户反馈闭环。(2)四问四答。检索不准:固定长度切片破坏语义、嵌入模型不适配领域术语、缺少重排;对策为按语义单元切片、领域语料微调嵌入模型、增加重排模型。无引用:提示词未约束、元数据未透传;对策为强制引用模板、检索结果携带来源与章节、检索不到依据时明确拒答。响应慢:链路串行、模型推理开销大;对策为高频问题缓存、模型量化、流式输出、请求批处理。更新滞后:全量重建周期长;对策为增量索引、文档变更监听、知识版本管理。(3)风险点。提示注入诱导越权回答:输入过滤加指令与数据分离;越权检索到无权文档:权限过滤必须放在检索层而非生成层,否则越权内容已经进入上下文;敏感数据泄露:入池前脱敏加输出内容过滤;答案错误影响业务决策:高风险场景保留人工兜底与确认卡点。
案例模拟三:数字员工平台的智能体设计
某集团建设数字员工平台,要求支持合同问答、制度查询、流程办理、工单流转,全程权限隔离、审计可追溯。设计团队在单智能体与多智能体之间犹豫,且担心自动化执行失控。
问题:(1)写出平台核心组件及职责;(2)说明单智能体与多智能体的适用边界并给出本平台的建议;(3)为"防止自动化执行失控"设计至少四项机制。
(1)组件。智能体运行时:任务规划、会话记忆、工具调用编排;工具网关:工具统一注册、鉴权、限流与超时控制;知识服务:制度与合同语料的检索增强问答;连接器:审批、工单等业务系统接口;监控审计:全链路调用日志、执行轨迹回放。(2)边界。任务单一、链路明确(合同问答、制度查询)用单智能体,成本低、误差不扩散;跨域长流程(办理加流转加审批)天然分角色,用多智能体按职能分工协作,但要控制通信开销与误差传播。建议:问答域单智能体,流程域按"受理、办理、复核"三角色多智能体协作,复核角色独立于发起角色形成制衡。(3)防失控机制。工具白名单与最小权限;高危操作(对外发文、资金相关)设人工确认卡点;执行预算:单任务步数与时长上限,超限终止;全链路审计与状态快照,支持中断续跑与回滚;输出校验:结构化字段校验不通过不落库。
案例模拟四:质检系统的端边云协同
某制造企业部署视觉质检:产线相机每秒采集三十帧图像,缺陷检测要求毫秒级响应,质检图像不允许出厂区,模型每周迭代一次新版本。现有方案全部部署在云端,时延与带宽均不达标。
问题:(1)说明端侧 AI 相对云侧 AI 的优势,并给出本场景的算力分布方案;(2)指出本场景涉及哪几种边云协同模式;(3)说明 AI 算力资源池设计要考虑的三个方面。
(1)优势与分布。端侧优势:无网络往返、延迟低,数据不出设备、隐私可控,断网可用,节省上行带宽。分布方案:缺陷推理部署在厂区边缘服务器(满足毫秒级与数据不出厂),模型训练与全厂数据汇聚分析放在云端,推理用量化后的轻量模型适配边缘算力。(2)协同模式。智能协同:边缘推理加云端训练,训练后的新模型下发边缘;数据协同:边缘做采集与初筛,仅上传疑似缺陷样本,降低带宽;管理协同与服务协同:云端统一管理模型版本、编排边缘应用。(3)资源池三方面。资源抽象与异构计算:屏蔽 GPU、NPU 差异,统一供给接口;动态调度与能效优化:按产线班次与负载弹性分配,闲时降频;安全与隔离:多产线多租户隔离,质检数据分级授权。
案例题通用骨架。架构组件题按"接入、编排、检索或知识、生成或执行、治理"五层落笔;成因题按"问题、原因、措施"一一对应,问题说检索不准,措施就必须落在切片、嵌入或重排上;治理题背五个词:脱敏、权限、过滤、审计、兜底,几乎每道 AI 案例都用得上。
论文押题
三道押题按考中概率排序。每道给出题目、七段式骨架与素材要点。素材原则:一个覆盖 RAG、向量库、模型服务化的企业知识平台项目可以同时应付三道题,考场上只换论述重心,不换项目底座。
押题一:论基于检索增强生成的企业知识服务系统架构设计
押题二:论大模型应用系统的架构设计与安全治理
项目背景建议用智能客服或智能运维平台。架构重心写三件事:训练与推理分离部署(训练集群批量弹性、推理集群在线扩缩容、模型版本管理)、模型服务化与推理优化(量化、批处理、缓存、流式输出)、安全治理五件套(脱敏入池、权限隔离、输入输出过滤、全程审计、人工兜底)。这一题的得分点在治理的深度:写出提示注入的攻防逻辑与高危操作确认卡点,就与泛泛而谈的答卷拉开了差距。
押题三:论智能体技术在企业业务流程自动化中的应用
项目背景建议用 IT 服务台或财务流程自动化。核心论述:任务拆解与规划、工具注册与最小权限、单智能体与多智能体的边界决策(对比论证,说明为什么复核角色要独立)、执行预算与人工卡点、审计与回滚。末段自然衔接传统工作流引擎与智能体的融合:确定性流程用工作流,不确定判断交给智能体,两者编排共存,这是最能体现架构师取舍的落点。
论文三条红线。一、不要写成产品介绍,阅卷人看的是架构决策与权衡过程,选型对比必须写出"为什么不是另一个"。二、不要漏量化数字,没有数字的效果段基本不得分。三、不要临时编架构,按本文骨架提前把项目写成一页纸素材,考场拆题重组。