ARTICLE · 1121460
AI Agent #15
AI Agent #15请自行验证是否准确哈~ 声明:仅供参考,应该没有任何“原题”。
AI Agent · 单位 U15(多智能体协作与状态机/图编排)
本段主题:Agent 工作流的「组织形态」——多智能体协作(角色分工、拓扑、投票仲裁、通信成本与收敛)与状态机/图编排(状态转移与可达性、吸收概率与期望步数、编排图的容量与状态爆炸、循环终止保障)。覆盖:多数表决正确率、马尔可夫链的吸收概率与期望步数、编排图边数与拓扑序计数、协作拓扑设计、图编排框架选型、多体通信成本、终止性设计、冗余与仲裁概率、循环期望步数。结论只依赖可在量化投研(把研究流程拆给多个角色、用图编排保证可控执行)复用的知识。
题目编号:TRACK-03-U15-Q01
题型:笔试 | 考点:多智能体协作 / 角色分工与多数表决 / 表决正确率 题干:由多个独立同质的 Agent 对同一问题给出「是/否」判断并多数表决。单个 Agent 判断正确的概率为 p=0.7,各 Agent 相互独立。(a) 求 3 个 Agent 多数表决(≥2 票)正确的概率;(b) 求 5 个 Agent 多数表决(≥3 票)正确的概率;(c) 比较 (a)(b) 与单 Agent 的 0.7,说明增加 Agent 数是否总是有益。 假设与边界:各 Agent 判断独立同分布(伯努利);表决为二值、无弃权;p 为边际正确率且各 Agent 相同;投票数取奇数以避免平票。 解析:多数正确率 = Σ_{i>n/2} C(n,i)pi(1−p){n−i}。(a) n=3:P= C(3,2)p²(1−p) + C(3,3)p³ = 3×0.49×0.3 + 0.343 = 0.441 + 0.343 = 0.784。(b) n=5:P= C(5,3)p³(1−p)² + C(5,4)p⁴(1−p) + p⁵ = 10×0.343×0.09 + 5×0.2401×0.3 + 0.16807 = 0.3087 + 0.36015 + 0.16807 = 0.83692→0.8369。(c) 0.7 → 0.784 → 0.8369,随人数单调上升。 参考答案:(a) 0.784;(b) 0.8369;(c) 在 p>0.5 且独立的前提下,多数表决正确率随 n 单调上升并趋近 1(孔多塞陪审团定理)。 验算/自检:另一种解法(补事件)——n=3 时少数正确(≤1 票)概率 = C(3,0)0.3³ + C(3,1)0.7×0.3² = 0.027 + 3×0.063 = 0.027+0.189=0.216,1−0.216=0.784 ✔。边界值复算:p=0.5 时任意 n 的表决正确率恒为 0.5(无信息);p<0.5 时多数表决反而更差(放大错误)——这解释了「独立且略优于随机」是多数表决有效的两个前提;n 增大只是趋近完美,但边际收益递减(0.7→0.784 增 0.084,→0.8369 增 0.053)。 常见错误:直接把正确率相加(0.7×3);忽略独立性前提;在 p<0.5 时仍用多数表决;用偶数人数出现平票无法裁决。 评分要点:0.784、0.8369;孔多塞定理的方向性;独立性/阈值 p>0.5 的前提;边际收益递减。 追问/变形/还能这样考:Agent 判断正相关(共享模型)时多数表决退化(接 U12-Q08);给不同 Agent 加权(准确率高的权重大);用非对称代价(漏报 vs 误报)设计表决阈值。
题目编号:TRACK-03-U15-Q02
题型:笔试 | 考点:状态机/图编排 / 状态转移与吸收概率 / 马尔可夫链 题干:一个 Agent 编排状态机,状态 {P=规划, R=检索, C=计算, V=校验, A=完成(吸收), F=失败(吸收)},转移概率:P→R 0.8, P→F 0.2;R→C 0.7, R→P 0.2, R→F 0.1;C→V 0.8, C→F 0.2;V→A 0.7, V→C 0.2, V→F 0.1。(a) 求从 P 出发,最终到达 A(成功吸收)的概率;(b) 求从 P 出发到达吸收态所需步数的期望;(c) 求从 P 出发「在 4 步内到达 A」的概率。 假设与边界:马尔可夫链,A、F 为吸收态;每一步对应一次状态转移(一次操作);初始状态为 P(0 步时在 P);不考虑状态内并行。 解析:设 a_s = 从 s 吸收到 A 的概率,e_s = 期望步数,f_s^{(k)} = 首次在第 k 步到达 A 的概率。 (a) a_A=1,a_F=0;a_V=0.7a_A+0.2a_C+0.1a_F=0.7+0.2a_C;a_C=0.8a_V+0.2a_F=0.8a_V;联立:a_C=0.8(0.7+0.2a_C)=0.56+0.16a_C ⇒ 0.84a_C=0.56 ⇒ a_C=0.666667;a_V=0.7+0.2×0.666667=0.833333;a_R=0.7a_C+0.2a_P;a_P=0.8a_R ⇒ a_P=0.8(0.7×0.666667+0.2a_P)=0.8(0.466667+0.2a_P)=0.373333+0.16a_P ⇒ 0.84a_P=0.373333 ⇒ a_P=0.444444。 (b) e_V=1+0.2e_C(到吸收加 1 步);e_C=1+0.8e_V;联立 e_C=1+0.8(1+0.2e_C)=1.8+0.16e_C ⇒ 0.84e_C=1.8 ⇒ e_C=2.142857;e_V=1+0.2×2.142857=1.428571;e_R=1+0.7e_C+0.2e_P;e_P=1+0.8e_R ⇒ e_P=1+0.8(1+0.7×2.142857+0.2e_P)=1+0.8(1+1.5+0.2e_P)=1+0.8(2.5+0.2e_P)=1+2+0.16e_P=3+0.16e_P ⇒ 0.84e_P=3 ⇒ e_P=3.571429。 (c) 到 A 的最短路径为 P→R→C→V→A,恰好 4 步,概率 = 0.8×0.7×0.8×0.7 = 0.3136;任何其他 4 步路径要么未达 A、要么含回头环(更长),故 4 步内到达 A 的概率 = 0.3136。 参考答案:(a) 0.4444;(b) 3.5714 步;(c) 0.3136。 验算/自检:另一种解法((a) 用 a_F=1−a_A 二元吸收)——本题只有 A/F 两吸收态,故 a_F|P = 1−a_P = 0.5556,可独立用 a_F 的线性方程复核(结果应一致)。数值自检:a_P=0.4444 < a_C=0.6667 < a_V=0.8333,符合「越靠近 A 成功率越高」的单调性 ✔。边界复算:若把 P→F 的概率设为 0(P 必进 R),e_P 与 a_P 应提升;若把 V→A 设为 1(V 后必成),则 a_P 提升。 常见错误:把「吸收概率」与「一步到达概率」混淆;列方程时漏掉自环项;期望步数漏加「当前这一步」的 1;(c) 把含环路径也算入「4 步内」导致多计。 评分要点:0.4444、3.5714、0.3136;线性方程组列写正确(含自环);(c) 识别唯一最短路径;单调性自检。 追问/变形/还能这样考:加入状态执行时长求加权完工时间;把 F 拆成「可重试失败」与「硬失败」;用矩阵幂/特征值求长期分布与吸收时间分布(接 Q09)。
题目编号:TRACK-03-U15-Q03
题型:笔试 | 考点:状态机/图编排 / 编排图规模与状态爆炸 / 组合计数 题干:一个多智能体编排图含 N=12 个节点。(a) 若允许任意两节点间有向连接(简单有向图,无自环),求可能边数的上界;(b) 若每条边可独立处于「启用/停用」两态,求全部配置的数量级(用 2 的幂与以 10 为底的对数表示);(c) 若强制为有向无环图(DAG)——最大边数与可能的拓扑序上界各是多少。 假设与边界:节点可区分;(a) 有向简单图(每对节点最多一条方向);(b) 每条边独立两态;(c) DAG 指不存在有向环,拓扑序为满足所有边的线性排列。 解析:(a) 可能的有向边数 = 每对无序节点 2 个方向 × C(N,2) = N(N−1) = 12×11 = 132。(b) 每条边 2 态(启用/停用),共 2^132;用 log₁₀(2^132)=132×0.30103=39.736,即约 10^39.7 种配置。(c) DAG 最大边数 = 把节点全序排列后只允许从前向后的边 = C(N,2)=66;拓扑序上界 = 全序图仅 1 个拓扑序,但无边的 DAG 有 N!=12! 个拓扑序;12! = 479001600。 参考答案:(a) 132 条;(b) 2^132 ≈ 10^39.7 种配置;(c) DAG 最大 66 条边;拓扑序上界 N!=12!=479001600。 验算/自检:另一种解法((a) 排列计数)——有向边数 = 从 12 个节点中取有序对的数目 = P(12,2)=12×11=132 ✔。(c) 复核:完全无约束(无边的 DAG)拓扑序 = 12! = 479001600;完全有序(链)拓扑序 = 1。边界复算:N=12 时 2^66(DAG 启停配置)≈7.38×10^19,仍远大于任何可穷举测试量——说明「穷举所有编排配置」不可行,必须用采样/性质测试(呼应 Q07 终止性验证)。 常见错误:把有向边数算成 C(12,2)=66(漏方向);把 2^132 写成 132² ;把拓扑序上界当 N(应为 N!);混淆「DAG 最大边数」与「全图最大边数」。 评分要点:132、2132≈1039.7、DAG 66 边与 12! 拓扑序;能指出状态空间爆炸对测试策略的影响。 追问/变形/还能这样考:把「每条边只有启用/停用」扩展为「每节点多内部状态」的状态空间 k^N;用有环图的强连通分量压缩状态;以组合爆炸论证「不做全枚举、改用不变量与性质测试」。
题目编号:TRACK-03-U15-Q04
题型:面试 | 考点:多智能体协作 / 协作拓扑与角色 / 拓扑设计 题干:请比较几种多智能体协作拓扑:顺序流水线、并行扇出-汇聚、监督者-工作者(supervisor-worker)、辩论/评审(debate/critic)。分别说明适用任务、通信开销、失败模式与可观测性,并给出量化投研场景下的选型。 (无唯一答案,考察思路。) 假设与边界:任务含可并行子任务与需统一裁决的环节;Agent 有成本;须可审计、可复现;不指定具体框架。 解析: 顺序流水线:每步依赖前步输出,强顺序、易审计;适合取数→计算→成文的强依赖链;失败模式是「单点错误沿链传播」(接 U11 错误传播)。 并行扇出-汇聚:把独立子任务(如多标的、多数据源)并行后汇聚;吞吐高;失败模式是「部分失败与汇聚一致性」(需处理缺项)。 监督者-工作者:一个 supervisor 分解并分派、worker 执行、supervisor 汇总/决定下一步;灵活、可动态重规划;通信开销大,supervisor 是潜在瓶颈与单点。 辩论/评审:多角色(如构建者 vs 批判者)对抗式改进;对开放/易错判断有效;成本最高、收敛性存疑(可能震荡),需轮数上限。 量化选型:确定性取数/计算用流水线;多标的多源用并行汇聚;多步研究分解用监督者;对结论可靠性要求高、且有客观校验的环节用「构建者+批判者+校验器」。 参考答案:选型矩阵(任务特征→拓扑)——强顺序依赖→流水线;可并行独立子任务→扇出-汇聚;任务需动态分解/重规划→监督者-工作者;需交叉验证/降低单点偏差→辩论评审;高风险最终裁决→辩论 + 人在回路。每类拓扑都需配「终止/收敛判据 + 超时预算 + 审计日志」。 验算/自检:用「成本-收益」对比——辩论拓扑的通信轮数约为线性拓扑的 O(n²)(n 个角色两两交互),当 n=3 时为常数,n 增大时成本迅速上升;故辩论角色数应保持较小(2–3)。边界:supervisor-worker 在 worker 频繁失败时会把压力集中在 supervisor 的重试逻辑上(需退避与熔断);辩论在角色间「互相强化错误共同偏见」时会放大错误(需独立证据与校验器打断)。 常见错误:任何任务都上「多智能体辩论」导致成本爆炸;忽略汇聚一致性(并行结果冲突无法裁决);监督者无退避成为单点;辩论无收敛判据导致震荡。 评分要点:四类拓扑的适用/开销/失败模式/可观测性;量化场景选型;终止/预算/审计的通用要求;对辩论成本的 O(n²) 认识。 追问/变形/还能这样考:把拓扑映射为图编排节点与边(接 Q05);用评测比较拓扑的端到端成功率与成本(接 U16);supervisor 的单点如何用多实例/冗余缓解。
题目编号:TRACK-03-U15-Q05
题型:面试 | 考点:状态机/图编排 / 图编排 vs 状态机 vs 脚本 / 编排选型 题干:实现 Agent 工作流时,可以用「简单脚本 + while 循环」「有限状态机(FSM)」「图编排(有向图/状态图)」。请比较三者在可控性、并发/并行、可恢复性、可观测性上的差异,并给出何时该从脚本升级到图编排。 (无唯一答案,考察思路。) 假设与边界:工作流含分支、循环、并行、并行汇聚、失败重试;要求可持久化恢复与审计;团队规模与迭代速度有限。 解析: 脚本 + while:上手最快、灵活;但分支/循环/状态散落在代码里,难以「可视化、持久化、按状态恢复」,并发与超时需手写,可观测性弱(难回答「现在在哪个状态」)。 FSM:状态与转移显式、易验证终止性与可达性(接 Q02/Q07);但对「并行 + 动态拓扑」表达力弱(状态爆炸),适合状态数有限的强流程。 图编排:节点=步骤、边=转移/依赖,天然支持并行、汇聚、条件边与循环;可持久化节点状态、支持恢复与重放、可观测(每节点有状态与产物);代价是抽象与框架开销。 升级时机:出现「需要在任意步骤崩溃后恢复」「需要并行与汇聚」「需要按状态审计与重放」「流程复杂到脚本难以维护」时,升级到图编排;若只是线性简单流程,FSM 或脚本足够。 参考答案:选型准则—— 纯线性、无恢复需求、快速原型 → 脚本; 状态有限、转移显式、需终止性证明 → FSM; 有并行/汇聚/动态分支、需持久化恢复与审计 → 图编排; 混合:外层图编排(负责恢复与可观测),内层单节点用脚本/FSM 实现复杂逻辑。 验算/自检:用「崩溃恢复」对照实验——同样一段含并行与循环的流程,脚本版需自行实现检查点与恢复(易错),图编排版由框架按节点状态恢复;以「崩溃后能恢复到正确中间态」为判据。边界:图编排若把「大循环」都塞进一个节点,等于把复杂度藏回节点内部,恢复粒度变粗——故节点划分要与「可恢复粒度」对齐(接 U12-Q05 粒度)。 常见错误:为简单线性流程硬上图编排(过度工程);复杂流程用裸脚本导致无法恢复与审计;把循环体塞进单节点使恢复失效;忽略节点划分与恢复粒度的关系。 评分要点:三者可控性/并发/恢复/可观测对比;升级触发条件;混合分层策略;节点划分与恢复粒度对齐。 追问/变形/还能这样考:把 FSM 的终止性验证用于图编排(接 Q07);图编排节点与「检查点」的映射(接 U39);跨语言把图编排节点下沉到 Python/C++ 服务(接 U47)。
题目编号:TRACK-03-U15-Q06
题型:面试 | 考点:多智能体协作 / 通信成本与收敛 / 协作设计 题干:多智能体协作时,通信(互相传消息、共享上下文)通常是最贵的部分。请分析通信开销的构成,给出降低通信成本的手段,并讨论如何保证「协作能收敛」而不是「越聊越乱」。 (无唯一答案,考察思路。) 假设与边界:Agent 间通过消息/共享状态交互;每轮通信有 token 与延迟成本;存在「互相强化错误」「无限争论」的风险;需要可审计。 解析:通信开销构成——① 消息体量(上下文越长越贵);② 通信轮数(多角色两两交互 O(n²));③ 广播/同步成本(汇聚点等待)。降低手段:结构化消息(只传「结论+证据指针」而非全文)、黑板(blackboard,共享状态而非点对点全量)、限制轮数、按需通信(只在冲突/不确定时交换)、缓存与复用共识。收敛保障:设「轮数上限 + 收敛判据(如连续两轮结论不再变化)+ 独立证据打断(引入校验器或外部数据裁决)+ 平局裁决规则」。 参考答案:设计——(1) 通信协议:结构化消息 schema({role, claim, evidence_id, confidence}),大内容走「共享存储 + 指针」;(2) 拓扑:尽量用 supervisor 汇聚而非全连接(把 O(n²) 降到 O(n));(3) 收敛:设最大轮数、变化阈值、外部校验器优先裁决;(4) 审计:每次通信留痕,可重放判断「为何收敛到该结论」。给出伪代码: round = 0while round < max_rounds: msgs = collect(agents) # 结构化消息if not changed(msgs, prev): break# 收敛判据if verify_conflict(msgs): arbitrate_with_evidence() prev = msgs; round += 1验算/自检:成本核算——n 个角色、每轮每人一条消息、消息 m token:全连接每轮约 n(n−1)m,supervisor 汇聚每轮约 2nm(worker→sup,sup→worker),比值约 (n−1)/2,n=4 时省约 1/3,n 越大越明显。边界:收敛判据若只看「文本相同」,措辞变化会误判未收敛;应看「结构化结论字段」是否稳定(接 U16 匹配口径)。 常见错误:全连接广播全文导致成本爆炸;无轮数上限导致不收敛;无外部裁决使错误共识固化;只看文本相似判收敛。 评分要点:通信开销构成;结构化消息 + 共享状态 + 按需通信;拓扑降复杂度(O(n²)→O(n));收敛判据(轮数/变化阈值/外部裁决);审计。 追问/变形/还能这样考:通信成本规划为容量问题(接 U36 容量估算);用投票替代全连接讨论(接 Q01/Q08);把收敛过程写入记忆以便复用(接 U14)。
题目编号:TRACK-03-U15-Q07
题型:面试 | 考点:状态机/图编排 / 循环与终止性保障 / 终止性设计 题干:图编排支持条件边与循环(如「校验不通过则回到计算」)。请设计终止性保障:如何保证任何输入下流程都能终止(或明确失败),如何避免「死循环」「活锁」与「无进展循环」。 (无唯一答案,考察思路。) 假设与边界:图含环(重试/自纠正回路);节点可能改变状态或不变;需可观测与可中断;目标是「必然终止」+「无进展可检测」。 解析:终止性靠三重机制——① 硬边界:全局最大「总步数/总时长/总成本」与每个循环的「最大迭代数」,命中即强制退出到兜底节点;② 势函数(progress measure):定义一个单调变化的量(如「剩余待解子问题数」「误差估计」「已确认事实数」),要求每次经过回路都严格改善,否则判为无进展并退出;③ 无进展检测:用状态指纹(当前目标 + 关键中间态)检测重复访问,重复即中止并转兜底(接 U11 no_progress)。活锁(不断切换但不推进)用「计划指纹去重 + 变化阈值」处理(接 U12-Q06)。 参考答案:终止性设计清单—— 每个循环边带 max_iter;全局 max_steps / max_time / max_cost;定义势函数并断言「回路每轮严格改善」,不满足→退出; 状态指纹集合检测重复状态→退出; 兜底节点:终止时输出「已完成部分 + 未完成原因 + 建议」,绝不静默死循环; 可观测:暴露「当前迭代数 / 势函数值 / 是否触发硬边界」。 验算/自检:用「对抗输入」测试——构造「校验永远不过」的输入,验证是否在 max_iter 内退出并给出兜底结果(而非无限循环);构造「在两状态间震荡」的输入,验证状态指纹检测能中止。边界:势函数定义不当(如把「答案长度」当势)会误判(长答案未必更接近正确答案),势函数必须与「任务完成度」强相关且可判定。 常见错误:只设全局步数不设循环内 max_iter;用不可判定的量当「进展」;无状态指纹导致活锁;终止时不产出兜底结果。 评分要点:硬边界 + 势函数 + 无进展/活锁检测三层;兜底节点;势函数需可判定;可观测字段。 追问/变形/还能这样考:用图论上的「强连通分量 + 势函数」形式化终止性(接 U15-Q03 的图);把终止性写成性质测试而非穷举(状态爆炸);终止兜底与降级/拒答的衔接(接 U14-Q06)。
题目编号:TRACK-03-U15-Q08
题型:逻辑概率 | 考点:多智能体协作 / 冗余与仲裁 / 概率计算 题干:一个「构建者-批判者」协作:构建者独立给出答案,正确概率 0.6。批判者审查该答案:若构建者答案错误,批判者以 0.8 的概率发现并给出修正(该修正本身正确的概率为 0.9);若构建者答案正确,批判者以 0.1 的概率误报(此时「修正」有 0.7 的概率仍然正确)。求 (a) 系统最终答案正确的概率;(b) 最终答案错误的概率,并核对两者之和为 1。 假设与边界:设事件:A=构建者正确;B=批判者发现错误(在 A^c 下概率 0.8);C=在 A 下误报(概率 0.1);修正正确性:A^c 且发现→修正正确 0.9;A 且误报→修正正确 0.7。各事件按题设独立取值。 解析:分四类路径: A 且不误报:0.6×0.9=0.54 → 最终正确。 A 且误报(0.1) 且修正正确(0.7):0.6×0.1×0.7=0.042 → 正确。 A^c 且发现(0.8) 且修正正确(0.9):0.4×0.8×0.9=0.288 → 正确。 其余:A 且误报且修正错 =0.6×0.1×0.3=0.018;A^c 且发现且修正错 =0.4×0.8×0.1=0.032;A^c 且未发现 =0.4×0.2=0.08。合计错误 =0.018+0.032+0.08=0.13。 (a) 正确 =0.54+0.042+0.288=0.870。(b) 错误 =0.13;0.87+0.13=1.00 ✔。 参考答案:(a) 0.87;(b) 0.13,两者和为 1。 验算/自检:另一种解法(全概率)——P(正确)=P(A)[P(不误报)+P(误报)·0.7] + P(A^c)[P(发现)·0.9] = 0.6[0.9+0.1×0.7] + 0.4[0.8×0.9] = 0.6×0.97 + 0.288 = 0.582+0.288=0.87 ✔。边界值复算:若批判者误报率→0(不误报),P(正确)=0.6+0.4×0.8×0.9=0.6+0.288=0.888;若发现率→1 且修正必对,P(正确)→0.6+0.4=1.0(批判者完美补齐),说明改进主要来自「发现错误」而非「误报后的挽救」。 常见错误:漏掉「误报后修正错误」的反例(只算正例导致和不为 1);把「发现概率」与「修正正确率」相乘时重复计;忘记 A^c 未发现的情况。 评分要点:0.87 与 0.13;四类路径完整且和为 1;正确区分「修正对/错」两个分支。 追问/变形/还能这样考:批判者多轮迭代(接 U13 反思几何);批判者与构建者相关(同模型)时独立性失效;用代价矩阵选批判者阈值(误报/漏报代价)。
题目编号:TRACK-03-U15-Q09
题型:逻辑概率 | 考点:状态机/图编排 / 循环的期望步数 / 马尔可夫期望 题干:一个「规划(Plan) → 执行(Exec)」的循环:从 Plan 必到 Exec(1 步);从 Exec 有 0.5 概率成功进入吸收态 A、0.3 概率回到 Plan(进入下一轮循环)、0.2 概率进入失败吸收态 F。(a) 求从 Plan 出发最终到达 A 的概率;(b) 求从 Plan 出发到达吸收态的期望步数;(c) 求从 Plan 出发,期望「经过 Plan 状态的次数」(含起点那一次)。 假设与边界:马尔可夫链;A、F 为吸收态;初始在 Plan(0 步);每次转移计 1 步;Plan→Exec 概率恒为 1。 解析:记 x=P(成功|Exec)=P(成功|Plan)(因 Plan 必到 Exec,二者相同)。 (a) x=0.5+0.3x ⇒ 0.7x=0.5 ⇒ x=0.714286→0.7143。 (b) e_Plan=1+e_Exec;e_Exec=1+0.3e_Plan+0.5·0+0.2·0 ⇒ e_Exec=1+0.3e_Plan;故 e_Plan=1+1+0.3e_Plan=2+0.3e_Plan ⇒ 0.7e_Plan=2 ⇒ e_Plan=2.857143→2.8571。 (c) 设 N=从 Plan 出发期望访问 Plan 的次数(含起点)。每次在 Plan 必到 Exec,Exec 以 0.3 回到 Plan。故 N=1+0.3N ⇒ 0.7N=1 ⇒ N=1.428571→1.4286。 参考答案:(a) 0.7143;(b) 2.8571 步;(c) 1.4286 次。 验算/自检:另一种解法(几何分布)——每轮 Plan→Exec 的「成功概率 0.5、返回概率 0.3、失败 0.2」,把「成功/失败」合并为「终止概率 0.7」,成功占终止的 0.5/0.7=0.714286 ✔;循环轮数 ~ 几何(0.7),E[轮数]=1/0.7=1.428571,与 (c) 的 N 一致 ✔;E[步数]=每轮 2 步×期望轮数 = 2×1.428571=2.857143 ✔。三者自洽。边界复算:若返回概率→0,则 N→1、E[步数]→2、成功率→0.5/0.7=0.714;若成功概率→1,则 N→1、E→2、成功率→1。 常见错误:把「成功率」写成 0.5(漏掉「返回后再成功」的累积);(c) 把「进入 Plan 的转移次数」与「访问 Plan 的次数」混淆;期望步数漏算每轮的固定 2 步结构。 评分要点:0.7143、2.8571、1.4286;几何视角的统一解释;三个量的自洽核对。 追问/变形/还能这样考:把执行时长随机化求期望完工时间;加入「执行后必校验,校验失败才回 Plan」的多状态版;用矩阵幂求 T 步内成功概率分布。
题目编号:TRACK-03-U15-Q10
题型:扩展延伸 | 考点:扩展延伸 / 跨赛道(多智能体编排 × C++/Python 系统) / 交付物 题干:把一个「多智能体研究编排」同时接入 Python 研究系统(数据/回测)与 C++ 交易/回测引擎(低延迟撮合仿真),让不同角色的 Agent 分别调用二者完成「策略假设 → 回测验证 → 结论」。请给出交付物:编排图(角色/节点/边)、跨语言调用契约、失败与一致性处理、以及端到端的可观测与审计设计。 (无唯一答案,考察思路。) 假设与边界:Python 侧适合数据/统计、C++ 侧适合高保真撮合;两侧数据模型与时钟不同;Agent 不直接下单,只做研究验证;要求可复现、可审计。 解析:交付物四层——① 编排图:假设生成 Agent(读数据/文献)→ 特征/因子 Agent(调 Python)→ 回测 Agent(调 C++ 引擎)→ 评审 Agent(对照 Python 与 C++ 结果)→ 汇总;节点含并行(多参数回测)与汇聚、循环(假设迭代)。② 跨语言契约:统一请求/响应 schema(策略参数、数据快照 ID、时钟口径、结果指标),版本化字段(向后兼容),浮点/时间戳对齐规范,幂等键防重复提交。③ 失败/一致性:C++ 回测超时/崩溃→降级到 Python 近似回测并标注「近似」;两侧结果不一致→评审节点用「口径差异 vs 实现差异」归因,冲突时以更保真者(C++)为主并显式记录。④ 可观测/审计:每节点 trace/span、跨语言 trace 关联(传递 trace_id)、结果快照与版本指纹、可重放。 参考答案:交付物清单——(1) 编排图(节点/角色/边/循环与终止判据/并行汇聚);(2) 跨语言契约(schema + 版本 + 幂等 + 浮点/时间戳对齐);(3) 一致性裁决规则(口径统一→结果比对→归因→主判);(4) 降级矩阵(C++ 不可用→Python 近似并标注);(5) 可观测(trace_id 贯穿、每节点状态与产物);(6) 审计(版本矩阵、快照、可重放脚本);(7) 测试:注入「两侧结果一致/不一致」「C++ 超时」三类场景验证裁决与降级。 验算/自检:一致性测试——同一策略分别用 Python 与 C++ 回测,检查关键指标(收益、换手、最大回撤)在容差内一致;若系统偏差大,先排查口径(复权/费用/成交假设)再怀疑实现。边界:跨语言浮点与时间的细微差异会导致「伪不一致」,需先做对齐规范(十进制往返、时区/时点),否则评审节点会误判为「实现 bug」。端到端正确率 ≈ 各节点正确率的乘积,最弱节点决定上限(呼应长链路错误传播)。 常见错误:两侧时钟/口径未对齐就比对结果;跨语言无幂等键导致重复回测;C++ 失败静默切换 Python 不标注;trace 不跨语言关联导致无法端到端定位;忽略「最弱节点」对端到端正确率的支配。 评分要点:编排图含并行/汇聚/循环与终止判据;跨语言契约(schema/版本/幂等/对齐);一致性裁决(先口径后实现);降级标注;跨语言可观测与审计;对端到端正确率=乘积的认识。 追问/变形/还能这样考:把跨语言延迟预算与背压纳入编排(接 U47/U36);用评测衡量编排端到端成功率(接 U16);把编排状态持久化以支持长流程恢复(接 U39)。