AI 岗位预备 · 深入
写进简历的 Agent 项目,会被深挖到第三层
面试官一眼就能看出你是「学」还是「做过」
Agent 岗的面试结构其实很稳定:项目深挖占一半以上的时间,剩下的分给系统设计、技术原理与编码手撕。而项目深挖有四问几乎 100% 会问 ——「你的 RAG 召回率多少?怎么测的?怎么优化的?」「Agent 遇到死循环怎么处理?终止条件怎么设计?」「为什么选 LangGraph 而不是 AutoGen?」「线上出过什么问题?怎么排查的?」这份做法把四类深挖点与必问四问拆成四层,每层给判据与答法 —— 目标是让凡写进简历的项目,架构分层 · 评测指标 · 异常处理三层都能展开讲。
追问现场 · 面试真题
面试真题“请详细描述你项目中采用的 Multi-Agent 三层架构(Router → Manager → Sub-Agent)的设计逻辑。”
大多数人的第一反应:把三层名字背一遍,说「这样架构清晰、易扩展」——听完还是不知道你为什么这么切——架构是从教程抄的,没自己做过取舍
面试官要的是每一层的划分理由与替代方案对比:为什么不用两层、为什么不用单 Agent 加编排(核心词:划分理由 + 替代方案对比 + 失败降级),面试官要的是每一层的划分。
先说结论
先说结论:项目深挖按四层准备,第四层才是拉开差距的地方。第一层「做过什么」· 第二层「怎么评测」· 第三层「异常怎么办」· 第四层「为什么是它而不是别的」。简历上每一个 Agent / RAG 项目,都要能讲到第四层。
基础层 · 行业方案
① 做过什么(占面试时间 50% 以上)。要具体到可复述:任务是什么、用了什么模型与框架、数据从哪来、产出长什么样。修法:讲功能前先讲「要解决什么问题」。
② 怎么评测。「你的 RAG 召回率多少?怎么测的?怎么优化的?」——评估要从两条线答:检索侧(召回率 / MRR)与生成侧(忠实度 / 答案相关性)。修法:预算很小但要覆盖各类场景的评测集。
③ 异常怎么办。「Agent 遇到死循环怎么处理?终止条件怎么设计?」——三板斧(最大步数 / 重复动作检测 / 超时)是及格线;能讲清死循环真长什么样才是区分度。修法:说清「原地打转」与「向前失败」的区别。
④ 为什么是它而不是别的(选型)。「为什么选 LangGraph 而不是 AutoGen?」——要给出对比维度并落到自己的场景。修法:准备一套有取舍逻辑的表述,比背定义有用。
执行层 · 我们的增量
⑤ 我们的增量:「线上出过什么问题、怎么排查」要当成必答题准备。这道题的判据不是「有没有出过问题」(谁都会出),而是你能否说出一次具体的现场、根因与修复动作。准备方式:给每个写进简历的项目留一份「事故卡」——现象 / 定位过程 / 根因 / 修复 / 防御。没有事故卡的项目,宁可不写进简历。
真实事故(事后回看):真实事故(事后回看):训练侧按 460 写、检查侧拿 540 核对 —— 每个新产物都判不合格 → 退回 → 重做 → 再判不合格 → 暂停。链条是:基准切换 → 检查标准未同步 → 每一件必不通过 → 流程空转。根因不是有人写错,而是标准迁移不完整。
事后补的防御(避免重演)
凡是「两方各持一套标准」的环节,都要在开工前对齐一次基准并留下版本号与时间戳;连续三次不合格时,先查标准是否同版,而不是继续重做。。核心原则:**连续失败先查标准,不是先重做**。
面试官想听什么
能按四层展开:做过什么 → 怎么评测 → 异常怎么办 → 为什么是它而不是别的
评测给两条线(检索侧与生成侧),并说得出评测集是怎么搭的
死循环能讲根因(推理循环 vs 流程循环),不止三板斧
选型有对比维度,且能落到自己的场景约束上
有一次具体的线上事故:现象 · 定位 · 根因 · 修复 · 防御
加分项:主动区分「推理死循环」与「流程死循环」——前者是 ReAct 循环没有出口,后者是两方标准不一致导致的空转。两者的治理完全不同(前者加停止条件,后者对齐基准),能分开讲说明你不止跑过 demo。
可复制 · 救急段
面试官让你描述 Multi-Agent 架构,别背三层名字——先讲「为什么必须切这三层」,再给替代方案对比(两层为什么不成立、单 Agent 加编排差在哪),最后补一句失败降级。加分项:主动区分推理死循环与流程死循环。