多 Agent 演示很容易令人兴奋:多个角色讨论、分工、调用工具,看起来像一个小型数字组织。但业务落地关心的是稳定性、成本和可追责性。
拆分 Agent 前先拆任务。哪些步骤需要规划,哪些需要检索,哪些适合小模型快速处理,哪些必须由大模型判断,哪些节点需要人确认。角色来自任务结构,而不是来自组织想象。
系统必须有清楚的业务基线:效果至少达到什么水平,单次任务可接受多少成本,响应时间多长,失败后如何回退。没有基线,就只能展示最好的一次结果。
上线后要持续观察错误分布,而不只看平均准确率。优化可能来自模型、知识库、Prompt、标注标准或流程设计,不能把所有问题都归因于模型。
多 Agent 真正成熟时,人们感受到的不是系统里有多少 Agent,而是复杂任务变得更顺、更稳、更可控。