不要从 Prompt 长度开始
一个 Prompt 更长,可能只是因为工具 schema 更详细;更短,也可能是把规则放进了代码或服务端。长度能描述规模,不能直接代表能力和质量。
真正可比较的是六个问题:Agent 被要求扮演什么角色;上下文从哪里来;有哪些工具;权限怎样限制;任务怎样委派;完成状态怎样验证。
身份与任务边界
有的 Agent 被定义成结对程序员,有的强调自主完成,有的更像通用个人助理。身份会影响默认行为:是先解释还是先修改,是只处理代码还是可以操作浏览器和外部服务。
上下文与记忆
比较环境、项目规则、会话历史和长期记忆怎样进入 Prompt。持续运行的个人 Agent 更看重跨会话记忆,仓库内编码 Agent 更看重工作区状态和 Git 安全。
工具与专业化程度
基础工具面通常包含终端、读取和编辑;更专业的系统会增加 AST、LSP、浏览器、图像或定时任务。关键不是有没有,而是是否提供清楚的选择规则与结果验证。
权限与确认机制
关注哪些动作默认允许,哪些动作必须确认,以及限制存在于 Prompt 还是工具执行层。只写原则、没有硬边界的安全设计,可靠性通常较低。
协作与委派
多 Agent 设计需要说明什么时候可以拆分、子任务继承什么上下文、谁负责验收。没有这些规则的并行容易产生重复调查和冲突写入。
交付与纠错
成熟 Agent 会区分“给出建议”和“完成任务”,并规定构建、测试、浏览器检查或外部回执。收到用户纠正后,它还要更新当前目标而不是为旧计划辩护。
用本站完成对比
从 全部 66 组静态对比 选择两个 Agent,先看六个维度的摘要,再进入双方最新版本阅读对应原文。需要追踪演进时,再回到 Agent 首页按发布时间查看历史版本。这样可以把结论一直追溯到具体 Prompt,而不是停留在产品印象。