先做信息对等,再谈模型能力:Agent 失败时该优化系统还是模型
Agent 做错判断时,不要先凭感觉升级模型或增加工作流。先冻结模型实际可见的输入,再用同输入可解性、信息增量和输出唯一性三项测试定位问题究竟在推理侧、系统侧还是任务契约。
Agent 做错判断时,不要先凭感觉升级模型或增加工作流。先冻结模型实际可见的输入,再用同输入可解性、信息增量和输出唯一性三项测试定位问题究竟在推理侧、系统侧还是任务契约。
当一个自然语言要求同时涉及多个主体、结构化事实、附件和原文时,可以先将复合意图编译为带主体的原子查询,再完成实体绑定、多源执行与按主体归并。知识图谱只是可选的主体解析工具,不是这套模式的本体。
代码领域之所以最早得到 AI 自动化,不只是因为代码适合大模型,而是因为软件工程已经拥有版本控制、测试、增量提交和回滚机制。其他领域并不是没有评价标准,而是缺少把标准绑定到中间版本上的工作流。文章、小说、视频、3D 模型等复杂作品也能被拆解、验证、冻结和追溯;而且文字领域天然拥有经典作品、评论和写作理论作为 reference corpus。一旦这些参照物被转成任务、rubric 和 checkpoint,AI 可能比在代码领域释放出更强的能力。