先做信息对等,再谈模型能力:Agent 失败时该优化系统还是模型

Agent 做错判断时,不要先凭感觉升级模型或增加工作流。先冻结模型实际可见的输入,再用同输入可解性、信息增量和输出唯一性三项测试定位问题究竟在推理侧、系统侧还是任务契约。

2026年8月28日 · 3 分钟 · map[name:Jeanphilo]

从复合意图到可执行查询:面向实体的多源证据编排

当一个自然语言要求同时涉及多个主体、结构化事实、附件和原文时,可以先将复合意图编译为带主体的原子查询,再完成实体绑定、多源执行与按主体归并。知识图谱只是可选的主体解析工具,不是这套模式的本体。

2026年8月17日 · 4 分钟 · map[name:Jeanphilo]

为什么 AI 在代码领域最先自动化

代码领域之所以最早得到 AI 自动化,不只是因为代码适合大模型,而是因为软件工程已经拥有版本控制、测试、增量提交和回滚机制。其他领域并不是没有评价标准,而是缺少把标准绑定到中间版本上的工作流。文章、小说、视频、3D 模型等复杂作品也能被拆解、验证、冻结和追溯;而且文字领域天然拥有经典作品、评论和写作理论作为 reference corpus。一旦这些参照物被转成任务、rubric 和 checkpoint,AI 可能比在代码领域释放出更强的能力。

2026年5月21日 · 4 分钟 · map[name:Jeanphilo]