- 上下文精度
- 31.9%
- 必需角色覆盖
- 1/20
扩展方案明显退化,返回检索与覆盖返修。
让企业经验成为 Agent 可复用的判断力
让多个 Agent 与产品经理基于同一事实工作
知识产生 · 按任务交付 · 评测演进 · 工作流结果
规范、项目经验和业务材料分散,来源权威并不一致。
全量加载造成上下文膨胀;冲突与过期材料会静默进入回答;规则写死在 Skill 中又让知识与流程耦合。
先治理什么能进入任务、由谁裁决、如何失败,再谈检索能力。
即时捕获不是每个对话都触发:只有可能改变未来跨任务行为,并有用户原话或可定位证据时才登记候选。
它不是会话结束 Hook;纯 Agent 推断、当前 TODO、项目进度和一次性 Bug 不进入候选队列。
候选可以先去重或追加证据,显式沉淀、复现或周度复盘再触发五问裁决,决定是否进入正式知识。
小语料阶段,人工权威索引用较低复杂度稳定完成任务路由。
V1 最多返回 5 个文件,没有 Token 硬上限。
文件长度不一会造成上下文波动;知识、角色和跨项目材料增加后,维护与覆盖成本开始上升。
知识角色、跨项目材料和文件长度同时增长,V1 的文件数量控制开始出现波动。
用更强的检索、排序、质量门和 RetrievalTrace 验证规模化能力,但不直接接管生产流量。
V1 保持 stable,V2 只作为 Shadow 旁路进入同题验证。
V2 把查找、排序、冲突处理与组装拆成可观察的分层链路。
第一次明显退化;第二次返修缩小差距,但仍有 6 个完成输出回归。
activation=false:保留 V1 生产基线,V2 保持 Shadow,把有效机制收敛进 V1.5。
扩展方案明显退化,返回检索与覆盖返修。
差距缩小,但 activation=false,V2 保持 Shadow。
V1.5 保留人工权威索引,用 Profile 固定任务、角色与知识边界,再分两阶段查找和审查组装。
第一次冻结检索契约只通过 11/20;九题失败推动候选与覆盖判断返修。
第二次纯检索契约达到 20/20,但模型答案与人工盲评未形成最终结论,整体仍为 incomplete。
候选和覆盖判断未满足冻结 Gold,返回修复。
纯检索契约通过;模型答案与人工盲评尚未形成最终结论。
PRD Writer 与独立 Reviewer 使用同一知识事实基线。
产品部门全员覆盖,渗透率 100%;历史文档缺失的产品优化需求除外。
规则、案例和项目记忆可以独立维护、按任务加载并版本化演进。