04 / Judge
Judge 是独立意见,不是计分板。
有 LLM Judge。它出现在所有「实现者不能同时当裁判」的地方。它从不是投票,也不是可以代替你阅读的分数。
Arena / 跨模型 judge
- 看见什么
- 私有 rubric,按路径标签的候选产物。看不到模型名。
- 做什么
- 逐条打分,推荐一个 base,并说明理由。与父代理自己通读并行,不与候选人并行。
- 人还要做什么
- 父代理必须自己读完全文。和 judge 选同一个 base 是确认。分歧先怀疑偏见或 rubric 含糊。
Eval / 盲评 judge
- 看见什么
- 消毒过的标签和同一把尺子。一次过完所有变体。
- 做什么
- 在同一量尺上打分。两次分开的 judge 跑法不能比,校准会漂。
- 人还要做什么
- 先读所有产出,再看裁决。不同意时先改 rubric,不要先改自己的判断。
Interrogate / Lead
- 看见什么
- 目标、约束、时间线、已经做过的取舍。评审者只看到切片。
- 做什么
- 去重、标共识、把每条放进 Act on / Consider / Noted / Dismissed。不自动改代码。
- 人还要做什么
- 必须展示 Dismissed。Lead 不是神谕。你可以推翻它。
Reflect / 综合者
- 看见什么
- 三个并行评审者对一次会话的提案。
- 做什么
- 分成 Accepted / Rejected / Backlog。未经你批准不改技能。
- 人还要做什么
- 只接受会改变未来决策的提案。一次怪异会话是轶事,不是规则。
Shipping / 独立 verdict
- 看见什么
- 绿的堆栈。旧裁决和当前 commit。
- 做什么
- 每个 PR 由新鲜代理独立判定。只落地连续已验证的那一段。
- 人还要做什么
- 绿不等于可以合并。绿只说明可以进入合并决策。
figure-it-out / 工人旁的 judge
- 看见什么
- 委托产物和完成谓词。
- 做什么
- 配对每个委托。工人博弈门禁就重置并硬化契约。门禁错了就单独修门禁。
- 人还要做什么
- INCONCLUSIVE 不是通过。空白截图能通过的门,先怀疑观察方法。
Judge 的共同纪律
候选人看不到评分标准。看见了就会为分数写作,而不是为任务写作。
Judge 看不到模型名。标签消毒。否则品牌偏好会污染选择。
父代理自己通读。只信摘要,等于把综合也外包了。Arena 里略读 N 个候选,通常只会选那个表面最眼熟的。
选的是可被未来维护者延展的 base,不是最炫的那个。平手时选更干净的边界、更小的表面。然后把失败者身上的一两点嫁接进去,用手折进同一个心智模型,不要机械粘贴。
全体收敛到同一形状,是强信号,记下然后交货。全体狂散,说明 brief 没写清。重新框,不要平均分歧。