不同 run 之间
跨 run
单个 run 做了什么在运行档案里看;这里看的是跨 run的事:run 之间怎么比、整条链上反复出现什么问题、harness 改过什么、现在还有什么没修。登记表(问题、变更、解释)由 G 任务立项与审查验收时人工或 Claude 维护,看板只读。
什么阻塞下一步?问题与待办25 个未解除(P0 12);T1 链启动门未通过为什么改、改后怎样?harness 变更史19 条改动,19 条待验;达到真实 run / 官网验证的 0 条什么问题反复出现?链与专题复盘3 条续做链;三层分开:机器观测 / 规则推断 / 人工解释谁更好、能否比较?实验对比51 次正式运行,按榜并排,标出不可直接比较的
25 个问题未解除(P0 12);19 项 harness 变更待验,其中只做到「已实现」17 项、回放验证 2 项,真实 run / 官网验证 0 项。
- G45-P0-1 截止收尾竞态:截止时先进入 final,执行线程随后丢掉 carryover;前移后的截止没有传…
- G45-P0-2 第三环重复续做旧版本,且把历史 resume 算进本环名额(名额被耗尽)
- G45-P0-3 权重验收失败仍可打分,之后晋级/护栏 seed 悄悄重训,把不同训练结果当成同一冻结权重下的样本
- G45-P0-4 祖先 run 事后被污染(TAINTED),第三环仍可能打包其被改动的轨迹
其中 44 条起草自文档、待用户核对。来源:notes/plan/issues.tsv(更新 2026-10-03)、notes/changelogs/harness_changes.tsv(更新 2026-10-03)。
读这些页面时最容易读错的三件事
- 混尺子:把评分器的 50 分当成我们流水线的基线(实测照抄基线 T1 是 46.9);评分口径、数据纪元、预算、seed 不同的 run 不能直接比。
- 把相关当因果、把重复当独立:同一条链的各环、同一批的几个 seed 不是独立样本;单次领先不能说成方法更好。
- 把「已实现」当「已生效」:代码合入、单测通过、回放里的现象都不等于真实 run 或官网上的收益;旧文档也不是实时状态,以登记表和档案为准。
机制说明与各机制「目前效果」见工作原理 · 跨 run 是怎么优化的。