给第一次看的人
工作原理
这个面板在看一件事:agent 搜出来的建模代码,在官网上到底有没有更好。下面按「是什么 → 怎么跑 → 谁在干什么 → 怎么变好 → 现在怎样」讲清楚;每个机制后面都写了「目前效果」,只引用档案和文档里已有的数字,没有证据的写暂无证据。
一、整个系统在干什么
一句话:让大模型 agent 自己搜索、编写、评估建模代码,去预测虚拟胚胎挑战(VEC)各题里「下一个发育阶段的细胞表达」,最后把分数最高的预测交到官网。
- 考什么:T1 用 E8.5、E9.5 预测 E10.5;T2 是心脏 / 全胚的插值与外推;T3 预测 Gata4 敲除。真值要到 10-20 才公开,所以官网每日只给有限的打分次数(P2 阶段每任务每天 8 次,来源 项目计划总览(notes/plan/README.md))。
- 搜什么:每个 run 是一棵「程序树」,每个节点是一份候选建模代码(
solution/run.py)。agent 不断:想方案 → 写代码 → 在本地「尺子」上打分 → 留下好的、改进它。 - 本地「尺子」是什么:真题的答案看不到,所以用手头已知阶段造几道本地题(proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。、proxy10、X3 等)给候选打分。尺子能不能预测官网分,是整个项目最大的不确定性,见第六节。
- 人在哪:run 一旦锁定,人不看不改(官网规则 §9)。人和 Claude Code 只在两个 run 之间改配置、提示词、种子,挑要提交的预测、上传官网。
- 谁写平台代码:平台由 Claude Opus 子 agent 实现;run 内的研究 agent 用 qwen3.8-max(部分角色经 VM 中继用 Opus,见 16 LLM 中继与回退链)。
细节以 10 算法搜索架构(D = ERA + tune) 为准,决策原因见 决策记录 decisions.tsv。
二、一个 run 的主流程
一个 run 从「锁定」到「提交」的全过程如下图。上半是启动和起点,中间方框是每个节点都走一遍的流水线(同时跑 2 个节点),下半是收尾和下一环。
LLM 角色(agent) 程序 / 服务(不调用模型或只执行) 人或 Claude Code 在 run 之间做的事 判断点。虚线 = 回到上一步。
图里几个词
- draft(新方向)?搜索节点的一种操作:从空白开始,按方法族库换一个全新的方法族起草最小版本;另两种是 improve(在父节点上改结构)和 debug(修运行错误)。:节点的三种操作之一。每个节点开始时抽一次签:T1 约 30% draft(新方法族)、15% debug(修错)、其余 improve(深化);T2 的 draft 是 15%。tune(调参)代码保留但现行配置关闭。
- A 半 / B 半:每把尺子的真值分两半,Engineer 自测只能查 A 半,搜索打分用 B 半,防止程序迎合打分数据。
- 照抄基线?copy_last:把最后一个输入阶段的细胞原样当预测交上去,是所有改进要超过的底线;我们流水线实测的官网分是 T1 46.9,不是评分器参考线 50。 copy_last:把最后一个输入阶段原样当预测。所有「改进」都要先超过它。
- 种子:搜索起点程序(种子程序?搜索的起点程序(copy_last、ot_moscot 等),分 anchor / exploration / active / reference_only 四种状态;不是随机种子。),不是随机数种子。
三、各个 agent 角色
搜索树的每个节点由 4 个 LLM 角色(Researcher、Engineer、Analyst、Reviewer)加 2 个新增的合规角色(Compliance、Data agent)接力完成;run 外还有审计、分析两个 agent。「目前效果」只写档案或文档里有的事实,没有就写暂无证据。
| 角色 | 干什么 | 输入 → 输出 | 什么时候触发 | 用什么模型 | 目前效果 |
|---|---|---|---|---|---|
| Researcher 研究员 | 看父节点、全树实验表、教训表和知识库,提出这个节点要做的方案;可查文献(每节点 ≤ 10 次)和数据集元数据。 | 父节点分数 / 分项 / METHOD / 代码开头 / 分析;全树表;知识库前 3 条;教训表 → PLAN.json(方法族、机制、关闭机制对照、可带数据请求) | 每个新节点(improve / debug / draft);单轮调用,15 分钟上限 | relay_cli 的 Opus,回退 qwen3.8-max | 这一环没有「去掉 Researcher」的对照实验。 暂无证据。已知问题:方案被证否后原样回退的节点占槽位 19–21%(G39 任务书 §0.1),已改成必须交备选机制,改后效果暂无数据。 |
| Compliance 合规审查 | 删掉 PLAN、检索文本、数据说明中涉及保留阶段测量值的句子;主要段落过半被删就退回重写一次。 | 正则 + 单轮 LLM 判句子是测量值 / 机制 / 规则 / 方法 → 修改后的 PLAN,附 [compliance: removed] 标记 | Researcher 之后、Engineer 之前;Data agent 取回的数据入库前也审 | relay_cli Opus,回退 qwen3.8-max | 暂无证据:2026-10-03 才接进控制器(15 Compliance、Data agent 与 vec-data),本页还没统计到使用它的 run 的删句比例。 |
| Data agent 数据员 | 按 PLAN 里的数据请求下载外部数据,先按元数据、再逐细胞删掉本任务禁窗内的样本,算哈希、写目录,通过后挂进视图并存档供以后的 run 复用。 | data_requests(accession + 用途)→ 隔离区 → 删窗 → external/dynamic/<id>/,数据纪元 +1 | 仅当 PLAN 带数据请求;多轮会话,30 分钟上限 | qwen3.8-max(opencode) | 暂无证据:新角色。已有的旁证:此前挂进视图的外部训练数据「几乎没被中选程序真正用到」(G39–G43 任务书(2026-10-03) §7.3),所以「更多数据 → 更好」还没有证据。 |
| Engineer 工程师 | 在沙箱里实现方案、调试、自测。能用 vec-score(每节点 ≤ 20 次,只看 A 半)、vec-check、vec-gpu。 | 方案 + 评分规则简报 + 父节点代码 + 全树表 → solution/ 与 METHOD.md | 每个新节点;不设固定时限,180 秒无动作记一次停顿,连续 3 次结束 | qwen3.8-max(Token Plan),bwrap 沙箱,只放行 LLM 域名 | 会话 77–83% 的时间在等模型(G39–G43 任务书(2026-10-03) §7.2);旧的 30 分钟限制让 draft 里 3/4 撞限、判失败(G39–G43 任务书(2026-10-03) §0.1 4c),已改为不设固定时限。改后的失败率暂无数据。 |
| 执行与打分 程序,不是 agent | 无网络沙箱里重跑候选,在 B 半真值上打分;关闭机制对照(--ablate)检查新机制是不是真起作用;视图盲检查防止程序读到被伪装掉的视图信息。 | solution/ → 各尺子的分项分数、mechanism_active、view_dependent 标记 | Engineer 提交之后 | 不用模型 | 对照与盲检查的统计暂无汇总(档案里有逐节点记录,见各节点页)。 |
| Analyst 分析师 | 读本节点的变化量表、diff 和 Engineer 最后的话,写这次改动为什么有效 / 无效,并给出教训。 | 变化量表 + PLAN + diff → ANALYSIS.json(后续节点能看到父节点和前几名的完整分析) | 每个节点执行之后;10 分钟上限 | relay_cli Opus,回退 qwen3.8-max | 暂无证据:没有做过「去掉 Analyst」的对照。 |
| Reviewer 审查员 | 检查越界读取、硬编码目标阶段统计量、读保留数据、钻评分器漏洞;判 fail 的节点不能当父节点也不能进终选。 | 源码 + PLAN + 视图 manifest(内联)→ REVIEW.json | 节点排进前 10% 且高于最好种子;Engineer 没写完 METHOD 的节点晋级前必审 | relay_cli Opus,回退 qwen3.8-max | 暂无证据:没有按 run 汇总的「拦下多少个」统计。 |
| 终选控制器 程序 | 停止挂载数据,去重后取前 5,在最终数据纪元里跑 3 个 seed,再过终选护栏;护栏不过就交 copy_last。 | 候选 → final/ 预测和 SELECTION.md | 预算最后阶段(预留时间按实测估算) | 不用模型 | T1 官网 ≥ +2.6 的 5 个程序回放时全部通过护栏;但台账里没有低于 copy_last 的程序,护栏拦坏程序的能力没被检验过(10 算法搜索架构(D = ERA + tune) §5)。 |
| 轨迹审计 G50 run 外 | run 打包后,用正则 + LLM 扫全部轨迹和代码,找保留阶段数据泄漏;是提交前的闸门(fail 不能交,review 要人放行)。 | 全部轨迹、程序库、SELECTION → AUDIT.json | 每个正式 run 打包后自动跑;提交前再核一次 | relay / Opus / qwen(agent/audit/llm.yaml) | 暂无证据:审计目录里还没有记录。 |
| 轨迹分析 G44 run 外 | 读整个 run 的事实包,找「槽位时间花在哪、选父 / draft 哪里浪费」,出改动提案;白名单内的改动(提示词、方法卡、方向库、搜索参数)自动应用并备好下一环配置,黑名单等人批。 | 事实包 + 现行白名单文件 → META.json、_apply.json、下一环配置 | 每环结束后 | 由 agent/audit/llm.yaml 的 profile 决定(relay / opus / qwen);调用失败时本轮不出提案 | 暂无证据:17 run 外的审计与分析 agent §7写明还没有在真实 run 上验收,G45 调度器未接线。 |
| 报告写手 G28 run 外 | 根据事实包写每个 run 的中文迭代报告,数字有核对程序。 | 事实包 → notes/reports/runs/*.md(本站「报告」页) | run 结束后 | 报告页头注明写作模型(已有报告为 qwen3.8-max) | 已生成 7 份文件(含汇总报告)。 |
| 通知 G51 程序 | 每 2 小时的健康邮件、每个 run 的终选结果、额度耗尽告警;看板「用量与花费」页统计 token。 | 档案与用量记录 → 邮件 | 定时 / run 结束 | 不用模型 | 只是通知,没有效果指标。 |
模型与回退:每个角色有回退链「Token Plan 千问 → 百炼按量千问 → Opus」,每次调用记 token。Claude 凭据只在虚拟机,Spark 通过反向隧道的LLM 中继?Claude 凭据只放在虚拟机里,Spark 通过反向隧道的中继调用;模型挂掉时按回退链换下一个模型。调用(16 LLM 中继与回退链)。凭据中继「部署待用户」,所以 Opus 角色目前可能实际跑在回退模型上,以各 run 的锁文件为准。
四、run 内是怎么优化的
一个 run 之内,优化靠这几件事:谁来被改进(选父)、改什么(三种操作)、怎么判断变好了(尺子 + 复测)、最后交哪个(护栏)。
| 机制 | 怎么运转 | 目前效果 |
|---|---|---|
| 节点树 + FUTS 选父 | ERA 的选父算法原样使用:按排名分加探索项在全树里选最值得继续的节点;虚拟访问、忙父回避、连续失败降权避免「同一个父节点被反复选中」。 | ERA 原型实测的现象(同父连续被选、多次超时)是设计这些包装的原因(10 算法搜索架构(D = ERA + tune) §1.1)。 包装层本身没有单独消融。 |
| 三种操作 + 方法族覆盖 | draft 从方法族库(T1 共 11 族)按覆盖顺序起草新方向,覆盖完后用 bandit 在「探索」和「复测收益大的族」之间分配;improve 深化;debug 修错。平台期(连续 8 个已打分节点没刷新前 5)draft 概率临时升到 0.5。 | 暂无证据:覆盖调度与平台期策略在 2026-10-03 才合入,G39–G43 任务书(2026-10-03) §7.2写明随下一轮启用,暂无运行数据。 |
| 本地尺子 proxy / proxy2 / proxy10 / X3 | 候选在本地几道「已知答案」的题上打分,节点分 = 目标分量的加权均值。T1 目标是 proxy10×1 + X3×2;T2 插值用本榜 proxy;T2 心脏外推用去掉尺寸项的 proxy_noscale;T3 没有可靠本地尺子,走 agent 模式。 | T1:X3 与官网的 Spearman ρ ≈ 0.77,但收益幅度只有官网的约 0.4 倍;proxy10 对两输入程序完全看不见;X1、X4–X6 没有可用正相关。T3:本地尺子在 3 个官网点上完全反序(ρ = −1)。(10 算法搜索架构(D = ERA + tune) §5) 结论:本地分只能辅助,不能单独预测官网分。 |
| 尺子泄漏规则 | 智能体可见的文本不得写出本地尺子目标阶段的统计量,否则尺子就失效。 | T2 心脏外推:方向库写了 E9.5 的 RMS,程序据此得到 proxy 尺寸项 +4.15,官网只有 49.6(10 算法搜索架构(D = ERA + tune) §6)。之后该榜改用 proxy_noscale。 |
| 晋级复测 晋级复测 | 按候选身份去重后,排名分前 5 的节点用 seed 1、2 再跑,之后用 3 个 seed 的均值排名。 | 设计目的是挡掉「一次运气」; 本页没有统计晋级前后排名变化。暂无证据 |
| 候选去重 / 已证否方向 | 代码树相同、预测相同、或多 seed 分数逐位相同的节点算同一个候选;原样回退的节点记「已证否方向」,下次 Researcher 与 Engineer 都能看到。 | 轨迹报告发现终选前 5 名在 scr-D 里 5/5 是同一程序的副本、A 里 4/5(G39–G43 任务书(2026-10-03) §0.1 4a),所以加了去重。 改后效果暂无回放结果。 |
| tune(调参)算子:现行关闭 | 借鉴 OpenEvolve 的便宜多轮修改,专门调已证实机制的参数。 | 全部 D 组 run 里 40 个 tune 节点只有 1 个被接受(r2-D-s1 #16,+0.8);T2 D run 里 tune 占约 1/4 节点槽(2026-10-03 决定),所以默认关。 D 比 A(只差 tune)在三个榜各高一点:T1 53.4 vs 52.0、心脏插值 63.9 vs 61.1、全胚插值 61.7 vs 59.9,每榜只比了一次。 |
| 预算、并发与终选预留 | 每个 run 有墙钟预算(T1 链 24 h,其余 12 h)和 max_nodes;同时 2 个节点;终选预留时间按候选实测时间估算,只会把截止往前移。结束原因记在 stop_manifest(budget / agent_early_exit / infra / operator)。 | r2-D 的结束是预算到了,不是搜索收敛(G39–G43 任务书(2026-10-03) §7.2)。 终选预留的估算偏小问题见第五节已知限制 #8。 |
| 健康监督 | 每分钟读候选进程的 CPU、自己的 GPU 计算、I/O,30 分钟无活动判 hung;现阶段 enforce: false 只观测。 | 暂无证据:误判率还在统计中(18 跨环续做与 seed 策略 §4)。 |
| 终选护栏(回退基线) | 终选只选 1 个候选,它与 copy_last 在新 seed 3–7 上配对运行,配对增益的单侧 97.5% 下界 > 0 才替换;否则交 copy_last,不再试别的候选(避免多重检验)。T2 用旧式护栏(每把尺子 3 seed 均值都高于 copy_last + 1)。 | 官网 ≥ +2.6 的 5 个程序回放时全部通过;护栏挡坏程序的能力没被检验。 另见首页「之前做得怎样」里各题最近一次终选是否回退。 |
想看某个 run 实际怎么走的,从运行档案进入节点树、每个节点的方案、代码改动和分析。
五、跨 run 是怎么优化的
跨 run 的优化有两层:把工作带到下一环(节点、未做完的会话、训练好的权重),和把经验带到下一环(知识库、教训表、方向库、种子取舍、G44 提案)。两层都只在两个锁定 run 之间发生。
| 机制 | 怎么运转 | 目前效果 |
|---|---|---|
运行链与 continuation(--continue-from) | 每个题目一串锁定的 run;后一环导入上一环的已打分节点(评测指纹相同就不重评)、已证否方向,祖先链轨迹作证据。run 内不能改配置,所以「总结问题、改进自己」只发生在两环之间。 | 档案里有 3 个接续运行:20261003-172000-search-t2-heart-extrap-chain-12h、20261003-171955-search-t2-embryo-interp-chain-12h、20261001-114429-search-t1-g18-continue。 其中最早的 G18 续跑:导入的 9 个节点重打分与原分数完全一致,新节点最好与续跑前最好差 0.0,报告判「不算提升」(见 20261001-114429-search-t1-g18-continue 的迭代报告)。 正式的 T1 24 小时链尚未启动,等修复(见下)。 |
| 跨环续做 跨环续做 | 环交接点(截止 − 节点收尾时间)时,没做完的 Engineer 会话或被截止切断的训练,封存成逐文件校验的只读快照;下一环校验通过后优先续做(每环最多 4 个),新开 Engineer 会话,带上原方案和「交接摘要」(上一段改了什么、最后的消息节选)。 | 暂无证据:2026-10-03 实现,档案里还没有真实跨环续做。Codex 审查结论:「当前实现还不能放心用于正式跨环链」(Codex 对跨环续做的审查(2026-10-03))。 |
| 权重复用 | 训练型程序声明 per_view 权重:每个视图第一次权威执行训练并不可变登记;之后晋级 seed、终选护栏、下一环按缓存键回放,不重训。缓存键 = 代码树 + 训练种子 + 视图内容 + 依赖环境 + --ablate 参数。已登记的权重缺失或哈希不符就报 interrupted,不悄悄重训。 | 动机:同一候选被重复执行约 9 次(权威、对照、晋级 2、护栏 5),30 分钟上限对 OT / CFM / VAE 太紧(18 跨环续做与 seed 策略 §0)。 Codex 发现验收失败仍可打分、之后悄悄重训(P0 #3),缓存键也没覆盖 GPU 环境注入(P1 #11)。 |
| 护栏 seed 轮换 | 链上每一环护栏用的新 seed 不与此前各环重叠(3–7 → 8–12),减少多环反复用同一真值集的适应性偏差。 | 已知副作用(Codex P1 #9):换 seed 会改变评测指纹,导入时清空旧分数,只有 top-k 被重评,其余节点永久成为历史。 修复方向是区分「搜索分数可比指纹」和「终选规格」。 |
| 知识库 知识库(k0xx) | agent/knowledge/ 下 72 个条目(人工整理、带出处);Researcher 按 BM25 取前 3 条。官方知识图谱(KG)含目标阶段的表达事实,不能挂进 run 内,只能锁外由人审核后写成条目,且不收 Theiler ≥ TS16 的断言;check_knowledge.py 扫描目标阶段统计量(现在默认只警告)。 | 暂无证据:没有「有 / 无知识库」的对照。已知风险:本地规则与官网不一致时以官网为准,知识里不得出现保留阶段测量值(G39–G43 任务书(2026-10-03) §7.4)。 |
| 教训表 教训表 | 每榜一份 lessons_<榜>.md,按方法族汇总:试过几次、机制是否生效、本地最好 3 seed 差、失败数、Analyst 教训,以及该族被提交程序相对 copy_last 的官网差。只附给 Researcher 和 Analyst,不给 Engineer;不含分项、逐基因信息。官网差只用于在方法族之间分配精力。 | 暂无证据:2026-10-03 加入(2026-10-03「官网分以方法族相对差进入教训表」),还没有用过它的 run 与没用的对照。 |
| 方向库 ideas 文件 | agent/prompts/ideas_<榜>.md:T1 有 11 个方法族(分连续动力学、命运分支、分布结构三类)和合规前言;draft 按它排覆盖顺序。库里不写分数。 | 暂无证据:T1 的 draft 覆盖效果等下一轮;此前 D 组里的 draft 节点是否更好没有单独统计。 |
| 种子策略 | 种子程序分 anchor(只有 copy_last)、exploration(已准入,子节点上限 3,有复测收益才转 active)、active、reference_only(只作对照)。准入要有合规与机制生效记录(ADMISSION_*.md)。 | T1 现有 exploration 种子:ot_moscot、composition_trend(2026-10-03 准入);目前没有静态的 active 种子(10 算法搜索架构(D = ERA + tune) §4.2)。 |
| G44 分析 → 下一环 | 上一环的轨迹分析提案里,白名单内的自动应用并写下一环配置;黑名单(评分器、护栏、预算、ERA 核心)必须人批。 | 暂无证据:见第三节。 |
| 数据与审计的跨 run 积累 | Data agent 下载并通过 Compliance 的数据永久存进 data/external/,以后的 run 直接挂载;每个 run 的审计结论进入 notes/reports/audit/index.json。 | 暂无证据:数据复用效果暂无。 |
教训表实例:lessons_T1__val.md(前 70 行;这就是附给下一个 run 的 Researcher 和 Analyst 的内容)
跨 run 教训表 · T1:val(2026-10-03,自动生成)
用法:官网差只用于在方法族之间分配精力,不能用来反推目标阶段的性质(规则 §10:分数只能用来选择,不能用来计算预测)。本表只含方法族级别的聚合数字,没有逐基因或逐细胞信息;官网分项只以指标组的定性等级出现。分项只用于在方法方向间分配精力,不得用来推算目标的任何性质;不要据此在代码里写任何目标阶段的取值。
来源:最近 22 个已结束 run(r2-D-s1, r2-D-s0, scr-D, scr-C, scr-B, scr-A, x3-era-mechcheck, abc-r1-C-native, abc-r1-B-population, abc-r1-A-era, abc-r0-C-native, abc-r0-B-population, abc-r0-A-era, g21q-D, g21q-C, g21q-B, g21q-A, g23-spark, g18-continue, spark-c3, spark-eng-default, spark)。「本地差」= 该族节点的 seed 平均目标分 − 同一 run 的 copy_last;各 run 的本地目标不同(2X3+proxy10、X3、X3+proxy+proxy2、X3+X4+X5+proxy+proxy2、X3+X4+X5),只在同一目标内比较,跨目标的本地差不可比。机制生效 / 假设成立来自 Analyst 判定(生效数/已判定数);方法族取 PLAN 的 family_id,缺失时取 Analyst 判定。
官网参照(固定,不随新提交变化):我们流水线 copy_last(台账 2026-10-02,机制检查 run 的护栏输出);台账行 20261002-135403-search-t1-x3-era-mechcheck(submission_id c1fdc7d1),官网分 46.9。官网差 = 程序的官网分 − 该参照。
来源审计:未审计(旧 run,照常纳入):22 个。
当前官网冠军与对照
冠军:t1-r2-D-s0 节点 21(composition_program),官网差 +8.1,目标 2X3+proxy10 下本地差 +7.0;领先第二名 1.6 分,单次提交,未经重复。祖先链(从种子到冠军):
| 节点 | 类型 | 族 | METHOD 首行 | 本地目标分变化 | 机制生效 |
|---|---|---|---|---|---|
| 3 | seed | seed | composition_trend | — | — |
| 4 | improve | composition_program | composition_trend + 型内拟时序表达平移(已实现并筛查 | -0.2 | no |
| 8 | improve | composition_program | composition_trend + 型内表达重锚定 | +1.9 | yes |
| 10 | improve | composition_program | composition_trend + 型内表达重锚定,α 扫描延伸至拐点 | +0.5 | no |
| 14 | improve | composition_program | composition_trend + α=3 重锚定 + 两阶段逐基因方向位移(按细胞型 EB 收缩,β=1 | +0.7 | yes |
| 21 | improve | composition_program | composition_trend + α=3 重锚定 + 置信度加权稀疏型内位移 | +0.1 | yes |
关键改动:把父节点(14)的均匀型内位移核(β=1,中位数门控)换成置信度加权稀疏核;起点种子:composition_trend。
对照(同一目标 2X3+proxy10 下,官网明显更低的已提交程序):
- t1-r2-D-s1 节点 25(growth_dynamics):本地差 +8.9(冠军 +7.0),官网差 +3.2(冠军 官网差 +8.1);单次提交;祖先族 growth_dynamics;末步 growth_dynamics v3
由此可学的(机械对比,只看机制层面):同一尺子下,growth_dynamics 相对冠军所在的族「composition_program」本地更高但官网更低;冠军末步「composition_trend + α=3 重锚定 + 置信度加权稀疏型内位移」,对照末步「growth_dynamics v3」。每个官网差都只有单次提交,只用来在族间分配精力。
方法族汇总(other 放在表末)
| 方法族 | 试过 | 机制生效 | 假设成立 | 本地最好差(目标 差) | 失败 | 官网差 |
|---|---|---|---|---|---|---|
| lowrank_shape | 23 | 8/23 | 1/23 | 2X3+proxy10 +4.9;X3 +14.5 | 0 | +5.1(n=1†) |
| composition_program | 12 | 5/11 | 0/11 | 2X3+proxy10 +7.0 | gen 1 | +8.1(n=1†) |
| local_ot | 12 | 9/12 | 2/12 | 2X3+proxy10 +1.7;X3 +12.1 | 0 | +2.6(n=1†) |
| growth_dynamics | 7 | 2/7 | 0/7 | 2X3+proxy10 +8.9;X3 +2.2* | 0 | +3.2(n=1†) |
| stochastic_bridge | 3 | 0/3 | 0/3 | X3 +2.4 | 0 | +0.9(n=1†) |
| manifold_ode | 14 | 4/12 | 0/12 | 2X3+proxy10 +5.8;X3 -0.9 | gen 2 | — |
| generative_latent | 9 | 3/8 | 0/8 | 2X3+proxy10 +0.9;X3 +1.9 | gen 1 | — |
| ot_cfm | 8 | 3/5 | 0/5 | X3 +5.0 | gen 3 | — |
| ot_moscot | 7 | 0/7 | 0/7 | X3 +1.7 | 0 | — |
| graph_fate | 5 | 3/4 | 1/4 | 2X3+proxy10 +3.1;X3 +1.4* | gen 1 | — |
| pseudobulk_shift | 5 | 1/5 | 0/5 | X3 -0.3 | 0 | — |
| regulatory_program | 3 | 0/3 | 0/3 | 2X3+proxy10 -0.2*;X3 +2.0 | 0 | — |
| copy_last | 2 | 0/2 | 0/2 | X3 +0.5 | 0 | — |
| other(无族标签的早期节点,混合多种目标,只作背景) | 359 | — | — | X3 +13.5;X3+proxy+proxy2 +4.4;X3+X4+X5+proxy+proxy2 +7.5 | crash 2/gen 12/fmt 1 | +2.4(n=6) |
| 其余 2 族(各试过少于上表) | 3 | — | — | — | — | — |
* = 没有节点跑满 3 个 seed;† = 单次提交,官网噪声未测;失败计数按 gen(生成失败)/ timeout / crash。
本地差 vs 官网差(被提交的程序,按本地目标分组)
目标 X3(4 个提交)
| 方法族 | n | 本地差 | 官网差 |
|---|---|---|---|
| lowrank_shape | 1† | +14.8 | +5.1 |
| local_ot | 1† | +13.8 | +2.6 |
| stochastic_bridge | 1† | +2.4 | +0.9 |
| other(无族标签,只作背景) | 1† | +13.5 | +6.5 |
同一尺子下,本组各族的本地排序与官网排序一致(单次提交,只作参考)。
目标 X3+proxy+proxy2(3 个提交)
| 方法族 | n | 本地差 | 官网差 |
|---|
已知限制:Codex 对跨环续做的审查(2026-10-03)
结论原文:「当前快照不适合今晚直接启动正式 T1 24 小时跨环链;至少先修复 P0,并补齐三环去重及截止收尾回归。」决定(decisions.tsv「T1 链启动时机」):T1 链等这些修复和三环回归通过后再启动,不做「第一环关闭续做」的折中。来源 Codex 对跨环续做的审查(2026-10-03)。
- P0 #1:截止时先进入终选,执行线程随后丢掉 carryover;动态截止可能被错过。
- P0 #2:第三环会重复续做旧版本,且把历史 resume 算进本环名额(名额被耗尽)。
- P0 #3:权重验收失败仍可打分,之后悄悄重训,把不同训练结果当成同一冻结权重下的样本。
- P0 #4:祖先 run 后来被污染(TAINTED),第三环仍可能打包其被改动的轨迹。
- P1 #5–#7:每段证据未保证随包交付;读取额度失败会把已用查询算成零;封存不是可恢复的原子事务。
- P1 #8:终选预留扩大了,但内部截止仍按廉价基线留时间,训练型候选可能没时间完成 final,只能回退基线(倾向安全,未发现跳过护栏)。
- P1 #9:自动换 fresh seed 会让每环评测指纹不同,清空大部分可用旧分数。
- P1 #10–#11:SIGTERM 宽限只等 leader 不等整个进程组;权重缓存键没覆盖执行时注入的 GPU 环境。
这些问题的负责人、状态、验收条件,和每项 harness 改动「已实现 / 回放验证 / 真实 run 验证」到了哪一级,在跨 run · 问题与待办和跨 run · harness 变更史里按登记表显示;本节只说明机制。
Codex 同时确认的正确部分:enforce=false 不会杀进程;缺基线时拒绝候选替换,有基线时先落盘;正常读取来源链时 fresh seed 整组替换;权重键包含视图内容、训练 seed、额外参数;未发现把 final 权重回放到 proxy / X3,或向下一环暴露官方保留阶段真值的路径。
六、到目前为止,效果怎么样
诚实的结论:本地分上涨,还没有被官网证明是真提升。已有的官网分里,搜索产出的程序与我们自己流水线的照抄基线(T1 官网 46.9,不是评分器的参考线 50)的差距,只是单次历史观察,不是受控实验(14 本地尺子与优化目标)。
| 题目 | 官网记录(组) | 已有最高 | 来自 | 实测照抄基线 |
|---|---|---|---|---|
| T1 验证(E8.5 + E9.5 → E10.5) | 14 | 55.0 | t1_round2 / D 组 | 46.9 |
| T2 心脏插值 | 3 | 63.9 | G24 T2/T3 首跑 / D 组 | — |
| T2 心脏外推 | 1 | 49.6 | G24q | — |
| T2 全胚插值 | 4 | 61.7 | G24 T2/T3 首跑 / D 组 | — |
| T3 Gata4 敲除 | 3 | 53.4 | G24 T2/T3 首跑 | — |
来自提交台账,按题目和预测哈希去重;最高分只是历史记录,不同运行的目标与条件不同,不能当作「方法更好」的证明。完整校准
- T1:台账里官网最高 55.0(t1_round2 / D 组),比实测照抄 46.9 高 8.1;这是单次提交、没有重复,教训表也只把它当作在方法族间分配精力的线索。早期 G21 四份预测官网 47.0–47.8,只比照抄高 0.1–0.9,不是已确立的改进(14 本地尺子与优化目标)。本地尺子里只有 X3 前瞻有效(ρ≈0.77),见第四节。
- T2 心脏外推:本地 proxy 的 +4.15 全部来自尺寸项(用了泄漏常数),官网 49.6;改用 proxy_noscale 后,改动程序与照抄基线在本地同分(g40_scale 配置注释记 VM 核对 50.00 / 50.00),所以此前 G24 的心脏外推 run 终选护栏回退了照抄基线(档案 selection_facts)。真正能区分的是坐标缩放,只能用官网配额预注册扫描(3 个 run,log s = 0.15 / 0.30 / 0.45,见首页「排队」和 decisions.tsv)。
- T3:本地没有可靠尺子;公开日志里 66.6 的路线是把真实 Mab21l2 KO 细胞混进 WT 输出,已设为方法卡 v2 主线,尚无结果(G41)。
各次实验之间能否比较、同一条链上反复出现什么问题,见跨 run · 实验对比和跨 run · 链与专题复盘;「目前效果」一栏只引用档案和文档里已有的,登记表里的验证级别以跨 run 页为准。
七、原始文档
上面每一条的出处。文档已渲染成站内页面,相互的链接可点;指向源码的链接只显示路径。
- 10 算法搜索架构(D = ERA + tune)
notes/architecture/10_harness_era_architecture.md - 13 实验记录与溯源
notes/architecture/13_records.md - 14 本地尺子与优化目标
notes/architecture/14_objective_rulers.md - 15 Compliance、Data agent 与 vec-data
notes/architecture/15_data_agent_compliance.md - 16 LLM 中继与回退链
notes/architecture/16_llm_relay_fallback.md - 17 run 外的审计与分析 agent
notes/architecture/17_meta_and_audit_agents.md - 18 跨环续做与 seed 策略
notes/architecture/18_carryover_and_seed_policy.md - 项目计划总览(notes/plan/README.md)
notes/plan/README.md - G39–G43 任务书(2026-10-03)
notes/plan/tasks/G39-G43_plan_2026-10-03.md - Codex 对跨环续做的审查(2026-10-03)
notes/reports/reviews/2026-10-03_codex_g45_impl.md - Codex 对跨环续做与 seed 草案的审阅(2026-10-03)
notes/reports/reviews/2026-10-03_codex_carryover_seed.md - Codex 对外层自主循环的审阅(2026-10-03)
notes/reports/reviews/2026-10-03_codex_outer_loop.md - 19 外层自主循环(草案)
notes/architecture/19_outer_loop_autonomy.md - 开发记录:G39 / G49–G52 集成(2026-10-03)
notes/reports/dev/2026-10-03_integration.md - 开发记录:G39 搜索循环修正
notes/reports/dev/2026-10-03_G39_search_fixes.md - 开发记录:G45 跨环续做与执行上限
notes/reports/dev/2026-10-03_G45_carryover_limits.md - 开发记录:跨 run 教训表
notes/reports/dev/2026-10-03_lessons_table.md - 开发记录:分项反馈与评分规则简报
notes/reports/dev/2026-10-03_per_metric_feedback.md - 开发记录:本地尺子目标泄漏审计
notes/reports/dev/2026-10-03_proxy_target_leak_audit.md - 开发记录:四个小项
notes/reports/dev/2026-10-03_small_fixes.md - 迭代报告:g18 续跑
notes/reports/runs/2026-10-01_20261001-114429-search-t1-g18-continue.md - 决策记录 decisions.tsv
notes/changelogs/decisions.tsv
源码入口:agent/search/controller.py(搜索控制器)、agent/search/final.py(终选与护栏)、agent/search/continuation.py、agent/search/carryover.py(跨环续做)、agent/meta/(G44)、agent/audit/(G50)。