Virtual Embryo Challenge更新于 10-03 19:07(北京时间) / 每 5 分钟更新

给第一次看的人

工作原理

回到研究进展

这个面板在看一件事:agent 搜出来的建模代码,在官网上到底有没有更好。下面按「是什么 → 怎么跑 → 谁在干什么 → 怎么变好 → 现在怎样」讲清楚;每个机制后面都写了「目前效果」,只引用档案和文档里已有的数字,没有证据的写暂无证据。

一、整个系统在干什么

一句话:让大模型 agent 自己搜索、编写、评估建模代码,去预测虚拟胚胎挑战(VEC)各题里「下一个发育阶段的细胞表达」,最后把分数最高的预测交到官网。

细节以 10 算法搜索架构(D = ERA + tune) 为准,决策原因见 决策记录 decisions.tsv。

二、一个 run 的主流程

一个 run 从「锁定」到「提交」的全过程如下图。上半是启动和起点,中间方框是每个节点都走一遍的流水线(同时跑 2 个节点),下半是收尾和下一环。

每个节点(同时做 2 个,直到预算用完)① 锁定启动配置 · 代码快照输入 · 评测指纹② 种子打分copy_last 是底线再加已准入种子③ 抽签 + 选父draft/improve/debugFUTS 选父节点④ Researcher查文献/数据元数据写方案 PLAN⑤ Compliance删保留阶段测量值句子⑥ Data agent有数据请求才启动下载·删窗·入库⑦ Engineer改代码 · 自测查分(只看 A 半真值)⑧ 权威执行打分无网沙箱 · B 半视图盲检查⑨ Analyst写分析报告供后续节点读⑩ Reviewer前 10% 且高于最好种子才审⑪ 存档 + 晋级前 5 名用 seed 1、2复测,改用均分预算用完?否:回 ③ 下一个节点是:进入终选⑫ 终选去重前 5 → 新 seed护栏对照 copy_last⑬ 打包 + 审计package · verifyG50 审计 · 邮件⑭ 挑选并提交prepare_submission人传官网、记台账⑮ G44 分析找效率问题出下一环提案⑯ 下一环--continue-from导入节点与教训

LLM 角色(agent) 程序 / 服务(不调用模型或只执行) 人或 Claude Code 在 run 之间做的事 判断点。虚线 = 回到上一步。

图里几个词
  • draft(新方向)?搜索节点的一种操作:从空白开始,按方法族库换一个全新的方法族起草最小版本;另两种是 improve(在父节点上改结构)和 debug(修运行错误)。:节点的三种操作之一。每个节点开始时抽一次签:T1 约 30% draft(新方法族)、15% debug(修错)、其余 improve(深化);T2 的 draft 是 15%。tune(调参)代码保留但现行配置关闭。
  • A 半 / B 半:每把尺子的真值分两半,Engineer 自测只能查 A 半,搜索打分用 B 半,防止程序迎合打分数据。
  • 照抄基线?copy_last:把最后一个输入阶段的细胞原样当预测交上去,是所有改进要超过的底线;我们流水线实测的官网分是 T1 46.9,不是评分器参考线 50。 copy_last:把最后一个输入阶段原样当预测。所有「改进」都要先超过它。
  • 种子:搜索起点程序(种子程序?搜索的起点程序(copy_last、ot_moscot 等),分 anchor / exploration / active / reference_only 四种状态;不是随机种子。),不是随机数种子。

三、各个 agent 角色

搜索树的每个节点由 4 个 LLM 角色(Researcher、Engineer、Analyst、Reviewer)加 2 个新增的合规角色(Compliance、Data agent)接力完成;run 外还有审计、分析两个 agent。「目前效果」只写档案或文档里有的事实,没有就写暂无证据。

角色干什么输入 → 输出什么时候触发用什么模型目前效果
Researcher
研究员
看父节点、全树实验表、教训表和知识库,提出这个节点要做的方案;可查文献(每节点 ≤ 10 次)和数据集元数据。父节点分数 / 分项 / METHOD / 代码开头 / 分析;全树表;知识库前 3 条;教训表 → PLAN.json(方法族、机制、关闭机制对照、可带数据请求)每个新节点(improve / debug / draft);单轮调用,15 分钟上限relay_cli 的 Opus,回退 qwen3.8-max这一环没有「去掉 Researcher」的对照实验。 暂无证据。已知问题:方案被证否后原样回退的节点占槽位 19–21%(G39 任务书 §0.1),已改成必须交备选机制,改后效果暂无数据。
Compliance
合规审查
删掉 PLAN、检索文本、数据说明中涉及保留阶段测量值的句子;主要段落过半被删就退回重写一次。正则 + 单轮 LLM 判句子是测量值 / 机制 / 规则 / 方法 → 修改后的 PLAN,附 [compliance: removed] 标记Researcher 之后、Engineer 之前;Data agent 取回的数据入库前也审relay_cli Opus,回退 qwen3.8-max暂无证据:2026-10-03 才接进控制器(15 Compliance、Data agent 与 vec-data),本页还没统计到使用它的 run 的删句比例。
Data agent
数据员
按 PLAN 里的数据请求下载外部数据,先按元数据、再逐细胞删掉本任务禁窗内的样本,算哈希、写目录,通过后挂进视图并存档供以后的 run 复用。data_requests(accession + 用途)→ 隔离区 → 删窗 → external/dynamic/<id>/,数据纪元 +1仅当 PLAN 带数据请求;多轮会话,30 分钟上限qwen3.8-max(opencode)暂无证据:新角色。已有的旁证:此前挂进视图的外部训练数据「几乎没被中选程序真正用到」(G39–G43 任务书(2026-10-03) §7.3),所以「更多数据 → 更好」还没有证据。
Engineer
工程师
在沙箱里实现方案、调试、自测。能用 vec-score(每节点 ≤ 20 次,只看 A 半)、vec-check、vec-gpu。方案 + 评分规则简报 + 父节点代码 + 全树表 → solution/ 与 METHOD.md每个新节点;不设固定时限,180 秒无动作记一次停顿,连续 3 次结束qwen3.8-max(Token Plan),bwrap 沙箱,只放行 LLM 域名会话 77–83% 的时间在等模型(G39–G43 任务书(2026-10-03) §7.2);旧的 30 分钟限制让 draft 里 3/4 撞限、判失败(G39–G43 任务书(2026-10-03) §0.1 4c),已改为不设固定时限。改后的失败率暂无数据。
执行与打分
程序,不是 agent
无网络沙箱里重跑候选,在 B 半真值上打分;关闭机制对照(--ablate)检查新机制是不是真起作用;视图盲检查防止程序读到被伪装掉的视图信息。solution/ → 各尺子的分项分数、mechanism_active、view_dependent 标记Engineer 提交之后不用模型对照与盲检查的统计暂无汇总(档案里有逐节点记录,见各节点页)。
Analyst
分析师
读本节点的变化量表、diff 和 Engineer 最后的话,写这次改动为什么有效 / 无效,并给出教训。变化量表 + PLAN + diff → ANALYSIS.json(后续节点能看到父节点和前几名的完整分析)每个节点执行之后;10 分钟上限relay_cli Opus,回退 qwen3.8-max暂无证据:没有做过「去掉 Analyst」的对照。
Reviewer
审查员
检查越界读取、硬编码目标阶段统计量、读保留数据、钻评分器漏洞;判 fail 的节点不能当父节点也不能进终选。源码 + PLAN + 视图 manifest(内联)→ REVIEW.json节点排进前 10% 且高于最好种子;Engineer 没写完 METHOD 的节点晋级前必审relay_cli Opus,回退 qwen3.8-max暂无证据:没有按 run 汇总的「拦下多少个」统计。
终选控制器
程序
停止挂载数据,去重后取前 5,在最终数据纪元里跑 3 个 seed,再过终选护栏;护栏不过就交 copy_last。候选 → final/ 预测和 SELECTION.md预算最后阶段(预留时间按实测估算)不用模型T1 官网 ≥ +2.6 的 5 个程序回放时全部通过护栏;但台账里没有低于 copy_last 的程序,护栏拦坏程序的能力没被检验过(10 算法搜索架构(D = ERA + tune) §5)。
轨迹审计 G50
run 外
run 打包后,用正则 + LLM 扫全部轨迹和代码,找保留阶段数据泄漏;是提交前的闸门(fail 不能交,review 要人放行)。全部轨迹、程序库、SELECTION → AUDIT.json每个正式 run 打包后自动跑;提交前再核一次relay / Opus / qwen(agent/audit/llm.yaml)暂无证据:审计目录里还没有记录。
轨迹分析 G44
run 外
读整个 run 的事实包,找「槽位时间花在哪、选父 / draft 哪里浪费」,出改动提案;白名单内的改动(提示词、方法卡、方向库、搜索参数)自动应用并备好下一环配置,黑名单等人批。事实包 + 现行白名单文件 → META.json、_apply.json、下一环配置每环结束后由 agent/audit/llm.yaml 的 profile 决定(relay / opus / qwen);调用失败时本轮不出提案暂无证据:17 run 外的审计与分析 agent §7写明还没有在真实 run 上验收,G45 调度器未接线。
报告写手 G28
run 外
根据事实包写每个 run 的中文迭代报告,数字有核对程序。事实包 → notes/reports/runs/*.md(本站「报告」页)run 结束后报告页头注明写作模型(已有报告为 qwen3.8-max)已生成 7 份文件(含汇总报告)。
通知 G51
程序
每 2 小时的健康邮件、每个 run 的终选结果、额度耗尽告警;看板「用量与花费」页统计 token。档案与用量记录 → 邮件定时 / run 结束不用模型只是通知,没有效果指标。

模型与回退:每个角色有回退链「Token Plan 千问 → 百炼按量千问 → Opus」,每次调用记 token。Claude 凭据只在虚拟机,Spark 通过反向隧道的LLM 中继?Claude 凭据只放在虚拟机里,Spark 通过反向隧道的中继调用;模型挂掉时按回退链换下一个模型。调用(16 LLM 中继与回退链)。凭据中继「部署待用户」,所以 Opus 角色目前可能实际跑在回退模型上,以各 run 的锁文件为准。

四、run 内是怎么优化的

一个 run 之内,优化靠这几件事:谁来被改进(选父)、改什么(三种操作)、怎么判断变好了(尺子 + 复测)、最后交哪个(护栏)。

机制怎么运转目前效果
节点树 + FUTS 选父ERA 的选父算法原样使用:按排名分加探索项在全树里选最值得继续的节点;虚拟访问、忙父回避、连续失败降权避免「同一个父节点被反复选中」。ERA 原型实测的现象(同父连续被选、多次超时)是设计这些包装的原因(10 算法搜索架构(D = ERA + tune) §1.1)。 包装层本身没有单独消融。
三种操作 + 方法族覆盖draft 从方法族库(T1 共 11 族)按覆盖顺序起草新方向,覆盖完后用 bandit 在「探索」和「复测收益大的族」之间分配;improve 深化;debug 修错。平台期(连续 8 个已打分节点没刷新前 5)draft 概率临时升到 0.5。暂无证据:覆盖调度与平台期策略在 2026-10-03 才合入,G39–G43 任务书(2026-10-03) §7.2写明随下一轮启用,暂无运行数据。
本地尺子 proxy / proxy2 / proxy10 / X3候选在本地几道「已知答案」的题上打分,节点分 = 目标分量的加权均值。T1 目标是 proxy10×1 + X3×2;T2 插值用本榜 proxy;T2 心脏外推用去掉尺寸项的 proxy_noscale;T3 没有可靠本地尺子,走 agent 模式。T1:X3 与官网的 Spearman ρ ≈ 0.77,但收益幅度只有官网的约 0.4 倍;proxy10 对两输入程序完全看不见;X1、X4–X6 没有可用正相关。T3:本地尺子在 3 个官网点上完全反序(ρ = −1)。(10 算法搜索架构(D = ERA + tune) §5) 结论:本地分只能辅助,不能单独预测官网分。
尺子泄漏规则智能体可见的文本不得写出本地尺子目标阶段的统计量,否则尺子就失效。T2 心脏外推:方向库写了 E9.5 的 RMS,程序据此得到 proxy 尺寸项 +4.15,官网只有 49.6(10 算法搜索架构(D = ERA + tune) §6)。之后该榜改用 proxy_noscale。
晋级复测 晋级复测按候选身份去重后,排名分前 5 的节点用 seed 1、2 再跑,之后用 3 个 seed 的均值排名。设计目的是挡掉「一次运气」; 本页没有统计晋级前后排名变化。暂无证据
候选去重 / 已证否方向代码树相同、预测相同、或多 seed 分数逐位相同的节点算同一个候选;原样回退的节点记「已证否方向」,下次 Researcher 与 Engineer 都能看到。轨迹报告发现终选前 5 名在 scr-D 里 5/5 是同一程序的副本、A 里 4/5(G39–G43 任务书(2026-10-03) §0.1 4a),所以加了去重。 改后效果暂无回放结果。
tune(调参)算子:现行关闭借鉴 OpenEvolve 的便宜多轮修改,专门调已证实机制的参数。全部 D 组 run 里 40 个 tune 节点只有 1 个被接受(r2-D-s1 #16,+0.8);T2 D run 里 tune 占约 1/4 节点槽(2026-10-03 决定),所以默认关。 D 比 A(只差 tune)在三个榜各高一点:T1 53.4 vs 52.0、心脏插值 63.9 vs 61.1、全胚插值 61.7 vs 59.9,每榜只比了一次。
预算、并发与终选预留每个 run 有墙钟预算(T1 链 24 h,其余 12 h)和 max_nodes;同时 2 个节点;终选预留时间按候选实测时间估算,只会把截止往前移。结束原因记在 stop_manifest(budget / agent_early_exit / infra / operator)。r2-D 的结束是预算到了,不是搜索收敛(G39–G43 任务书(2026-10-03) §7.2)。 终选预留的估算偏小问题见第五节已知限制 #8。
健康监督每分钟读候选进程的 CPU、自己的 GPU 计算、I/O,30 分钟无活动判 hung;现阶段 enforce: false 只观测。暂无证据:误判率还在统计中(18 跨环续做与 seed 策略 §4)。
终选护栏(回退基线)终选只选 1 个候选,它与 copy_last 在新 seed 3–7 上配对运行,配对增益的单侧 97.5% 下界 > 0 才替换;否则交 copy_last,不再试别的候选(避免多重检验)。T2 用旧式护栏(每把尺子 3 seed 均值都高于 copy_last + 1)。官网 ≥ +2.6 的 5 个程序回放时全部通过;护栏挡坏程序的能力没被检验。 另见首页「之前做得怎样」里各题最近一次终选是否回退。

想看某个 run 实际怎么走的,从运行档案进入节点树、每个节点的方案、代码改动和分析。

五、跨 run 是怎么优化的

跨 run 的优化有两层:把工作带到下一环(节点、未做完的会话、训练好的权重),和把经验带到下一环(知识库、教训表、方向库、种子取舍、G44 提案)。两层都只在两个锁定 run 之间发生。

机制怎么运转目前效果
运行链与 continuation(--continue-from)每个题目一串锁定的 run;后一环导入上一环的已打分节点(评测指纹相同就不重评)、已证否方向,祖先链轨迹作证据。run 内不能改配置,所以「总结问题、改进自己」只发生在两环之间。档案里有 3 个接续运行:20261003-172000-search-t2-heart-extrap-chain-12h、20261003-171955-search-t2-embryo-interp-chain-12h、20261001-114429-search-t1-g18-continue。 其中最早的 G18 续跑:导入的 9 个节点重打分与原分数完全一致,新节点最好与续跑前最好差 0.0,报告判「不算提升」(见 20261001-114429-search-t1-g18-continue 的迭代报告)。 正式的 T1 24 小时链尚未启动,等修复(见下)。
跨环续做 跨环续做环交接点(截止 − 节点收尾时间)时,没做完的 Engineer 会话或被截止切断的训练,封存成逐文件校验的只读快照;下一环校验通过后优先续做(每环最多 4 个),新开 Engineer 会话,带上原方案和「交接摘要」(上一段改了什么、最后的消息节选)。暂无证据:2026-10-03 实现,档案里还没有真实跨环续做。Codex 审查结论:「当前实现还不能放心用于正式跨环链」(Codex 对跨环续做的审查(2026-10-03))。
权重复用训练型程序声明 per_view 权重:每个视图第一次权威执行训练并不可变登记;之后晋级 seed、终选护栏、下一环按缓存键回放,不重训。缓存键 = 代码树 + 训练种子 + 视图内容 + 依赖环境 + --ablate 参数。已登记的权重缺失或哈希不符就报 interrupted,不悄悄重训。动机:同一候选被重复执行约 9 次(权威、对照、晋级 2、护栏 5),30 分钟上限对 OT / CFM / VAE 太紧(18 跨环续做与 seed 策略 §0)。 Codex 发现验收失败仍可打分、之后悄悄重训(P0 #3),缓存键也没覆盖 GPU 环境注入(P1 #11)。
护栏 seed 轮换链上每一环护栏用的新 seed 不与此前各环重叠(3–7 → 8–12),减少多环反复用同一真值集的适应性偏差。已知副作用(Codex P1 #9):换 seed 会改变评测指纹,导入时清空旧分数,只有 top-k 被重评,其余节点永久成为历史。 修复方向是区分「搜索分数可比指纹」和「终选规格」。
知识库 知识库(k0xx)agent/knowledge/ 下 72 个条目(人工整理、带出处);Researcher 按 BM25 取前 3 条。官方知识图谱(KG)含目标阶段的表达事实,不能挂进 run 内,只能锁外由人审核后写成条目,且不收 Theiler ≥ TS16 的断言;check_knowledge.py 扫描目标阶段统计量(现在默认只警告)。暂无证据:没有「有 / 无知识库」的对照。已知风险:本地规则与官网不一致时以官网为准,知识里不得出现保留阶段测量值(G39–G43 任务书(2026-10-03) §7.4)。
教训表 教训表每榜一份 lessons_<榜>.md,按方法族汇总:试过几次、机制是否生效、本地最好 3 seed 差、失败数、Analyst 教训,以及该族被提交程序相对 copy_last 的官网差。只附给 Researcher 和 Analyst,不给 Engineer;不含分项、逐基因信息。官网差只用于在方法族之间分配精力。暂无证据:2026-10-03 加入(2026-10-03「官网分以方法族相对差进入教训表」),还没有用过它的 run 与没用的对照。
方向库 ideas 文件agent/prompts/ideas_<榜>.md:T1 有 11 个方法族(分连续动力学、命运分支、分布结构三类)和合规前言;draft 按它排覆盖顺序。库里不写分数。暂无证据:T1 的 draft 覆盖效果等下一轮;此前 D 组里的 draft 节点是否更好没有单独统计。
种子策略种子程序分 anchor(只有 copy_last)、exploration(已准入,子节点上限 3,有复测收益才转 active)、active、reference_only(只作对照)。准入要有合规与机制生效记录(ADMISSION_*.md)。T1 现有 exploration 种子:ot_moscot、composition_trend(2026-10-03 准入);目前没有静态的 active 种子(10 算法搜索架构(D = ERA + tune) §4.2)。
G44 分析 → 下一环上一环的轨迹分析提案里,白名单内的自动应用并写下一环配置;黑名单(评分器、护栏、预算、ERA 核心)必须人批。暂无证据:见第三节。
数据与审计的跨 run 积累Data agent 下载并通过 Compliance 的数据永久存进 data/external/,以后的 run 直接挂载;每个 run 的审计结论进入 notes/reports/audit/index.json。暂无证据:数据复用效果暂无。
教训表实例:lessons_T1__val.md(前 70 行;这就是附给下一个 run 的 Researcher 和 Analyst 的内容)

跨 run 教训表 · T1:val(2026-10-03,自动生成)

用法:官网差只用于在方法族之间分配精力,不能用来反推目标阶段的性质(规则 §10:分数只能用来选择,不能用来计算预测)。本表只含方法族级别的聚合数字,没有逐基因或逐细胞信息;官网分项只以指标组的定性等级出现。分项只用于在方法方向间分配精力,不得用来推算目标的任何性质;不要据此在代码里写任何目标阶段的取值。

来源:最近 22 个已结束 run(r2-D-s1, r2-D-s0, scr-D, scr-C, scr-B, scr-A, x3-era-mechcheck, abc-r1-C-native, abc-r1-B-population, abc-r1-A-era, abc-r0-C-native, abc-r0-B-population, abc-r0-A-era, g21q-D, g21q-C, g21q-B, g21q-A, g23-spark, g18-continue, spark-c3, spark-eng-default, spark)。「本地差」= 该族节点的 seed 平均目标分 − 同一 run 的 copy_last;各 run 的本地目标不同(2X3+proxy10、X3、X3+proxy+proxy2、X3+X4+X5+proxy+proxy2、X3+X4+X5),只在同一目标内比较,跨目标的本地差不可比。机制生效 / 假设成立来自 Analyst 判定(生效数/已判定数);方法族取 PLAN 的 family_id,缺失时取 Analyst 判定。

官网参照(固定,不随新提交变化):我们流水线 copy_last(台账 2026-10-02,机制检查 run 的护栏输出);台账行 20261002-135403-search-t1-x3-era-mechcheck(submission_id c1fdc7d1),官网分 46.9。官网差 = 程序的官网分 − 该参照。

来源审计:未审计(旧 run,照常纳入):22 个。

当前官网冠军与对照

冠军:t1-r2-D-s0 节点 21(composition_program),官网差 +8.1,目标 2X3+proxy10 下本地差 +7.0;领先第二名 1.6 分,单次提交,未经重复。祖先链(从种子到冠军):

节点类型族METHOD 首行本地目标分变化机制生效
3seedseedcomposition_trend——
4improvecomposition_programcomposition_trend + 型内拟时序表达平移(已实现并筛查-0.2no
8improvecomposition_programcomposition_trend + 型内表达重锚定+1.9yes
10improvecomposition_programcomposition_trend + 型内表达重锚定,α 扫描延伸至拐点+0.5no
14improvecomposition_programcomposition_trend + α=3 重锚定 + 两阶段逐基因方向位移(按细胞型 EB 收缩,β=1+0.7yes
21improvecomposition_programcomposition_trend + α=3 重锚定 + 置信度加权稀疏型内位移+0.1yes

关键改动:把父节点(14)的均匀型内位移核(β=1,中位数门控)换成置信度加权稀疏核;起点种子:composition_trend。

对照(同一目标 2X3+proxy10 下,官网明显更低的已提交程序):

  • t1-r2-D-s1 节点 25(growth_dynamics):本地差 +8.9(冠军 +7.0),官网差 +3.2(冠军 官网差 +8.1);单次提交;祖先族 growth_dynamics;末步 growth_dynamics v3

由此可学的(机械对比,只看机制层面):同一尺子下,growth_dynamics 相对冠军所在的族「composition_program」本地更高但官网更低;冠军末步「composition_trend + α=3 重锚定 + 置信度加权稀疏型内位移」,对照末步「growth_dynamics v3」。每个官网差都只有单次提交,只用来在族间分配精力。

方法族汇总(other 放在表末)

方法族试过机制生效假设成立本地最好差(目标 差)失败官网差
lowrank_shape238/231/232X3+proxy10 +4.9;X3 +14.50+5.1(n=1†)
composition_program125/110/112X3+proxy10 +7.0gen 1+8.1(n=1†)
local_ot129/122/122X3+proxy10 +1.7;X3 +12.10+2.6(n=1†)
growth_dynamics72/70/72X3+proxy10 +8.9;X3 +2.2*0+3.2(n=1†)
stochastic_bridge30/30/3X3 +2.40+0.9(n=1†)
manifold_ode144/120/122X3+proxy10 +5.8;X3 -0.9gen 2—
generative_latent93/80/82X3+proxy10 +0.9;X3 +1.9gen 1—
ot_cfm83/50/5X3 +5.0gen 3—
ot_moscot70/70/7X3 +1.70—
graph_fate53/41/42X3+proxy10 +3.1;X3 +1.4*gen 1—
pseudobulk_shift51/50/5X3 -0.30—
regulatory_program30/30/32X3+proxy10 -0.2*;X3 +2.00—
copy_last20/20/2X3 +0.50—
other(无族标签的早期节点,混合多种目标,只作背景)359——X3 +13.5;X3+proxy+proxy2 +4.4;X3+X4+X5+proxy+proxy2 +7.5crash 2/gen 12/fmt 1+2.4(n=6)
其余 2 族(各试过少于上表)3—————

* = 没有节点跑满 3 个 seed;† = 单次提交,官网噪声未测;失败计数按 gen(生成失败)/ timeout / crash。

本地差 vs 官网差(被提交的程序,按本地目标分组)

目标 X3(4 个提交)
方法族n本地差官网差
lowrank_shape1†+14.8+5.1
local_ot1†+13.8+2.6
stochastic_bridge1†+2.4+0.9
other(无族标签,只作背景)1†+13.5+6.5

同一尺子下,本组各族的本地排序与官网排序一致(单次提交,只作参考)。

目标 X3+proxy+proxy2(3 个提交)
方法族n本地差官网差

已知限制:Codex 对跨环续做的审查(2026-10-03)

结论原文:「当前快照不适合今晚直接启动正式 T1 24 小时跨环链;至少先修复 P0,并补齐三环去重及截止收尾回归。」决定(decisions.tsv「T1 链启动时机」):T1 链等这些修复和三环回归通过后再启动,不做「第一环关闭续做」的折中。来源 Codex 对跨环续做的审查(2026-10-03)。

  • P0 #1:截止时先进入终选,执行线程随后丢掉 carryover;动态截止可能被错过。
  • P0 #2:第三环会重复续做旧版本,且把历史 resume 算进本环名额(名额被耗尽)。
  • P0 #3:权重验收失败仍可打分,之后悄悄重训,把不同训练结果当成同一冻结权重下的样本。
  • P0 #4:祖先 run 后来被污染(TAINTED),第三环仍可能打包其被改动的轨迹。
  • P1 #5–#7:每段证据未保证随包交付;读取额度失败会把已用查询算成零;封存不是可恢复的原子事务。
  • P1 #8:终选预留扩大了,但内部截止仍按廉价基线留时间,训练型候选可能没时间完成 final,只能回退基线(倾向安全,未发现跳过护栏)。
  • P1 #9:自动换 fresh seed 会让每环评测指纹不同,清空大部分可用旧分数。
  • P1 #10–#11:SIGTERM 宽限只等 leader 不等整个进程组;权重缓存键没覆盖执行时注入的 GPU 环境。

这些问题的负责人、状态、验收条件,和每项 harness 改动「已实现 / 回放验证 / 真实 run 验证」到了哪一级,在跨 run · 问题与待办和跨 run · harness 变更史里按登记表显示;本节只说明机制。

Codex 同时确认的正确部分:enforce=false 不会杀进程;缺基线时拒绝候选替换,有基线时先落盘;正常读取来源链时 fresh seed 整组替换;权重键包含视图内容、训练 seed、额外参数;未发现把 final 权重回放到 proxy / X3,或向下一环暴露官方保留阶段真值的路径。

六、到目前为止,效果怎么样

诚实的结论:本地分上涨,还没有被官网证明是真提升。已有的官网分里,搜索产出的程序与我们自己流水线的照抄基线(T1 官网 46.9,不是评分器的参考线 50)的差距,只是单次历史观察,不是受控实验(14 本地尺子与优化目标)。

题目官网记录(组)已有最高来自实测照抄基线
T1 验证(E8.5 + E9.5 → E10.5)1455.0t1_round2 / D 组46.9
T2 心脏插值363.9G24 T2/T3 首跑 / D 组—
T2 心脏外推149.6G24q—
T2 全胚插值461.7G24 T2/T3 首跑 / D 组—
T3 Gata4 敲除353.4G24 T2/T3 首跑—

来自提交台账,按题目和预测哈希去重;最高分只是历史记录,不同运行的目标与条件不同,不能当作「方法更好」的证明。完整校准

各次实验之间能否比较、同一条链上反复出现什么问题,见跨 run · 实验对比和跨 run · 链与专题复盘;「目前效果」一栏只引用档案和文档里已有的,登记表里的验证级别以跨 run 页为准。

七、原始文档

上面每一条的出处。文档已渲染成站内页面,相互的链接可点;指向源码的链接只显示路径。

源码入口:agent/search/controller.py(搜索控制器)、agent/search/final.py(终选与护栏)、agent/search/continuation.py、agent/search/carryover.py(跨环续做)、agent/meta/(G44)、agent/audit/(G50)。