Virtual Embryo Challenge更新于 10-03 19:12(北京时间) / 每 5 分钟更新

虚拟胚胎 / 研究工作台

研究进展

这个面板回答三件事:现在在做什么、排队什么、之前做得怎样。agent 在每个题目上搜索更好的建模代码,最终要看官网分是否真的变好。第一次看,先读工作原理。

阻塞与待验

T1 24h 链:不启动跨 run 总览

25 个问题未解除(P0 12);19 项 harness 变更待验,其中只做到「已实现」17 项、回放验证 2 项,真实 run / 官网验证 0 项。

其中 44 条起草自文档、待用户核对。来源:notes/plan/issues.tsv(更新 2026-10-03)、notes/changelogs/harness_changes.tsv(更新 2026-10-03)。

现在在做什么

2 个运行在跑

  • 运行链 search-t2-heart-extrap-chain-12h 运行中

    T2 心脏外推:自动搜索:多个节点轮流改程序、打分、挑最好的;接续上一环的结果继续搜索;按「proxy_noscale;终检 X2;护栏 proxy_noscale;诊断 proxy」给候选打分。

    已跑 1 小时 52 分 / 预算 12 小时 · 新候选已评分 4 / 已生成 6 · 当前最好 54.1(3 次复测均分)

  • 运行链 search-t2-embryo-interp-chain-12h 运行中

    T2 全胚插值:自动搜索:多个节点轮流改程序、打分、挑最好的;接续上一环的结果继续搜索;按「proxy;终检 X2;护栏 proxy」给候选打分。

    已跑 1 小时 53 分 / 预算 12 小时 · 新候选已评分 4 / 已生成 6 · 当前最好 63.0(3 次复测均分)

排队什么

1 条运行链配置还没启动;15 个已结束的运行还没有官网分。

待启动的运行链

  • 未启动 T1 验证(E8.5 + E9.5 → E10.5) search-t1-D-24h · 24 小时
    等待原因(decisions.tsv 2026-10-03「T1 链启动时机」):Codex 实现审阅(notes/reports/reviews/2026-10-03_codex_g45_impl.md)发现 4 个 P0 + 护栏 seed 指纹问题;T1 24 h 链等这些修复与三环回归通过后再启动,不做"第一环关闭续做"的折中agent/configs/experiments/chain/t1_D_12h.yaml
已启动过的配置(10)
  • 冒烟配置 T1 验证(E8.5 + E9.5 → E10.5) search-t1-D-smoke2h · 2 小时
    最近一次:运行链 / D 组 20261003-153851 已结束agent/configs/experiments/chain/t1_D_smoke2h.yaml
  • 已在跑 T2 全胚插值 search-t2-embryo-interp-chain-12h · 12 小时
    最近一次:运行链 20261003-171955 运行中agent/configs/experiments/chain/t2_embryo_interp_12h.yaml
  • 已在跑 T2 心脏外推 search-t2-heart-extrap-chain-12h · 12 小时
    最近一次:运行链 20261003-172000 运行中agent/configs/experiments/chain/t2_heart_extrap_12h.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s015 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s015.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s030 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s030.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s045 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s045.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-chain-12h · 12 小时
    最近一次:运行链 20261003-172000 已结束agent/configs/experiments/chain/t3_agent_12h.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-a · 4 小时
    最近一次:早期 Agent / komix-a 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_a.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-b · 4 小时
    最近一次:早期 Agent / komix-b 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_b.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-c · 4 小时
    最近一次:早期 Agent / komix-c 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_c.yaml

待提交官网的候选(推算 15,含不打算提交的试验 run)

待提交的候选(共 15 条,另 10 条已折叠)
「排队」指什么

这里的排队有两种:一是待启动的运行链(每个配置文件对应一个锁定运行,人或 Claude 手动 launch;一环结束后用 --continue-from 接下一环);二是待提交的预测包(run 结束后由人挑选并上传官网)。run 内部还有节点排队等空闲名额,显示在「现在在做什么」里。

来源:agent/configs/experiments/{chain,g40_scale,g24_t2_t3}/*.yaml(运行链配置,与已有运行按配置名对照)、notes/changelogs/decisions.tsv(等待原因)、提交台账(待提交由「有终选、台账无官网分」推算)。项目里没有机器可读的排队表(G45 调度器未接线),所以「何时启动」只能写出文档里的原因,不预测时间。官网登录状态不在档案里,本页不显示;每日打分次数(P2 阶段每任务每天 8 次,10-20 起测试榜每榜整个阶段 2 次,见 notes/plan/README.md)是文档或会话信息,不是实时数据。

之前做得怎样

按题目看最近一次终选与官网分;官网分只来自提交台账。

题目最近一次已结束的运行终选与基线比,一句话
T1 验证(E8.5 + E9.5 → E10.5)
24 次运行
t1_round2 / D 组
10-03 09:34 · 已结束
选中节点 n21
本地最好 56.8(3 次复测均分)
官网 55.0,实测照抄基线 46.9,相差 +8.1(单次历史观察,不是受控结论)。
T2 全胚插值
6 次运行
G24 T2/T3 首跑 / D 组
10-03 09:42 · 已结束
选中节点 n15
本地最好 62.5(3 次复测均分)
官网 61.7;这个榜还没有可确认的实测照抄基线,不能说好坏。
T2 心脏外推
8 次运行
G40 心脏外推尺度扫描
10-03 15:57 · 已结束
选中节点 n1
本地最好 50.0(3 次复测均分)
这次运行还没有官网分。该榜已有的官网记录里最高 49.6。 档案核对:G24 T2/T3 首跑 / D 组 的终选护栏回退到了照抄基线。 本次选中的是尺度扫描种子,本地 50.0 与照抄基线同分:去掉尺寸项后(proxy_noscale)本地尺子看不见坐标缩放,只能靠官网配额判断(配置 g40_scale/*.yaml 注释记 VM 核对 50.00 / 50.00,来源是注释与 decisions.tsv,不是本页重算)。
T2 心脏插值
5 次运行
G24 T2/T3 首跑 / D 组
10-03 09:42 · 已结束
选中节点 n30
本地最好 68.3(3 次复测均分)
这次运行还没有官网分。该榜已有的官网记录里最高 63.9。
T3 Gata4 敲除
7 次运行
运行链
10-03 17:20 · 已结束
交出最终文件(单 Agent)
本地最好 87.0(单 Agent 自报的本地代理分)
这次运行还没有官网分。该榜已有的官网记录里最高 53.4。 T3 没有可靠的本地尺子(留一基因尺子在 3 个官网点上完全反序,来源 notes/architecture/14 与 10 §5),所以本地分只作参考。
多个题目(早期单 Agent)1 次运行,还没有已结束并有终选的运行。

「照抄基线」= 把输入阶段原样当预测交上去(基线?copy_last:把最后一个输入阶段的细胞原样当预测交上去,是所有改进要超过的底线;我们流水线实测的官网分是 T1 46.9,不是评分器参考线 50。);终选护栏?最后选程序时的把关:候选必须在没用过的新 seed 上稳定胜过照抄基线(T1 要求配对增益的单侧下界 > 0),否则交出照抄基线。要求候选在新 seed 上稳定胜过它才替换。怎么判断 · 完整校准

官网给出的答案

完整校准记录

T1:val / 14 组预测记录

  1. t1_round2 / D 组 10-0355.0 +8.1
  2. screen_abcd / D 组 10-0253.4 +6.5
  3. screen_abcd / A 组 10-0252.0 +5.1
  4. A/B/C 框架对比 / A 组 10-0250.1 +3.2
  5. t1_round2 / D 组 10-0350.1 +3.2
  6. A/B/C 框架对比 / A 组 10-0149.7 +2.8
  7. screen_abcd / B 组 10-0249.5 +2.6
  8. G21 快速校准 / B 组 10-0147.8 +0.9
  9. screen_abcd / C 组 10-0247.8 +0.9
  10. A/B/C 框架对比 / B 组 10-0247.7 +0.8
  11. 早期 Agent / grok 09-2747.2 +0.3
  12. G21 快速校准 / A 组 10-0147.2 +0.3
其余 2 组预测
  1. G21 快速校准 / C 组 10-0147.0 +0.1
  2. 照抄基线(实测)46.9

一份预测的官网分 实测照抄基线 46.9(本流水线把输入阶段原样提交的官网结果;评分器的 50 分参考线不是它)

每个点对应一份预测。按已知哈希合并重复记录;这是历史观察,不是框架排名。

今日用量 399.65 M token(输入 28.62 M / 输出 9.47 M / 缓存读 361.27 M),1466 次调用。用量与花费

近 48 小时 678.39 M token(按节点完成时刻归属,近似)10-01 20:00 · 合计 910.0 k token(输入 99.5 k / 输出 38.9 k / 缓存读 771.7 k)· 5 次调用10-01 21:00 · 合计 19.78 M token(输入 1.66 M / 输出 570.9 k / 缓存读 17.55 M)· 74 次调用10-01 22:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-01 23:00 · 合计 4.05 M token(输入 570.9 k / 输出 165.8 k / 缓存读 3.31 M)· 37 次调用10-02 00:00 · 合计 18.92 M token(输入 2.77 M / 输出 661.5 k / 缓存读 15.49 M)· 134 次调用10-02 01:00 · 合计 17.62 M token(输入 2.62 M / 输出 598.4 k / 缓存读 14.40 M)· 125 次调用10-02 02:00 · 合计 17.15 M token(输入 2.75 M / 输出 587.6 k / 缓存读 13.82 M)· 124 次调用10-02 03:00 · 合计 13.92 M token(输入 1.57 M / 输出 470.2 k / 缓存读 11.88 M)· 76 次调用10-02 04:00 · 合计 14.83 M token(输入 1.84 M / 输出 549.3 k / 缓存读 12.43 M)· 88 次调用10-02 05:00 · 合计 20.70 M token(输入 2.89 M / 输出 702.8 k / 缓存读 17.11 M)· 133 次调用10-02 06:00 · 合计 20.04 M token(输入 3.09 M / 输出 725.4 k / 缓存读 16.22 M)· 143 次调用10-02 07:00 · 合计 16.50 M token(输入 1.79 M / 输出 471.0 k / 缓存读 14.23 M)· 75 次调用10-02 08:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 09:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 10:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 11:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 12:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 13:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 14:00 · 合计 12.51 M token(输入 934.0 k / 输出 336.4 k / 缓存读 11.24 M)· 41 次调用10-02 15:00 · 合计 8.90 M token(输入 852.1 k / 输出 319.1 k / 缓存读 7.73 M)· 41 次调用10-02 16:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 17:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 18:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 19:00 · 合计 0 token(输入 0 / 输出 0 / 缓存读 0)· 0 次调用10-02 20:00 · 合计 8.99 M token(输入 1.09 M / 输出 352.3 k / 缓存读 7.55 M)· 55 次调用10-02 21:00 · 合计 30.11 M token(输入 3.49 M / 输出 959.4 k / 缓存读 25.66 M)· 171 次调用10-02 22:00 · 合计 26.49 M token(输入 3.05 M / 输出 764.4 k / 缓存读 22.68 M)· 173 次调用10-02 23:00 · 合计 27.31 M token(输入 3.44 M / 输出 820.5 k / 缓存读 23.05 M)· 192 次调用10-03 00:00 · 合计 15.37 M token(输入 2.19 M / 输出 503.5 k / 缓存读 12.68 M)· 102 次调用10-03 01:00 · 合计 24.81 M token(输入 1.33 M / 输出 501.6 k / 缓存读 22.97 M)· 105 次调用10-03 02:00 · 合计 36.03 M token(输入 2.63 M / 输出 913.2 k / 缓存读 32.49 M)· 112 次调用10-03 03:00 · 合计 32.94 M token(输入 2.60 M / 输出 791.7 k / 缓存读 29.55 M)· 94 次调用10-03 04:00 · 合计 18.68 M token(输入 1.49 M / 输出 457.4 k / 缓存读 16.73 M)· 72 次调用10-03 05:00 · 合计 23.32 M token(输入 1.31 M / 输出 512.1 k / 缓存读 21.50 M)· 85 次调用10-03 06:00 · 合计 17.51 M token(输入 1.38 M / 输出 457.6 k / 缓存读 15.67 M)· 61 次调用10-03 07:00 · 合计 25.08 M token(输入 2.20 M / 输出 687.0 k / 缓存读 22.19 M)· 99 次调用10-03 08:00 · 合计 11.22 M token(输入 974.6 k / 输出 329.6 k / 缓存读 9.92 M)· 39 次调用10-03 09:00 · 合计 4.02 M token(输入 378.5 k / 输出 117.1 k / 缓存读 3.53 M)· 25 次调用10-03 10:00 · 合计 26.87 M token(输入 2.14 M / 输出 696.1 k / 缓存读 24.04 M)· 86 次调用10-03 11:00 · 合计 30.99 M token(输入 2.67 M / 输出 863.6 k / 缓存读 27.45 M)· 103 次调用10-03 12:00 · 合计 31.55 M token(输入 2.54 M / 输出 857.8 k / 缓存读 28.15 M)· 95 次调用10-03 13:00 · 合计 18.30 M token(输入 1.63 M / 输出 552.1 k / 缓存读 16.11 M)· 55 次调用10-03 14:00 · 合计 2.14 M token(输入 177.5 k / 输出 65.3 k / 缓存读 1.90 M)· 6 次调用10-03 15:00 · 合计 535.3 k token(输入 297.0 k / 输出 8921 / 缓存读 229.4 k)· 41 次调用10-03 16:00 · 合计 27.09 M token(输入 867.7 k / 输出 358.9 k / 缓存读 25.86 M)· 189 次调用10-03 17:00 · 合计 10.95 M token(输入 562.7 k / 输出 197.4 k / 缓存读 10.19 M)· 67 次调用10-03 18:00 · 合计 42.23 M token(输入 1.52 M / 输出 586.3 k / 缓存读 40.12 M)· 29 次调用10-03 19:00 · 合计 34.3 k token(输入 20.7 k / 输出 12.5 k / 缓存读 1024)· 1 次调用

线索与细节

需要时展开
观察与提示(5) 搜索有改动,终选仍回到基线;两把尺子经常给出相同信号;部分搜索没有发起新方向

这些是程序根据档案自动给出的观察,每条分「观察 / 提示 / 下一步验证」,只是线索,不是结论。

模型与目标

搜索有改动,终选仍回到基线

2 次运行最终由护栏选择基线。

提示当前候选未满足该 run 锁定的终选规则;这不等于整个方法族已经无效。

名词:护栏 · 基线

下一步验证

逐项查看被拒候选的收益与退化,再区分方法迁移问题和护栏设置问题。

评估设计

两把尺子经常给出相同信号

7 次运行中,230/246 个有双尺子记录的新候选,proxy 与 proxy2 同分。

提示第二把尺子的额外区分度有限;同分不能证明代码或预测相同。

名词:proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 · proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。 · 尺子?在本机就能算的分数(替代题、外部测试题等),用来在提交前估计官网分。

下一步验证

检查第二期输入是否影响预测,并用行为对照验证新尺子的区分能力。

Harness

部分搜索没有发起新方向

8 次运行生成了至少 10 个新节点,但没有 draft 记录。

提示这是搜索操作覆盖的证据,还不能据此判断实际方法族数量。

名词:draft?搜索节点的一种操作:从空白开始,按方法族库换一个全新的方法族起草最小版本;另两种是 improve(在父节点上改结构)和 debug(修运行错误)。

下一步验证

验证新调度在真实运行中的方向覆盖,同时检查相同程序的重复探索。

官网校准

官网结果需要与本地选择一起看

已有 25 组带官网分的预测记录,已按题目和已知预测哈希去重。

提示这些结果是历史观察,不能直接当作框架的受控重复;缺失哈希的记录尚不能确认唯一性。

下一步验证

为下一轮冻结实验条件,每份新预测同时记录官网结果、本地评估上下文和实际胜者。

按实验问题查看(23 组)
运行链 1 次运行 / T2:heart:val_extrap

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
运行链 1 次运行 / T2:embryo:val_interp

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
运行链 1 次运行 / T3:gata4

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
其他运行 3 次运行 / T3:gata4

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行

全部实验

术语速查:proxy(本地替代题)· 尺子(本地打分的题)· 护栏(终选把关)· draft(新方向)· 基线(照抄上一阶段)· 运行链?每个题目一串锁定的 run(每环 12 或 24 小时),后一环用 --continue-from 导入前一环的节点、教训和未做完的工作。run 内不能改配置,改动只发生在两环之间。。完整说明见工作原理。