Virtual Embryo Challenge更新于 10-03 18:07(北京时间) / 每 5 分钟更新

虚拟胚胎 / 研究工作台

研究进展

这个面板回答三件事:现在在做什么、排队什么、之前做得怎样。agent 在每个题目上搜索更好的建模代码,最终要看官网分是否真的变好。第一次看,先读工作原理。

现在在做什么

2 个运行在跑

  • 运行链 search-t2-heart-extrap-chain-12h 运行中

    T2 心脏外推:自动搜索:多个节点轮流改程序、打分、挑最好的;接续上一环的结果继续搜索;按「proxy_noscale;终检 X2;护栏 proxy_noscale;诊断 proxy」给候选打分。

    已跑 47 分 / 预算 12 小时 · 新候选已评分 2 / 已生成 4 · 当前最好 52.7(3 次复测均分)

  • 运行链 search-t2-embryo-interp-chain-12h 运行中

    T2 全胚插值:自动搜索:多个节点轮流改程序、打分、挑最好的;接续上一环的结果继续搜索;按「proxy;终检 X2;护栏 proxy」给候选打分。

    已跑 47 分 / 预算 12 小时 · 新候选已评分 0 / 已生成 2 · 当前最好 62.5(3 次复测均分)

排队什么

1 条运行链配置还没启动;15 个已结束的运行还没有官网分。

  • 未启动 T1 验证(E8.5 + E9.5 → E10.5) search-t1-D-24h · 24 小时
    等待原因(decisions.tsv 2026-10-03「T1 链启动时机」):Codex 实现审阅(notes/reports/reviews/2026-10-03_codex_g45_impl.md)发现 4 个 P0 + 护栏 seed 指纹问题;T1 24 h 链等这些修复与三环回归通过后再启动,不做"第一环关闭续做"的折中agent/configs/experiments/chain/t1_D_12h.yaml
已启动过的配置(10)
  • 冒烟配置 T1 验证(E8.5 + E9.5 → E10.5) search-t1-D-smoke2h · 2 小时
    最近一次:运行链 / D 组 20261003-153851 已结束agent/configs/experiments/chain/t1_D_smoke2h.yaml
  • 已在跑 T2 全胚插值 search-t2-embryo-interp-chain-12h · 12 小时
    最近一次:运行链 20261003-171955 运行中agent/configs/experiments/chain/t2_embryo_interp_12h.yaml
  • 已在跑 T2 心脏外推 search-t2-heart-extrap-chain-12h · 12 小时
    最近一次:运行链 20261003-172000 运行中agent/configs/experiments/chain/t2_heart_extrap_12h.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s015 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s015.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s030 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s030.yaml
  • 已跑过 T2 心脏外推 search-t2-heart-extrap-g40-s045 · 1 小时
    最近一次:G40 心脏外推尺度扫描 20261003-155751 已结束agent/configs/experiments/g40_scale/heart_extrap_s045.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-chain-12h · 12 小时
    最近一次:运行链 20261003-172000 已结束agent/configs/experiments/chain/t3_agent_12h.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-a · 4 小时
    最近一次:早期 Agent / komix-a 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_a.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-b · 4 小时
    最近一次:早期 Agent / komix-b 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_b.yaml
  • 已跑过 T3 Gata4 敲除 t3-gata4-komix-c · 4 小时
    最近一次:早期 Agent / komix-c 20261003-155754 已结束agent/configs/experiments/g24_t2_t3/t3_komix_c.yaml

待提交官网的候选(推算 15,含不打算提交的试验 run)

另有 5 个未列出。

「排队」指什么

这里的排队有两种:一是待启动的运行链(每个配置文件对应一个锁定运行,人或 Claude 手动 launch;一环结束后用 --continue-from 接下一环);二是待提交的预测包(run 结束后由人挑选并上传官网)。run 内部还有节点排队等空闲名额,显示在「现在在做什么」里。

来源:agent/configs/experiments/{chain,g40_scale,g24_t2_t3}/*.yaml(运行链配置,与已有运行按配置名对照)、notes/changelogs/decisions.tsv(等待原因)、提交台账(待提交由「有终选、台账无官网分」推算)。项目里没有机器可读的排队表(G45 调度器未接线),所以「何时启动」只能写出文档里的原因,不预测时间。官网登录状态不在档案里,本页不显示;每日打分次数(P2 阶段每任务每天 8 次,10-20 起测试榜每榜整个阶段 2 次,见 notes/plan/README.md)是文档或会话信息,不是实时数据。

之前做得怎样

按题目看最近一次终选与官网分;官网分只来自提交台账。

题目最近一次已结束的运行终选与基线比,一句话
T1 验证(E8.5 + E9.5 → E10.5)
24 次运行
t1_round2 / D 组
10-03 09:34 · 已结束
选中节点 n21
本地最好 56.8(3 次复测均分)
官网 55.0,实测照抄基线 46.9,相差 +8.1(单次历史观察,不是受控结论)。
T2 全胚插值
6 次运行
G24 T2/T3 首跑 / D 组
10-03 09:42 · 已结束
选中节点 n15
本地最好 62.5(3 次复测均分)
官网 61.7;这个榜还没有可确认的实测照抄基线,不能说好坏。
T2 心脏外推
8 次运行
G40 心脏外推尺度扫描
10-03 15:57 · 已结束
选中节点 n1
本地最好 50.0(3 次复测均分)
这次运行还没有官网分。该榜已有的官网记录里最高 49.6。 档案核对:G24 T2/T3 首跑 / D 组 的终选护栏回退到了照抄基线。 本次选中的是尺度扫描种子,本地 50.0 与照抄基线同分:去掉尺寸项后(proxy_noscale)本地尺子看不见坐标缩放,只能靠官网配额判断(配置 g40_scale/*.yaml 注释记 VM 核对 50.00 / 50.00,来源是注释与 decisions.tsv,不是本页重算)。
T2 心脏插值
5 次运行
G24 T2/T3 首跑 / D 组
10-03 09:42 · 已结束
选中节点 n30
本地最好 68.3(3 次复测均分)
这次运行还没有官网分。该榜已有的官网记录里最高 63.9。
T3 Gata4 敲除
7 次运行
运行链
10-03 17:20 · 已结束
交出最终文件(单 Agent)
本地最好 87.0(单 Agent 自报的本地代理分)
这次运行还没有官网分。该榜已有的官网记录里最高 53.4。 T3 没有可靠的本地尺子(留一基因尺子在 3 个官网点上完全反序,来源 notes/architecture/14 与 10 §5),所以本地分只作参考。
多个题目(早期单 Agent)1 次运行,还没有已结束并有终选的运行。

「照抄基线」= 把输入阶段原样当预测交上去(基线?copy_last:把最后一个输入阶段的细胞原样当预测交上去,是所有改进要超过的底线;我们流水线实测的官网分是 T1 46.9,不是评分器参考线 50。);终选护栏?最后选程序时的把关:候选必须在没用过的新 seed 上稳定胜过照抄基线(T1 要求配对增益的单侧下界 > 0),否则交出照抄基线。要求候选在新 seed 上稳定胜过它才替换。怎么判断 · 完整校准

今日用量 361.48 M token(输入 27.34 M / 输出 8.97 M / 缓存读 324.87 M),1445 次调用,折算 0.00。用量与花费

线索与细节

需要时展开
观察与提示(5) 搜索有改动,终选仍回到基线;两把尺子经常给出相同信号;部分搜索没有发起新方向

这些是程序根据档案自动给出的观察,每条分「观察 / 提示 / 下一步验证」,只是线索,不是结论。

模型与目标

搜索有改动,终选仍回到基线

2 次运行最终由护栏选择基线。

提示当前候选未满足该 run 锁定的终选规则;这不等于整个方法族已经无效。

名词:护栏 · 基线

下一步验证

逐项查看被拒候选的收益与退化,再区分方法迁移问题和护栏设置问题。

评估设计

两把尺子经常给出相同信号

7 次运行中,230/246 个有双尺子记录的新候选,proxy 与 proxy2 同分。

提示第二把尺子的额外区分度有限;同分不能证明代码或预测相同。

名词:proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 · proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。 · 尺子?在本机就能算的分数(替代题、外部测试题等),用来在提交前估计官网分。

下一步验证

检查第二期输入是否影响预测,并用行为对照验证新尺子的区分能力。

Harness

部分搜索没有发起新方向

8 次运行生成了至少 10 个新节点,但没有 draft 记录。

提示这是搜索操作覆盖的证据,还不能据此判断实际方法族数量。

名词:draft?搜索节点的一种操作:从空白开始,按方法族库换一个全新的方法族起草最小版本;另两种是 improve(在父节点上改结构)和 debug(修运行错误)。

下一步验证

验证新调度在真实运行中的方向覆盖,同时检查相同程序的重复探索。

官网校准

官网结果需要与本地选择一起看

已有 25 组带官网分的预测记录,已按题目和已知预测哈希去重。

提示这些结果是历史观察,不能直接当作框架的受控重复;缺失哈希的记录尚不能确认唯一性。

下一步验证

为下一轮冻结实验条件,每份新预测同时记录官网结果、本地评估上下文和实际胜者。

按实验问题查看(23 组)
运行链 1 次运行 / T2:heart:val_extrap

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
运行链 1 次运行 / T2:embryo:val_interp

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
运行链 1 次运行 / T3:gata4

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行
其他运行 3 次运行 / T3:gata4

这组运行带来了什么变化?

按目标与来源查看结果;未登记控制条件时,只作描述性比较。

比较这组运行

全部实验

术语速查:proxy(本地替代题)· 尺子(本地打分的题)· 护栏(终选把关)· draft(新方向)· 基线(照抄上一阶段)· 运行链?每个题目一串锁定的 run(每环 12 或 24 小时),后一环用 --continue-from 导入前一环的节点、教训和未做完的工作。run 内不能改配置,改动只发生在两环之间。。完整说明见工作原理。