Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-02 20:29

screen_abcd / C 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n52
本运行目标 50.84(种子 0 单次)
节点?搜索树里的每个候选程序。
75
已打分 62
官网分?官网 P2 返回的真实分数。
47.8
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
306
分析员 60、native 215、审查员 31

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测50.8真值 B 半 / 3 个 seed均值
X1终检诊断49.0全部真值 / 1 个 seed单次
X4终检诊断48.7全部真值 / 1 个 seed单次
X5终检诊断46.9全部真值 / 1 个 seed单次
X6终检诊断45.3全部真值 / 1 个 seed单次
proxy诊断记录46.8真值 B 半 / 1 个 seed单次
T1:val官网结果47.8提交预测对应的评分

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n49 草稿
改了什么
搜索目标分 52.29 · X3 52.29 · 3 次复测均分 50.13
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 T1 上把确定性 OT 耦合位移换成 [SF]^2M 桥漂移 + 输出端 PCA 各向同性噪声(NOISE_OUT=0.3)时,榜分只 +1.64(噪声内),但分组剧烈重排:cell_state +15.2 而 covariation -8.8、de_recovery -5.9——输出端注入的各向同性噪声换来分布层面匹配、破坏基因间协变与 DE 恢复,在总分上近似抵消。
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 1 越界读取:未发现问题。run.py 只通过 src.task1_temporal.view_io 的 load_manifest/panel_genes/read_stage/write_prediction 访问视图数据(run.py:35, g37_common.py:16),无绝对路径、.. 、/mnt、/home、data/raw、打分器路径,无联网代码。; 2 硬编码目标统计量:未发现问题。全部数值均为算法超参(N_HVG
↓
n52 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
改了什么
搜索目标分 53.15(+0.9) · X3 53.15(+0.9) · 3 次复测均分 50.84
分析员结论:在 [SF]²M 输出端用经验协方差 Cholesky 噪声替代各向同性噪声,covariation +4.26、de_recovery +3.59,但 cell_state 仍比父节点低 3.32:协方差形状噪声保住了基因间相关结构,却没有恢复多样性指标。
审查意见 通过 1 未发现问题:run.py 与 g37_common.py 仅通过框架 src.task1_temporal.view_io 读取视图内输入(load_manifest/read_stage/panel_genes),无绝对路径、'..'、/mnt、/home、打分器路径或网络访问。; 2 未发现问题:run.py:37-49 的常量均为方法超参数(N_HVG、SIGMA、NOISE_OUT、CLIP_SD、COV_REG 等);g3

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,47.921n2 种子,已打分,50.652n3 改进,已打分,45.97n4 改进,已打分,52.13n5 改进,已打分,47.88n6 草稿,生成失败n7 改进,已打分,46.27n8 改进,已打分,51.80n9 改进,生成失败n10 改进,已打分,49.00n11 改进,已打分,51.75n12 改进,已打分,47.37n13 改进,已打分,49.00n14 改进,已打分,51.80n15 草稿,已打分,51.09n16 改进,已打分,51.66n17 改进,已打分,49.00n18 草稿,已打分,50.05n19 改进,已打分,52.33n20 改进,已打分,49.90n21 改进,已打分,48.63n22 改进,已打分,47.88n23 改进,已打分,46.34n24 改进,已打分,49.34n25 改进,已打分,51.50n26 改进,已打分,48.11n27 改进,已打分,49.29n28 草稿,已打分,46.45n29 改进,已打分,51.02n30 改进,已打分,49.28n31 改进,已打分,49.89n32 改进,已打分,50.72n33 改进,已打分,50.48n34 改进,已打分,52.33n35 草稿,已打分,50.09n36 改进,已打分,48.97n37 改进,已打分,52.22n38 草稿,已打分,50.65n39 改进,已打分,49.36n40 改进,已打分,50.15n41 改进,已打分,48.43n42 改进,已打分,51.65n43 草稿,已打分,50.40n44 改进,已打分,52.13n45 改进,已打分,50.04n46 草稿,已打分,50.77n47 改进,已打分,46.94n48 改进,生成失败n49 草稿,已打分,52.29n50 改进,已打分,50.64n51 草稿,已打分,50.98n52 改进,已打分,53.1552n53 改进,已打分,50.93n54 改进,已打分,51.04n55 草稿,生成失败n56 改进,已打分,43.99n57 改进,已打分,49.08n58 改进,被中断n59 草稿,已打分,52.37n60 改进,已打分,52.81n61 改进,已打分,52.32n62 改进,生成失败n63 改进,已打分,44.24n64 改进,生成失败n65 改进,生成失败n66 改进,生成失败n67 改进,已打分,51.71n68 改进,生成失败n69 改进,已打分,49.34n70 改进,已打分,51.71n71 改进,生成失败n72 草稿,生成失败n73 草稿,已打分,49.76n74 草稿,被中断n75 改进,已打分,50.48终选 · 已提交
已打分?程序正常跑完并拿到分数。生成失败?会话没能产出可用的程序。被中断?因重启或大模型接口故障中断,不计入搜索。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
4849505152530255075100125150175从开始算起的分钟数20261002-202908-search-t1-scr-C20261002-202908-search-t1-scr-C:2 分钟 47.9220261002-202908-search-t1-scr-C:2 分钟 50.6520261002-202908-search-t1-scr-C:12 分钟 52.1320261002-202908-search-t1-scr-C:65 分钟 52.3320261002-202908-search-t1-scr-C:183 分钟 53.15
全部节点与对话(75)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分47.9—47.948.4通过不到 1 分seed copy_last
n2—种子已打分50.7—50.748.9通过不到 1 分ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
n3n1改进已打分46.0-1.946.046.2未审查5 分改了什么
n4n2改进已打分52.1+1.552.150.2通过9 分改了什么
n5n1改进已打分47.9-0.047.948.1未审查7 分改了什么
n6—草稿生成失败————未审查9 分—
n7n1改进已打分46.3-1.646.346.8未审查12 分改了什么
n8n2改进已打分51.8+1.151.849.9通过5 分改了什么
n9n5改进生成失败————未审查2 分—
n10n1改进已打分49.0+1.149.048.9未审查5 分改了什么
n11n8改进已打分51.7-0.051.750.0通过5 分改了什么
n12n5改进已打分47.4-0.547.4—未审查5 分改了什么
n13n7改进已打分49.0+2.749.048.9未审查5 分改了什么
n14n11改进已打分51.8+0.051.849.9通过6 分改了什么
n15—草稿已打分51.1—51.149.6通过7 分改了什么
n16n15改进已打分51.7+0.651.750.4通过6 分改了什么
n17n10改进已打分49.0+0.049.0—未审查5 分改了什么
n18—草稿已打分50.0—50.047.5未审查9 分改了什么
n19n4改进已打分52.3+0.252.350.4通过6 分改了什么
n20n18改进已打分49.9-0.149.9—未审查14 分改了什么
n21n1改进已打分48.6+0.748.6—未审查3 分改了什么
n22n11改进已打分47.9-3.947.9—未审查5 分改了什么
n23n12改进已打分46.3-1.046.3—未审查3 分改了什么
n24n17改进已打分49.3+0.349.3—未审查7 分改了什么
n25n22改进已打分51.5+3.651.549.7通过5 分改了什么
n26n5改进已打分48.1+0.248.1—未审查7 分改了什么
n27n21改进已打分49.3+0.749.3—未审查5 分改了什么
n28—草稿已打分46.4—46.4—未审查7 分改了什么
n29n4改进已打分51.0-1.151.048.9通过5 分改了什么
n30n20改进已打分49.3-0.649.3—未审查4 分改了什么
n31n28改进已打分49.9+3.449.9—未审查4 分改了什么
n32n25改进已打分50.7-0.850.748.9通过2 分改了什么
n33n16改进已打分50.5-1.250.549.4通过2 分改了什么
n34n19改进已打分52.3-0.052.350.4通过7 分改了什么
n35—草稿已打分50.1—50.150.5通过6 分改了什么
n36n35改进已打分49.0-1.149.0—未审查6 分改了什么
n37n16改进已打分52.2+0.652.250.7通过5 分改了什么
n38—草稿已打分50.7—50.748.9通过6 分改了什么
n39n20改进已打分49.4-0.549.4—未审查20 分改了什么
n40n38改进已打分50.1-0.550.1—未审查7 分改了什么
n41n5改进已打分48.4+0.548.4—未审查5 分改了什么
n42n40改进已打分51.7+1.551.749.7通过2 分改了什么
n43—草稿已打分50.4—50.448.3通过6 分改了什么
n44n19改进已打分52.1-0.252.150.2通过5 分改了什么
n45n43改进已打分50.0-0.450.0—未审查8 分改了什么
n46—草稿已打分50.8—50.848.8通过12 分改了什么
n47n38改进已打分46.9-3.746.9—未审查2 分改了什么
n48n8改进生成失败————未审查2 分—
n49—草稿已打分52.3—52.350.1通过10 分改了什么
n50n46改进已打分50.6-0.150.648.6通过7 分改了什么
n51—草稿已打分51.0—51.049.0通过4 分改了什么
n52n49改进已打分53.1+0.953.150.8通过5 分改了什么
n53n51改进已打分50.9-0.150.948.9通过6 分改了什么
n54n37改进已打分51.0-1.251.049.8通过3 分改了什么
n55—草稿生成失败————未审查6 分—
n56n38改进已打分44.0-6.744.0—未审查3 分改了什么
n57n20改进已打分49.1-0.849.1—未审查4 分改了什么
n58n35改进被中断————未审查1 分—
n59—草稿已打分52.4—52.450.0通过11 分改了什么
n60n52改进已打分52.8-0.352.850.7通过3 分改了什么
n61n19改进已打分52.3-0.052.350.4通过4 分改了什么
n62n19改进生成失败————未审查2 分—
n63n38改进已打分44.2-6.444.2—未审查6 分改了什么
n64n61改进生成失败————未审查2 分—
n65n16改进生成失败————未审查1 分—
n66n60改进生成失败————未审查1 分—
n67n2改进已打分51.7+1.151.749.8通过2 分改了什么
n68n37改进生成失败————未审查不到 1 分—
n69n7改进已打分49.3+3.149.3—未审查4 分改了什么
n70n45改进已打分51.7+1.751.749.8通过3 分改了什么
n71n50改进生成失败————未审查1 分—
n72—草稿生成失败————未审查11 分—
n73—草稿已打分49.8—49.8—未审查7 分改了什么
n74—草稿被中断————未审查17 分—
n75n73改进已打分50.5+0.750.548.6通过6 分改了什么
资源消耗与失败情况

生成失败 11 被中断 2

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员60051 分582,965135,556
native21504 小时 40 分4,825,568741,915
审查员31037 分576,629103,027
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261002-202908-search-t1-scr-C
10-02 20:29 · 自动搜索 · T1:val · screen_abcd · C 组 · scr
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3;终检 X1、X6、X4、X5;护栏 X3;诊断 proxy
状态已结束
开始 / 结束10-02 20:29 / 10-03 00:49
用时4 小时 20 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。ef9306882c5ce000b0d66dd6ac17a37c661c7ec5
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-C/config_source.yaml
配置指纹 b33ba20c4af378de
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。119d2c272d3bf7c1 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-C/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。fb88301e4aba02c2
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:120 个文件,指纹 4251258f721da0d4
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-C 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 27 行 · 2026-10-02 · T1:val · 预测文件指纹 d849b1cbd18b9cbe · 官网分 47.8
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告