Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-02 03:42

A/B/C 框架对比 / C 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n58
本运行目标 52.72(种子 0 单次)
节点?搜索树里的每个候选程序。
61
已打分 60
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
254
分析员 60、native 180、审查员 14

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测50.0真值 B 半 / 3 个 seed均值
proxy搜索目标复测54.1真值 B 半 / 3 个 seed均值
proxy2搜索目标复测54.1真值 B 半 / 3 个 seed均值
X1终检诊断50.2全部真值 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n9 草稿
改了什么
搜索目标分 51.40 · proxy 53.57 · proxy2 53.57 · X3 47.06 · 3 次复测均分 51.75
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 T1 中,用 include_external=False 只取官方输入阶段可以避免外部阶段(如 proxy2 的 Qiu E9.0)标签体系不匹配导致的崩溃/严重失分,proxy2 从 27.43 升到 53.57。
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 1 越界读取:未发现问题——run.py 全部 IO 经由 src.task1_temporal.view_io(load_manifest/panel_genes/read_stage/write_prediction,run.py:19-27,61-68,80),无绝对路径、`..`、/mnt、/home、data/raw、打分器路径,无联网下载。; 2 硬编码目标统计量:未发现问题——只有按名称正则的类型族权重(heart ×1.
↓
n20 改进
改了什么
搜索目标分 51.78(+0.4) · proxy 53.19(-0.4) · proxy2 53.19(-0.4) · X3 48.95(+1.9) · 3 次复测均分 52.15
分析员结论:榜分 +0.38、各分组变化均 <2 分(T1 噪声),不能宣称分层抽样或 EB 收缩有效;covariation 反而 -1.40,与'分层抽样保协方差'的预期相反(节点 14 的 covariation 50.79 也并未超过父节点 51.96)。
↓
n40 改进
改了什么
搜索目标分 52.42(+0.6) · proxy 53.65(+0.5) · proxy2 53.65(+0.5) · X3 49.96(+1.0) · 3 次复测均分 52.65
分析员结论:在分层无放回抽样框架下移除逐基因 EB 收缩位移:covariation +2.31、de_recovery 仅 +0.35(噪声内),说明该位移在本 proxy 上是净负担——它没换来 de_recovery 收益,却压低了协方差保真度。
审查意见 通过 1 未发现问题:run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/read_stage 读取 args.data 下 manifest 列出的输入阶段(run.py:68-76),无绝对路径、'..'、/mnt、/home、data/raw、打分器路径,无网络访问,未读取目标阶段文件。; 2 未发现问题:家族权重(heart=1.5 / reduced=0.2 / gut=0.9
↓
n58 改进 终选程序
改了什么
搜索目标分 52.61(+0.2) · proxy 53.93(+0.3) · proxy2 53.93(+0.3) · X3 49.96(+0.0) · 3 次复测均分 52.72
分析员结论:稀疏矩阵上用 ||x||²-2x·c+||c||² 计算到质心距离替代 todense(),在 T1 数据上内存峰值降约 21%(1.60→1.26 GB)且分数不变,是零风险的内存优化。
审查意见 通过 检查1(越界读取):未发现问题。run.py 只通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 读取 --data 视图内路径,全文件 grep 无绝对路径、'..'、/mnt、/home、data/raw、downloads、评分器路径或联网调用。; 检查2(硬编码目标统计量):未发现问题。run.py:35-57 只有按细胞类型名正则的家族规则

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,39.341n2 改进,已打分,46.30n3 改进,已打分,47.07n4 改进,已打分,48.22n5 改进,已打分,47.44n6 改进,已打分,45.10n7 改进,已打分,48.63n8 改进,已打分,48.46n9 草稿,已打分,51.40n10 改进,已打分,48.60n11 改进,已打分,49.31n12 改进,已打分,49.12n13 改进,已打分,50.79n14 改进,已打分,51.86n15 改进,已打分,50.97n16 草稿,已打分,48.34n17 草稿,已打分,48.23n18 改进,已打分,51.21n19 改进,已打分,52.09n20 改进,已打分,51.78n21 改进,已打分,51.40n22 改进,已打分,51.63n23 改进,已打分,52.12n24 改进,已打分,51.89n25 改进,已打分,52.18n26 改进,已打分,52.05n27 改进,已打分,51.06n28 改进,已打分,50.92n29 改进,已打分,49.22n30 改进,已打分,52.11n31 改进,已打分,51.98n32 改进,已打分,51.86n33 改进,已打分,52.11n34 改进,已打分,51.96n35 改进,已打分,52.28n36 改进,已打分,52.08n37 改进,已打分,52.20n38 改进,程序报错n39 修复,已打分,52.33n40 改进,已打分,52.42n41 草稿,已打分,50.03n42 改进,已打分,52.11n43 改进,已打分,51.56n44 草稿,已打分,48.54n45 改进,已打分,52.44n46 改进,已打分,51.11n47 草稿,已打分,48.11n48 草稿,已打分,48.24n49 草稿,已打分,48.10n50 改进,已打分,52.40n51 改进,已打分,52.15n52 改进,已打分,52.08n53 草稿,已打分,46.87n54 改进,已打分,52.44n55 改进,已打分,52.42n56 改进,已打分,52.44n57 改进,已打分,52.17n58 改进,已打分,52.6158n59 草稿,已打分,47.47n60 改进,已打分,52.27n61 改进,已打分,52.44终选
已打分?程序正常跑完并拿到分数。程序报错?候选程序运行时出错。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
4042.54547.55052.5050100150200从开始算起的分钟数20261002-034201-search-t1-abc-r1-C-native20261002-034201-search-t1-abc-r1-C-native:1 分钟 39.3420261002-034201-search-t1-abc-r1-C-native:7 分钟 47.0720261002-034201-search-t1-abc-r1-C-native:15 分钟 47.4420261002-034201-search-t1-abc-r1-C-native:17 分钟 48.2220261002-034201-search-t1-abc-r1-C-native:26 分钟 48.6320261002-034201-search-t1-abc-r1-C-native:40 分钟 51.4020261002-034201-search-t1-abc-r1-C-native:70 分钟 51.8620261002-034201-search-t1-abc-r1-C-native:85 分钟 52.0920261002-034201-search-t1-abc-r1-C-native:100 分钟 52.1220261002-034201-search-t1-abc-r1-C-native:106 分钟 52.1820261002-034201-search-t1-abc-r1-C-native:135 分钟 52.2820261002-034201-search-t1-abc-r1-C-native:145 分钟 52.4220261002-034201-search-t1-abc-r1-C-native:162 分钟 52.4420261002-034201-search-t1-abc-r1-C-native:211 分钟 52.61
全部节点与对话(61)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分39.3—50.027.440.539.4通过不到 1 分seed pseudobulk_shift
n2n1改进已打分46.3+7.049.249.240.546.7未审查6 分改了什么
n3n1改进已打分47.1+7.749.349.342.747.6通过5 分改了什么
n4n3改进已打分48.2+1.149.349.346.148.7通过9 分改了什么
n5n1改进已打分47.4+8.149.349.343.848.0未审查7 分改了什么
n6n2改进已打分45.1-1.246.846.841.8—未审查17 分改了什么
n7n4改进已打分48.6+0.449.249.247.449.3未审查7 分改了什么
n8n3改进已打分48.5+1.449.049.047.448.9未审查7 分改了什么
n9—草稿已打分51.4—53.653.647.151.8通过7 分改了什么
n10n7改进已打分48.6-0.049.249.247.4—未审查31 分改了什么
n11n8改进已打分49.3+0.949.549.549.049.7未审查6 分改了什么
n12n4改进已打分49.1+0.949.149.149.249.6未审查7 分改了什么
n13n9改进已打分50.8-0.653.553.545.451.0通过7 分改了什么
n14n11改进已打分51.9+2.553.153.149.352.2通过5 分改了什么
n15n4改进已打分51.0+2.753.453.446.151.1未审查6 分改了什么
n16—草稿已打分48.3—50.050.044.9—未审查6 分改了什么
n17—草稿已打分48.2—49.649.645.5—未审查5 分改了什么
n18n9改进已打分51.2-0.253.353.347.151.4未审查7 分改了什么
n19n11改进已打分52.1+2.853.553.549.352.1通过7 分改了什么
n20n9改进已打分51.8+0.453.253.249.052.1未审查4 分改了什么
n21n13改进已打分51.4+0.653.653.647.1—未审查6 分改了什么
n22n11改进已打分51.6+2.352.752.749.452.0未审查7 分改了什么
n23n15改进已打分52.1+1.253.553.549.452.1通过6 分改了什么
n24n21改进已打分51.9+0.553.253.249.3—未审查5 分改了什么
n25n11改进已打分52.2+2.953.853.848.952.2通过4 分改了什么
n26n19改进已打分52.1-0.053.553.549.2—未审查7 分改了什么
n27n18改进已打分51.1-0.153.653.646.0—未审查6 分改了什么
n28n9改进已打分50.9-0.553.653.645.6—未审查7 分改了什么
n29n14改进已打分49.2-2.649.149.149.5—未审查4 分改了什么
n30n9改进已打分52.1+0.753.253.250.052.5未审查5 分改了什么
n31n11改进已打分52.0+2.754.154.147.7—未审查5 分改了什么
n32n22改进已打分51.9+0.253.153.149.3—未审查4 分改了什么
n33n30改进已打分52.1+0.053.253.250.0—未审查6 分改了什么
n34n14改进已打分52.0+0.153.353.349.3—未审查6 分改了什么
n35n30改进已打分52.3+0.253.453.450.052.5通过3 分改了什么
n36n14改进已打分52.1+0.253.153.150.0—未审查5 分改了什么
n37n30改进已打分52.2+0.153.353.350.052.4未审查4 分改了什么
n38n36改进程序报错——————未审查1 分改了什么
n39n38修复已打分52.3—53.553.550.052.6通过5 分改了什么
n40n20改进已打分52.4+0.653.753.750.052.6通过4 分改了什么
n41—草稿已打分50.0—50.050.050.0—未审查10 分改了什么
n42n30改进已打分52.1+0.053.253.250.0—未审查5 分改了什么
n43n23改进已打分51.6-0.653.553.547.7—未审查2 分改了什么
n44—草稿已打分48.5—50.550.544.6—未审查7 分改了什么
n45n14改进已打分52.4+0.653.753.750.052.6通过4 分改了什么
n46n14改进已打分51.1-0.853.153.147.1—未审查5 分改了什么
n47—草稿已打分48.1—50.850.842.8—未审查12 分改了什么
n48—草稿已打分48.2—50.050.044.7—未审查7 分改了什么
n49—草稿已打分48.1—50.050.044.2—未审查8 分改了什么
n50n36改进已打分52.4+0.353.653.650.0—未审查4 分改了什么
n51n39改进已打分52.2-0.253.253.250.0—未审查6 分改了什么
n52n14改进已打分52.1+0.253.153.150.0—未审查6 分改了什么
n53—草稿已打分46.9—50.050.040.5—未审查4 分改了什么
n54n44改进已打分52.4+3.953.753.750.0—通过4 分改了什么
n55n40改进已打分52.4+0.053.753.750.0—未审查5 分改了什么
n56n14改进已打分52.4+0.653.753.750.0—未审查7 分改了什么
n57n30改进已打分52.2+0.153.753.749.2—未审查9 分改了什么
n58n40改进已打分52.6+0.253.953.950.052.7通过7 分改了什么
n59—草稿已打分47.5—50.051.840.5—未审查8 分改了什么
n60n30改进已打分52.3+0.253.753.749.5—未审查4 分改了什么
n61n12改进已打分52.4+3.353.753.750.0—未审查4 分改了什么
资源消耗与失败情况

程序报错 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员60035 分444,23385,458
native18004 小时 14 分4,172,631686,735
审查员14018 分228,28946,910
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261002-034201-search-t1-abc-r1-C-native
10-02 03:42 · 自动搜索 · T1:val · A/B/C 框架对比 · C 组 · r1-native
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy+proxy2+X3 等权;终检 X1
状态已结束
开始 / 结束10-02 03:42 / 10-02 07:22
用时3 小时 39 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。a3935ba50ec7aa51d88cffe46f526585058d9edd
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-C-native/config_source.yaml
配置指纹 79d14514265ad4ae
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。8eaaf3b2cfdeb02a 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-C-native/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。3337117a6cf3c4db
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:22 个文件,指纹 edb68fc794d79881
proxy:18 个文件,指纹 166d21c45cc35ede
proxy2:20 个文件,指纹 3a64c6f141374179
test:38 个文件,指纹 f706ad2858ee7264
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-C-native 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告