Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-01 20:44

G21 快速校准 / B 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n7
本运行目标 50.36(种子 0 单次)
节点?搜索树里的每个候选程序。
8
已打分 8
官网分?官网 P2 返回的真实分数。
47.8
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
20
分析员 5、工程师 5、调研员 5、审查员 5

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
proxy2搜索目标复测50.4真值 B 半 / 3 个 seed均值
X1终检诊断42.8全部真值 / 1 个 seed单次
T1:val官网结果47.8提交预测对应的评分

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n3 种子
seed pseudobulk_shift
搜索目标分 27.43 · proxy2 27.43 · 3 次复测均分 27.50
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n5 改进
trusted_base_shift:预测基底一律取最近的官方(域内)输入阶段;外部/更早阶段只用来估计小步长、按类型收缩的伪批量位移,绝不直接当输出细胞。
搜索目标分 50.45(+23.0) · proxy2 50.45(+23.0) · 3 次复测均分 50.24
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:当最新输入是域外/异技术阶段(基因面板被均值补齐、组成偏单一谱系)时,直接 copy_last 会摧毁 cell_state 和 covariation(各跌到 <4),改用最近域内官方阶段作基底可回升 +45/+49 分——'状态取域内、方向取域外小步长位移'的解耦在 T1 上成立。
审查意见 通过 检查1(越界读取):未发现问题——run.py 只通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 从 --data 视图读取 manifest.inputs 列出的阶段(L78-L104),无绝对路径、'..'、/mnt、/home、data/raw、downloads、打分器或 src/common/evaluation 引用,无网络访问。; 检
↓
n7 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
trusted_base_shift 精修:外部 Qiu delta 按映射类型样本量做可靠性缩放 α·n/(n+200),并取消 endocardial→Endothelium 映射;其余父节点5路径不变。低秩 PC 去噪已测试但未采用。
搜索目标分 50.53(+0.1) · proxy2 50.53(+0.1) · 3 次复测均分 50.36
分析员结论:在跨技术外部 delta(sci-RNA-seq3、4402 基因均值补齐)上,把 delta 投影到基底 E8.5 的前 50/100 个共表达 PC(β=1)并不能抬高 α 上限:去噪后 α=0.5 仍降分(49.88 vs α=0.3 的 49.80),且 direction 反降(51.6 vs 52.1)——说明卡住 α 的不是各向同性逐基因噪声,且 PC 投影会抹掉 direction 指标依赖的逐基因 DE 方向信号。
审查意见 通过 1 越界读取:未发现问题——run.py 只通过 view_io(load_manifest/read_stage/panel_genes 等,run.py:32-43)访问 args.data,无绝对路径、..、/mnt、打分器或 src/common/evaluation 引用,无联网代码。; 2 硬编码目标统计量:未发现问题——ALPHA/N0 为超参(run.py:45-49),外部类型细胞数 n_t 现场由 len(idx_e

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,27.431n2 种子,已打分,27.432n3 种子,已打分,27.433n4 改进,已打分,50.044n5 改进,已打分,50.455n6 改进,已打分,50.836n7 改进,已打分,50.537n8 改进,已打分,50.898终选 · 已提交
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
303540455001020304050从开始算起的分钟数20261001-204440-search-t1-g21q-B20261001-204440-search-t1-g21q-B:0 分钟 27.4320261001-204440-search-t1-g21q-B:13 分钟 50.0420261001-204440-search-t1-g21q-B:17 分钟 50.4520261001-204440-search-t1-g21q-B:36 分钟 50.5320261001-204440-search-t1-g21q-B:45 分钟 50.8320261001-204440-search-t1-g21q-B:51 分钟 50.89
全部节点与对话(8)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分27.4—27.427.5通过不到 1 分seed copy_last
n2—种子已打分27.4—27.427.5通过不到 1 分seed heart_jcf_peri
n3—种子已打分27.4—27.427.5通过不到 1 分seed pseudobulk_shift
n4n1改进已打分50.0+22.650.050.1通过12 分稳健锚点选择:只用通过 QC 的官方全基因覆盖输入作输出底座(proxy2 上排除外部 Qiu E9.0,锚定 E8.5);两个可信官方阶段时才启用类型匹配阻尼伪批量位移。
n5n3改进已打分50.5+23.050.550.2通过16 分trusted_base_shift:预测基底一律取最近的官方(域内)输入阶段;外部/更早阶段只用来估计小步长、按类型收缩的伪批量位移,绝不直接当输出细胞。
n6n4改进已打分50.8+0.850.850.0通过28 分在节点4锚点选择上加类型内伪时间前推位移:每个≥100细胞的类型以增殖分最高细胞为根做DPT,按伪时间4分位bin拟合基因斜率(MAD收缩+99分位截断),全体细胞加β=0.25·斜率并clip≥0。
n7n5改进已打分50.5+0.150.550.4通过18 分trusted_base_shift 精修:外部 Qiu delta 按映射类型样本量做可靠性缩放 α·n/(n+200),并取消 endocardial→Endothelium 映射;其余父节点5路径不变。低秩 PC 去噪已测试但未采用。
n8n7改进已打分50.9+0.450.950.7不通过13 分父节点7基底上加类型内方差成熟化膨胀(s=1.05):输出细胞按基底类型绕类型均值放大离差再夹≥0,补偿基底细胞云相对目标阶段偏紧;endocardial 回收 f=0.3 已测无增益、不采用。
资源消耗与失败情况

没有失败节点

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员503 分50,2587,922
工程师501 小时 8 分248,19682,650
调研员5013 分66,06531,622
审查员5011 分112,82227,648
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261001-204440-search-t1-g21q-B
10-01 20:44 · 自动搜索 · T1:val · G21 快速校准 · B 组
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy2;终检 X1
状态已结束
开始 / 结束10-01 20:44 / 10-01 21:38
用时53 分 / 预算 1 小时 15 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。1b079590444b55e5d5e5043f4809084e30d1da66
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261001-204440-search-t1-g21q-B/config_source.yaml
配置指纹 7fd87d7269c131b4
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。f6164bd81223b5a8 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261001-204440-search-t1-g21q-B/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。a192249b5426ce40
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:22 个文件,指纹 edb68fc794d79881
proxy:18 个文件,指纹 166d21c45cc35ede
proxy2:20 个文件,指纹 3a64c6f141374179
test:19 个文件,指纹 528e8fdd2929e988
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261001-204440-search-t1-g21q-B 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 5 行 · 2026-10-01 · T1:val · 预测文件指纹 da4987d94e651b32 · 官网分 47.8
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告