Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T2:heart:val_interp / 10-02 20:45

G24q

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n5
本运行目标 59.59(种子 0 单次)
节点?搜索树里的每个候选程序。
5
已打分 5
官网分?官网 P2 返回的真实分数。
62.9
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
12
分析员 3、工程师 3、调研员 3、审查员 3

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
proxy搜索目标复测59.6真值 B 半 / 3 个 seed均值
X2终检诊断53.6全部真值 / 1 个 seed单次
T2:heart:val_interp官网结果62.9提交预测对应的评分
为什么选中这个结果:逐候选护栏证据

差值来自该运行的 final_guard 事件,按当时锁定规则判断。不同尺子的分差不合并成一个结论。

候选尺子相对基线当时判定
n1proxy+0.00未通过
n2proxy+10.76通过
n4proxy+10.76通过
n5proxy+10.99通过

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子
seed mix
搜索目标分 59.50 · proxy 59.50 · 3 次复测均分 59.36
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n4 改进
实现 T2HI-01 类型内配对插值并对照:五个变体在代理上均不优于父 mix,提交为机制关闭(=父节点 mix,逐位一致)。
搜索目标分 59.50(+0.0) · proxy 59.50(+0.0) · 3 次复测均分 59.36
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在该榜(proxy 两端相隔 1.25 天、标签词汇不同)做类型内表达-PCA 最近邻配对时,NCC/aPHM/pPHM 的配对距离中位数超过 2× 型内 a 侧中位距离,跨阶段配对质量差,插值细胞不真实,全合成变体榜分 −1.0。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 src.task2_spatial.view_io 的 load_manifest/read_stage/panel_genes 读 --data 视图数据,无绝对路径、'..'、/mnt、/home、data/raw、downloads、打分器路径,无联网代码。; 2 硬编码目标统计量:未发现问题。代码中无细胞类型比例/数量/基因列表常量;PARAMS 与 PCA_DIM=30 等为方法
↓
n5 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
T2HI-05:把 mix 的全局 RMS 缩放换成按细胞类型插值型内 RMS 的缩放(提交态只作用于较晚端点),仅改型内空间离散度,表达不动。
搜索目标分 59.84(+0.3) · proxy 59.84(+0.3) · 3 次复测均分 59.59
分析员结论:只改坐标不动表达的机制(按类型缩放型内 RMS)能保证 expression_change/cell_state 两组严格不变(+0.00),是零风险改动的正确形态,避免 node 3/4 改一处伤多组的净负结局。
审查意见 通过 检查1(越界读取):未发现问题——run.py 不直接 open 任何文件,读取全部经 manifest 驱动的 load_manifest/read_stage/panel_genes;import 来自 src.task2_spatial.*(框架),非 src/common/evaluation;无绝对路径、.. 、/mnt、/home、data/raw、downloads,也无联网。; 检查2(硬编码目标统计量):未发现问题——

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,48.681n2 种子,已打分,59.502n3 改进,已打分,59.503n4 改进,已打分,59.504n5 改进,已打分,59.845终选 · 已提交
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
5052.55557.56001020304050从开始算起的分钟数20261002-204523-search-t2-heart-interp-g24q20261002-204523-search-t2-heart-interp-g24q:0 分钟 48.6820261002-204523-search-t2-heart-interp-g24q:0 分钟 59.5020261002-204523-search-t2-heart-interp-g24q:51 分钟 59.84
全部节点与对话(5)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分48.7—48.748.6通过不到 1 分seed copy_last
n2—种子已打分59.5—59.559.4通过不到 1 分seed mix
n3n2改进已打分59.5+0.059.5—不通过11 分mix + 类型质心位移(T2HI-02):实现并对照后机制在代理上单调有害,提交为关闭状态(=父节点 mix,逐位一致)。
n4n2改进已打分59.5+0.059.559.4通过22 分实现 T2HI-01 类型内配对插值并对照:五个变体在代理上均不优于父 mix,提交为机制关闭(=父节点 mix,逐位一致)。
n5n4改进已打分59.8+0.359.859.6通过13 分T2HI-05:把 mix 的全局 RMS 缩放换成按细胞类型插值型内 RMS 的缩放(提交态只作用于较晚端点),仅改型内空间离散度,表达不动。
资源消耗与失败情况

没有失败节点

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员302 分39,3925,322
工程师3039 分182,49864,120
调研员305 分22,06813,780
审查员306 分63,29418,279
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261002-204523-search-t2-heart-interp-g24q
10-02 20:45 · 自动搜索 · T2:heart:val_interp · G24q
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T2:heart:val_interp
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy;终检 X2;护栏 proxy
状态已结束
开始 / 结束10-02 20:45 / 10-02 21:41
用时56 分 / 预算 1 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。db589274e0080508aa963cf0e77e8f05dd2147ef
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261002-204523-search-t2-heart-interp-g24q/config_source.yaml
配置指纹 309824ae4c8c7b3d
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。fff5118ce91f392b 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-204523-search-t2-heart-interp-g24q/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。e9275e3a9c25ee9e
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:23 个文件,指纹 a426ceccd34c4666
proxy:20 个文件,指纹 5b83f22cc8c89b58
test:19 个文件,指纹 7982bdcbdbe0a565
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261002-204523-search-t2-heart-interp-g24q 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 17 行 · 2026-10-02 · T2:heart:val_interp · 预测文件指纹 e9fa76536b33387e · 官网分 62.9
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告