Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-03 15:38

运行链 / D 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n6
本运行目标 54.31(种子 0 单次)
节点?搜索树里的每个候选程序。
7
已打分 6
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
15
分析员 4、工程师 4、调研员 4、审查员 3

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测55.1真值 B 半 / 3 个 seed均值
proxy10搜索目标复测52.7真值 B 半 / 3 个 seed均值
X1终检诊断49.9全部真值 / 1 个 seed单次
X4终检诊断44.8全部真值 / 1 个 seed单次
X5终检诊断39.9全部真值 / 1 个 seed单次
X6终检诊断35.5全部真值 / 1 个 seed单次
proxy诊断记录50.9真值 B 半 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子
ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
搜索目标分 50.33 · X3 50.65 · proxy10 49.67 · 3 次复测均分 48.98
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n5 改进
OT 全细胞耦合的精确祖先位移:投到 30 个输入 PCA 程序模块并阻尼 λ=3 外推,再叠加 0.5×原始全基因位移,addnz 解码,均匀抽样输出,关闭生长重采样。
搜索目标分 54.53(+4.2) · X3 55.32(+4.7) · proxy10 52.94(+3.3) · 3 次复测均分 54.31
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:两输入视图上,OT 精确祖先位移投影到输入 PCA 模块后放大外推(λ=3),可在 X3 上把 mmd_u 从 0.0328 降到 0.0208(+5.35 分)。但它几乎不改善 DE 两项,X3 的 de_score 还降到地板以下。这类位移外推应当作 cell_state 杠杆,不应当作 DE 杠杆。
审查意见 通过 1 越界读取:未发现问题。run.py 和 g37_common.py 的所有读取都经过 view_io 的 load_manifest、panel_genes、read_stage、covered_mask 完成。stage_pair 中 inputs_by_time(include_external=True) 只读取 manifest 里列出的 external 条目(X3 的 qiu2024_heart_early E8.75
↓
n6 改进 终选程序
NO_CHANGE: 校准 addnz 解码(逐基因均值变化对齐 OT 意图位移)——X3 上 5 种解码/幅度组合全部低于父节点
搜索目标分 54.53(+0.0) · X3 55.32(+0.0) · proxy10 52.94(+0.0) · 3 次复测均分 54.31
分析员结论:在两输入 local_ot 位移管线里,把 addnz 解码校准成“实现的逐基因均值变化 ≈ OT 意图 D_g”,确实提高了 spearman(dp, D*)(0.417→0.664,Engineer 自报的诊断),但 X3 A 半 seed 0 上 DE 两项没有上升:de_score raw -0.100→-0.129,de_direction 0.018→0.016;mmd_u 降 0.38 分,variogram 降 0.95 分,榜分 54.94→53.39。说明 OT 意图的基因级方向不含 DE 信息,校准只是把噪声放大。
审查意见 通过 1 未发现问题:run.py 和 g37_common.py 只通过 view_io(load_manifest、panel_genes、stage_pair→inputs_by_time/read_stage/covered_mask)读取视图内的数据,没有绝对路径、`..`、/mnt、/home、data/raw、downloads 或评分器路径,也没有联网。增殖和凋亡基因表来自 moscot.utils.data 的库内标记表,不

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,49.531n2 种子,已打分,50.332n3 种子,已打分,53.693n4 改进,已打分,53.714n5 改进,已打分,54.535n6 改进,已打分,54.536n7 草稿,程序报错7终选
已打分?程序正常跑完并拿到分数。程序报错?候选程序运行时出错。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
50515253540102030405060从开始算起的分钟数20261003-153851-search-t1-D-smoke2h20261003-153851-search-t1-D-smoke2h:2 分钟 49.5320261003-153851-search-t1-D-smoke2h:3 分钟 50.3320261003-153851-search-t1-D-smoke2h:5 分钟 53.6920261003-153851-search-t1-D-smoke2h:61 分钟 54.53
全部节点与对话(7)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。proxy103 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分49.5—47.952.749.7通过不到 1 分seed copy_last
n2—种子已打分50.3—50.749.749.0通过不到 1 分ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
n3—种子已打分53.7—48.763.753.9通过2 分composition_trend — type-level composition reweighting + within-type maturity selection
n4n3改进已打分53.7+0.048.763.753.7不通过1 小时 1 分composition_program:组成层(收缩信号 + TV 预算)与型内成熟选择分层,wsum 耦合配额
n5n2改进已打分54.5+4.255.352.954.3通过56 分OT 全细胞耦合的精确祖先位移:投到 30 个输入 PCA 程序模块并阻尼 λ=3 外推,再叠加 0.5×原始全基因位移,addnz 解码,均匀抽样输出,关闭生长重采样。
n6n5改进已打分54.5+0.055.352.954.3通过20 分NO_CHANGE: 校准 addnz 解码(逐基因均值变化对齐 OT 意图位移)——X3 上 5 种解码/幅度组合全部低于父节点
n7—草稿程序报错———52.7—未审查24 分OT-CFM 最小版:两输入视图在共享 30 维 PCA 上用 minibatch 精确 OT 配对训练条件流匹配速度场 v(z,t=1),从最新阶段的输出细胞按阻尼步长 τ=α·r 做 Euler 前推,位移解码回 HVG 并加到细胞自己的表达上;单输入视图退化为均匀抽样照抄。
资源消耗与失败情况

程序报错 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员402 分811,857
工程师412 小时 18 分419,849177,888
调研员404 分823,006
审查员301 分66,720
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261003-153851-search-t1-D-smoke2h
10-03 15:38 · 自动搜索 · T1:val · 运行链 · D 组 · smoke2h
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索 测试
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3×2 + proxy10×1;终检 X1、X4、X5、X6;护栏 objective;诊断 proxy
状态已结束
开始 / 结束10-03 15:38 / 10-03 17:18
用时1 小时 39 分 / 预算 2 小时
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。bc1f100a4d3d9e4d4e1ee7eb6f5c2826c75710db
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/test/20261003-153851-search-t1-D-smoke2h/config_source.yaml
配置指纹 a3b8dbc120a76cf8
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。5a6d33ed8818b32e 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/test/20261003-153851-search-t1-D-smoke2h/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。4bbe6ef8651d6f32
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:120 个文件,指纹 74b4ffa4a49d2070
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
compliance:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
data:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
审查员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
运行目录/home/spark-longxinyang/vec/runs/test/20261003-153851-search-t1-D-smoke2h 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告