Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-03 09:34

t1_round2 / D 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n25
本运行目标 58.64(种子 0 单次)
节点?搜索树里的每个候选程序。
25
已打分 20
官网分?官网 P2 返回的真实分数。
50.1
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
68
分析员 17、工程师 16、调研员 16、审查员 5、tune 14

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测58.6真值 B 半 / 3 个 seed均值
proxy10搜索目标复测58.7真值 B 半 / 3 个 seed均值
X1终检诊断36.3全部真值 / 1 个 seed单次
X4终检诊断43.8全部真值 / 1 个 seed单次
X5终检诊断42.5全部真值 / 1 个 seed单次
X6终检诊断47.0全部真值 / 1 个 seed单次
proxy诊断记录55.0真值 B 半 / 1 个 seed单次
T1:val官网结果50.1提交预测对应的评分

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n19 草稿
growth_dynamics 最小版:两输入阶段做非平衡 Sinkhorn OT,取逐细胞生长权重 g_i(源边际失衡)驱动重采样 + 重心速度 α 外推(残差解码回真实细胞,稀疏门控);单输入退路为 copy_last。
搜索目标分 48.94 · X3 47.03 · proxy10 52.75
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在只有单输入阶段的视图上退路为 copy_last,会直接丢掉父节点在该视图已有的全部收益(本例 proxy10 -10.92,占总跌幅主体);新方法必须继承或重实现父节点的单输入路径,而不是退回基线。
↓
n22 改进
growth_dynamics v2 — METHOD
搜索目标分 58.19(+9.3) · X3 57.73(+10.7) · proxy10 59.13(+6.4) · 3 次复测均分 58.16
分析员结论:X3 上 growth-on 58.90 vs growth-off 57.69 只差 +1.21(噪声内),而两者都比父节点 47.03 高约 11 分:约 11 分里只有约 1 分可归于 OT 生长权重,收益主体是组成趋势外推(T=1.5、ratio clip 0.2–5、平滑 s=3)与门控型级位移。判断机制贡献必须用 on/off 对照减去公共部分,不能拿总增幅归因。
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/panel_genes/inputs_by_time(include_external=True)/read_stage/write_prediction 读写数据(run.py:34,140-154,339),external 均在 view_manifest_X3.json 声明内;无绝对路径、'.
↓
n25 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
growth_dynamics v3 — METHOD
搜索目标分 58.67(+0.5) · X3 58.44(+0.7) · proxy10 59.13(+0.0) · 3 次复测均分 58.64
分析员结论:在 X3(0.5 天间隔、两输入)上,把每型一个共享 delta 向量按细胞 z 逐细胞缩放幅度,不改变基因间共变结构:variogram 原始值 0.001508→0.00153(得分 -0.08),"状态调制能改善 covariation"的假设被否证——调制只改幅度分布,方向仍是同一个向量。
审查意见 通过 1 越界读取:未发现问题。run.py 只经 view_io(load_manifest/read_stage/inputs_by_time 等)读取 manifest['inputs'] 与 manifest['external'] 内的视图文件(run.py:145-159),无绝对路径、'..'、/mnt、/home、data/raw、打分器或 evaluation 路径,无联网;src.task1_temporal.view_i

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,49.531n2 种子,已打分,50.332n3 种子,已打分,53.693n4 调参,没有改动4n5 改进,已打分,52.825n6 草稿,已打分,47.666n7 改进,已打分,56.237n8 草稿,已打分,48.758n9 调参,没有改动9n10 改进,已打分,53.4910n11 草稿,已打分,47.8611n12 改进,已打分,50.2612n13 改进,已打分,53.6113n14 调参,没有改动14n15 草稿,已打分,49.5515n16 调参,已打分,54.9116n17 调参,没有改动17n18 草稿,已打分,49.5318n19 草稿,已打分,48.9419n20 改进,已打分,55.4220n21 草稿,已打分,50.3221n22 改进,已打分,58.1922n23 改进,已打分,55.1823n24 调参,没有改动24n25 改进,已打分,58.6725终选 · 已提交
已打分?程序正常跑完并拿到分数。没有改动?这次会话没有对代码做任何修改。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
5052545658050100150200从开始算起的分钟数20261003-093415-search-t1-r2-D-s120261003-093415-search-t1-r2-D-s1:4 分钟 49.5320261003-093415-search-t1-r2-D-s1:4 分钟 50.3320261003-093415-search-t1-r2-D-s1:6 分钟 53.6920261003-093415-search-t1-r2-D-s1:54 分钟 56.2320261003-093415-search-t1-r2-D-s1:210 分钟 58.1920261003-093415-search-t1-r2-D-s1:234 分钟 58.67
全部节点与对话(25)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。proxy103 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分49.5—47.952.749.7通过不到 1 分seed copy_last
n2—种子已打分50.3—50.749.749.0通过不到 1 分ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
n3—种子已打分53.7—48.763.753.9通过2 分composition_trend — type-level composition reweighting + within-type maturity selection
n4n3调参没有改动—————未审查14 分—
n5n2改进已打分52.8+2.552.852.951.4未审查20 分OT 位移解码改为投影到前 22 个 PCA 程序方向(α=1,无基因激活),单输入阶段回退改为均匀复制(去掉生长重采样)。
n6—草稿已打分47.7—45.751.548.2未审查14 分Palantir伪时间+CellRank hard前向转移,逐细胞按概率抽样后继(可多步随机游走)作为E目标预测;对照(--off)为恒等转移即复制输入。
n7n3改进已打分56.2+2.552.264.356.4通过27 分composition_trend + 型内表达程序(λ=0.15 单输入退路)+ 两阶段按型位移外推(β=1.0,≥2 输入时)
n8—草稿已打分48.8—46.852.7—未审查38 分高斯VAE潜空间+跨阶段1-NN耦合训练CFM位移场,从末阶段潜位置外推T=(Δt目标/Δt训练)步,残差=dec(z_pred)−dec(z)加回输入(软零门、±2截断、范数截断1.5×耦合中位数),λ=0.5阻尼;单输入阶段回退为均匀复制。
n9n7调参没有改动—————未审查18 分—
n10n6改进已打分53.5+5.854.152.252.9未审查14 分graph_fate v2: stage-constrained successor selection + two-stage type-frequency trend reweighting
n11—草稿已打分47.9—45.452.7—未审查23 分manifold_ode:PCA(25维,HVG2500)潜空间非自治神经ODE,Sinkhorn拟合相邻输入阶段,kNN流形惩罚,单步阻尼外推(α=0.3)+残差解码;单输入阶段回退为末阶段均匀复制。
n12n8改进已打分50.3+1.545.759.350.7未审查35 分VAE潜空间1-NN耦合→基因空间k=5潜距加权位移(去掉CFM与神经解码器,λ=0.35、gate=0.05、×T外推、VAE固定60 epochs);单输入退路=组成重加权(src reweight心/边权重, Neural Tube剔除)。
n13n11改进已打分53.6+5.850.360.254.0未审查28 分manifold_ode v2:ODE 速度范数只做型内细胞选择(不再位移表达),叠加两阶段类型频率趋势重加权;单输入退路=心脏解剖组成先验重加权+型内增殖程序(λ=0.15)。
n14n7调参没有改动—————未审查15 分—
n15—草稿已打分49.5—47.952.8—未审查17 分METHOD
n16n13调参已打分54.9+1.352.360.254.8通过10 分tune of #13: T clip from 2.0 to 1.5 (more conservative composition extrapolation), smoothing s from 5.0 to 3.0 (sharper frequency trend), to
n17n10调参没有改动—————未审查5 分—
n18—草稿已打分49.5—47.952.7—未审查21 分CollecTRI+ULM 调控程序族:两阶段按细胞类型估 TF 活性差并经签名调控网解码回表达;X3 上解码不敌其乱网对照,故默认 λ=0(机制关闭,≈copy_last),负结果如实上报。
n19—草稿已打分48.9—47.052.7—未审查29 分growth_dynamics 最小版:两输入阶段做非平衡 Sinkhorn OT,取逐细胞生长权重 g_i(源边际失衡)驱动重采样 + 重心速度 α 外推(残差解码回真实细胞,稀疏门控);单输入退路为 copy_last。
n20n16改进已打分55.4+0.553.060.255.5通过21 分manifold_ode v3:两输入路径把 ODE 场从 t=1 多步 Euler 积分 T_int=min(T_raw,1.5),每步 kNN(k=8) 流形回投(λ_p=0.5),终点投影到末阶段最近真实细胞作为输出(只改选谁,不位移表达);单输入路径逐位继承父节点 16。
n21—草稿已打分50.3—49.053.0—未审查27 分lowrank_shape 最小实现:Ledoit-Wolf 型内协方差低秩外推仿射变形;X3 上开/关对照显示机制单调有害(cell_state、covariation 齐降),故默认 α=0(关闭),负结果如实上报。
n22n19改进已打分58.2+9.357.759.158.2通过17 分growth_dynamics v2 — METHOD
n23n21改进已打分55.2+4.952.560.654.6未审查19 分lowrank_shape v2:协方差方向引导的型内细胞选择(不改表达)叠加组成基线(两阶段频率趋势外推 / 单输入心脏解剖先验),只改变哪些细胞被输出。
n24n22调参没有改动—————未审查3 分—
n25n22改进已打分58.7+0.558.459.158.6通过18 分growth_dynamics v3 — METHOD
资源消耗与失败情况

没有改动 5

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员17019 分290,10660,981
工程师1624 小时 54 分934,581361,720
调研员16038 分245,17088,415
审查员506 分116,67319,176
tune1408 分123,16022,133
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261003-093415-search-t1-r2-D-s1
10-03 09:34 · 自动搜索 · T1:val · t1_round2 · D 组 · r2-s1
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3×2 + proxy10×1;终检 X1、X4、X5、X6;护栏 objective;诊断 proxy
状态已结束
开始 / 结束10-03 09:34 / 10-03 13:49
用时4 小时 15 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。659a312f976e24cbff26537f513684c07241768d
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s1/config_source.yaml
配置指纹 e1d618283ba3de86
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。ce9da3f56e26c7ab 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s1/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。5a6042c362b04ecb
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:120 个文件,指纹 177fd975f0e38e54
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s1 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 46 行 · 2026-10-03 · T1:val · 预测文件指纹 3a8da7e247749fb2 · 官网分 50.1
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告