Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-02 20:29

screen_abcd / A 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n19
本运行目标 62.98(种子 0 单次)
节点?搜索树里的每个候选程序。
22
已打分 21
官网分?官网 P2 返回的真实分数。
52.0
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
67
分析员 19、工程师 20、调研员 20、审查员 8

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测63.0真值 B 半 / 3 个 seed均值
X1终检诊断46.7全部真值 / 1 个 seed单次
X4终检诊断48.0全部真值 / 1 个 seed单次
X5终检诊断45.1全部真值 / 1 个 seed单次
X6终检诊断50.0全部真值 / 1 个 seed单次
proxy诊断记录50.0真值 B 半 / 1 个 seed单次
T1:val官网结果52.0提交预测对应的评分

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n1 种子
seed copy_last
搜索目标分 47.92 · X3 47.92 · 3 次复测均分 48.45
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n4 改进
按细胞型在 PCA(25维,2500HVG) 空间估计两输入阶段均值差,方差收缩后乘时间比逐细胞加到最后阶段非零表达上(clip≥0);单输入退路 copy_last。
搜索目标分 56.16(+8.2) · X3 56.16(+8.2) · 3 次复测均分 56.56
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:两阶段全局均值差被细胞组成变化污染:全局低秩位移(46.83)反而低于父节点 copy_last(47.92)且 de_direction 为负;改成按细胞型配对求差后 de_recovery 43.8→51.0(X3 本地)。
审查意见 通过 1 越界读取:未发现问题。run.py 仅通过 view_io 的 load_manifest/inputs_by_time/read_stage/panel_genes/covered_mask 读视图内输入(run.py:60-83),无绝对路径、无 .. / /mnt / data/raw,未读 external/(X3 manifest 列了 external 但代码未使用)、未读目标阶段文件、无联网。; 2 硬编码目标统计量:
↓
n5 改进
在父节点分型 PCA 均值外推上叠加"形状演化":按细胞型估计各 PC 两阶段方差比,收缩后乘时间比、只允许扩张(r≥1),逐细胞缩放其在 PC 空间偏离型心的残差,使型内分布展宽、共变结构随时间演化。
搜索目标分 58.56(+2.4) · X3 58.56(+2.4) · 3 次复测均分 59.11
分析员结论:在均值外推上叠加'只扩张'的型内方差比缩放(r_t clip 下界 1.0)+ 大放大系数(β=3)能显著改善 cell_state(+10,mmd_u 0.0218→0.0176),说明目标阶段分布比最后输入阶段更展宽,扩张型形状演化直接改善分布匹配。
审查意见 通过 1 越界读取:未发现问题——run.py 只通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes/covered_mask 读取 --data 视图内文件(run.py:31-41,77-100),无绝对路径、..、/mnt、/home、data/raw、downloads、打分器或 src/common/evaluation 引用,无联网。; 2 硬编
↓
n7 改进
低秩形状演化改为各向同性扩张(型内方差加权平均的单一扩张系数,保留加性非零掩码解码),替代父节点的逐 PC 各向异性缩放;PLAN 指定的乘性解码 x·exp(δ/x) 已实现并全扫 β,实测劣于加性,如实报告后不采用。
搜索目标分 59.00(+0.4) · X3 59.00(+0.4) · 3 次复测均分 59.60
分析员结论:在 X3 A 半上,把形状解码从加性+非零掩码换成乘性 x·exp(δ/x)(β=1..5 全扫)后 covariation 为 41.4–46.8、全部 <47(β=0 对照 47.7),且总分峰值 56.95 低于加性 57.33 → 掩码非线性不是 covariation 受损主因,损伤来自展宽本身,换解码形式无用。
↓
n14 改进
在 node 7(iso-add β=3)之上加逐 PC 方差重归一 + PC 子空间部分重投影(blend m=0.3):对被形状化 5 型的预测细胞,把 PC 残差按 (1+c)²·var_obs/var_pred 向目标方差校正,再以 0.3 权重向 25 维 PC 重构收缩,非零掩码 + clip≥0 保持支撑;X3 A 半 seed0/1 = 61.60/61.00(父 57.67/57
搜索目标分 62.60(+3.6) · X3 62.60(+3.6) · 3 次复测均分 62.40
分析员结论:PLAN 的因果假设被证伪:实测 ratio_k=var_pred/var_target 全部 >1(各型 median 1.12–1.48,AVC-CM max 2.98),即 clip/掩码解码后型内 PC 方差低于扩张目标,但纯方差校正(delta 解码,w=0.3→1.0)使 covariation 单调下降 45.2→44.5——把各 PC 方差推向 (1+c)²·var_obs 会放大高序号 PC 的噪声占比,不是 covariation 受损主因。
审查意见 通过 检查1(越界读取): run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 等读取输入,全文无 open()、绝对路径、..、/mnt、/home、data/raw、downloads、联网或对打分器/src.common.evaluation 的访问,未发现越界读取。; 检查2(硬编码目标统计量): 所有数值均为超参(LOWRANK_T
↓
n17 改进
实测 PLAN 两机制均无增益:逐 PC 衰减使垂直收缩趋零而大幅恶化,范围扩展只多 9 细胞;提交改为 β=4 扩张 × m=0.3 blend 交互配置,双种子略优于父节点。
搜索目标分 63.21(+0.6) · X3 63.21(+0.6) · 3 次复测均分 62.98
分析员结论:在 blend 低秩收缩框架下引入逐 PC 指数衰减(decay<1)时,垂直分量权重 m_perp=m·decay^25 趋零(0.02–0.08),而 covariation 的主杠杆恰是垂直分量收缩(基因空间去噪),结果总分从 61.6 掉到 57.8–59.2;即使只衰减 Δz 保留 m_perp(BLEND_PERP=1)仍劣于等权(61.32/60.97 vs 61.60),说明高序号 PC 的方差校正增量也有正贡献。
审查意见 通过 检查1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 读取 args.data 视图内文件(run.py:87-102),无绝对路径、'..'、/mnt、/home、打分器路径,无联网代码。; 检查2 硬编码目标统计量:未发现问题——无任何写死的细胞类型名、比例、细胞数或基因列表;细胞型来自 labels_
↓
n19 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
解耦 blend 为垂直收缩(m_perp)与方差校正(m_var)两独立权重并扫描 9+4 组;实测 m_perp=0.3 仍是峰(提高 m_perp 用 cell_state 换 covariation,净负),提交默认=父节点配置(逐位相同),阴性结果如实报告。
搜索目标分 63.21(+0.0) · X3 63.21(+0.0) · 3 次复测均分 62.98
分析员结论:在 X3 上把 blend 垂直收缩权重 m_perp 从 0.3 提到 0.4/0.5,covariation 单调升 +2.2/+3.8 但 cell_state 降 −1.8/−5.7,总分净负:垂直去噪与低秩收缩在 cell_state 上强耦合,无法独立加强。
审查意见 通过 检查1(越界读取):未发现问题——run.py 仅通过 view_io(load_manifest/read_stage/panel_genes 等)以 args.data 为根读取输入阶段与基因面板(run.py:34-44,87-102),无绝对路径、'..'、/mnt、/home、data/raw、打分器路径,无任何网络访问。; 检查2(硬编码目标统计量):未发现问题——代码中的数值常量均为算法超参数(tau=0.3、alpha=

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,47.921n2 种子,已打分,50.652n3 改进,已打分,50.973n4 改进,已打分,56.164n5 改进,已打分,58.565n6 草稿,生成失败6n7 改进,已打分,59.007n8 改进,已打分,56.688n9 改进,已打分,58.569n10 改进,已打分,59.2710n11 改进,已打分,59.0011n12 改进,已打分,59.5412n13 改进,已打分,59.0113n14 改进,已打分,62.6014n15 草稿,已打分,48.4715n16 改进,已打分,52.0816n17 改进,已打分,63.2117n18 草稿,已打分,47.9618n19 改进,已打分,63.2119n20 改进,已打分,63.2120n21 改进,已打分,47.9621n22 改进,已打分,63.2122终选 · 已提交
已打分?程序正常跑完并拿到分数。生成失败?会话没能产出可用的程序。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
47.55052.55557.56062.50255075100125150175从开始算起的分钟数20261002-202907-search-t1-scr-A20261002-202907-search-t1-scr-A:2 分钟 47.9220261002-202907-search-t1-scr-A:2 分钟 50.6520261002-202907-search-t1-scr-A:22 分钟 50.9720261002-202907-search-t1-scr-A:23 分钟 56.1620261002-202907-search-t1-scr-A:45 分钟 58.5620261002-202907-search-t1-scr-A:66 分钟 59.0020261002-202907-search-t1-scr-A:103 分钟 59.2720261002-202907-search-t1-scr-A:122 分钟 59.5420261002-202907-search-t1-scr-A:151 分钟 62.6020261002-202907-search-t1-scr-A:176 分钟 63.21
全部节点与对话(22)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分47.9—47.948.4通过不到 1 分seed copy_last
n2—种子已打分50.7—50.748.9通过不到 1 分ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
n3n2改进已打分51.0+0.351.049.7通过19 分local_ot:moscot 耦合位移场双侧 kNN(K=100) 平滑后外推;生长重采样与 addnz 解码不变
n4n1改进已打分56.2+8.256.256.6通过20 分按细胞型在 PCA(25维,2500HVG) 空间估计两输入阶段均值差,方差收缩后乘时间比逐细胞加到最后阶段非零表达上(clip≥0);单输入退路 copy_last。
n5n4改进已打分58.6+2.458.659.1通过22 分在父节点分型 PCA 均值外推上叠加"形状演化":按细胞型估计各 PC 两阶段方差比,收缩后乘时间比、只允许扩张(r≥1),逐细胞缩放其在 PC 空间偏离型心的残差,使型内分布展宽、共变结构随时间演化。
n6—草稿生成失败————未审查33 分OT-CFM 最小版:共享 PCA 小速度场 + 阻尼外推,零速度关闭对照
n7n5改进已打分59.0+0.459.059.6未审查19 分低秩形状演化改为各向同性扩张(型内方差加权平均的单一扩张系数,保留加性非零掩码解码),替代父节点的逐 PC 各向异性缩放;PLAN 指定的乘性解码 x·exp(δ/x) 已实现并全扫 β,实测劣于加性,如实报告后不采用。
n8n4改进已打分56.7+0.556.757.2未审查11 分父节点分型 PCA 均值外推上叠加 Ledoit-Wolf 协方差差低秩校正(γ=0.4, k=3):按细胞型取两阶段 25 维 PC 协方差差 D 的前 3 特征方向,对细胞残差加性一步外推,逆投影只加到非零元素上。
n9n5改进已打分58.6+0.058.6—未审查13 分按 PLAN 实现并验证"shape delta 施加到全部 HVG 位置"的解码:零位置的稠密施加使 covariation 单调恶化(45.2→30.6),零阈值扫描确认父节点的非零掩码解码是该轴最优,故按 PLAN 第 4 步回退(默认 LOWRANK_SHAPE_ALLH
n10n7改进已打分59.3+0.359.358.8未审查34 分低秩形状演化改为各向同性扩张(型内方差加权平均的单一扩张系数,保留加性非零掩码解码),替代父节点的逐 PC 各向异性缩放;PLAN 指定的乘性解码 x·exp(δ/x) 已实现并全扫 β,实测劣于加性,如实报告后不采用。
n11n9改进已打分59.0+0.459.059.6未审查24 分形状演化由逐PC各向异性改为各向同性单一扩张系数(型内方差加权、β=3、保留非零掩码解码),采用 node7 已验证机制作提交默认;PLAN 的 top-k PC 选择与相关校正已实现并实测无增益,默认关闭。
n12n7改进已打分59.5+0.559.560.0未审查18 分对被形状化细胞型的 PC 残差做迹保持白化-再着色协方差锚定(Σ_target=(1−w)Σ_pred+wΣ_obs,w=0.1),并把各向同性扩张系数 β 提到 4 以补偿 cell_state;w=0 时精确复现父节点。
n13n11改进已打分59.0+0.059.059.6未审查19 分在父节点(ISO β=3)之上加 PC 空间型内协方差校正块(COVAR_FIX2):对 5 个 shaped 类型用 last 阶段型内协方差做白化-再着色,默认提交配置为相关结构校正(MODE=1, W=1.0,保各 PC 方差);实测 covariation 组对该机制不敏
n14n7改进已打分62.6+3.662.662.4通过29 分在 node 7(iso-add β=3)之上加逐 PC 方差重归一 + PC 子空间部分重投影(blend m=0.3):对被形状化 5 型的预测细胞,把 PC 残差按 (1+c)²·var_obs/var_pred 向目标方差校正,再以 0.3 权重向 25 维 PC 重构收
n15—草稿已打分48.5—48.5—未审查24 分VAE(2500 HVG, latent15) 学两输入阶段配对细胞型的 latent 位移 δ(z)=Wz+b(ridge λ=1),按时间比外推 z,用解码器差值 dec(z_pred)−dec(z_last) 加到最后阶段非零 HVG 上(w=0.5)。
n16n15改进已打分52.1+3.652.1—未审查27 分VAE(latent20) 上用同型 kNN 细胞级配对拟合位置依赖位移场 δ(z)=Wz+b(型内/型间 sd 比 0.98,父节点 0.08),再用 ridge 把 δ 校准到实测型级伪批量差的线性读出 G,按时间比外推、只加到最后阶段非零 HVG 位点(w=1.5)。
n17n14改进已打分63.2+0.663.263.0通过23 分实测 PLAN 两机制均无增益:逐 PC 衰减使垂直收缩趋零而大幅恶化,范围扩展只多 9 细胞;提交改为 β=4 扩张 × m=0.3 blend 交互配置,双种子略优于父节点。
n18—草稿已打分48.0—48.0—未审查29 分manifold_ode:25维PCA潜空间里训练小型非自治MLP速度场v(z,t)(Sinkhorn分布匹配+kNN流形约束),从最后输入阶段阻尼外推(γ)到目标,解码时潜空间位移只加到原细胞非零HVG位置。
n19n17改进已打分63.2+0.063.263.0通过14 分解耦 blend 为垂直收缩(m_perp)与方差校正(m_var)两独立权重并扫描 9+4 组;实测 m_perp=0.3 仍是峰(提高 m_perp 用 cell_state 换 covariation,净负),提交默认=父节点配置(逐位相同),阴性结果如实报告。
n20n19改进已打分63.2+0.063.263.0通过15 分实现按型置信度收缩(c_t=n/(n+κ) 向全局位移收缩)与 SE 裁剪两个机制;X3 实测两者均单调降低总分与 direction,任何对型级位移幅度的衰减都有害,提交默认=父配置(逐位相同),阴性结果如实报告。
n21n18改进已打分48.0+0.048.0—未审查26 分manifold_ode 改进:外推积分每个 RK4 子步后向 E9.5 观测潜流形做 kNN(K=5) 锚定投影(blend α);实测 α>0 均不涨分且 α≥0.3 显著变差,提交默认 α=0(逐位复现父节点 node 18),阴性结果如实报告。
n22n20改进已打分63.2+0.063.263.0通过14 分实测 PLAN 置信度放大机制(α_t=α(1+γc_t))与两个补充机制均单调劣于父:γ=0.5→59.53、保范数方向正则 w=0.5/1.0→60.61/59.81、全局 α=2.0/1.6→61.57/62.00(父 α=1.8→62.06),位移幅度与方向均为两侧最优,
资源消耗与失败情况

生成失败 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员19015 分242,36143,194
工程师2026 小时 5 分1,153,324427,797
调研员20052 分300,953125,768
审查员809 分170,52224,485
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261002-202907-search-t1-scr-A
10-02 20:29 · 自动搜索 · T1:val · screen_abcd · A 组 · scr
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3;终检 X1、X6、X4、X5;护栏 X3;诊断 proxy
状态已结束
开始 / 结束10-02 20:29 / 10-03 00:32
用时4 小时 3 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。ef9306882c5ce000b0d66dd6ac17a37c661c7ec5
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261002-202907-search-t1-scr-A/config_source.yaml
配置指纹 4a0a53e98113ea2c
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。c599c6848b218e45 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-202907-search-t1-scr-A/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。fb88301e4aba02c2
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:120 个文件,指纹 105881b1e7c248f9
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261002-202907-search-t1-scr-A 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 25 行 · 2026-10-02 · T1:val · 预测文件指纹 487845827f6d1f6c · 官网分 52.0
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告