Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-02 20:29

screen_abcd / B 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n14
本运行目标 60.51(种子 0 单次)
节点?搜索树里的每个候选程序。
20
已打分 19
官网分?官网 P2 返回的真实分数。
49.5
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
61
分析员 17、工程师 18、调研员 18、审查员 8

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测60.5真值 B 半 / 3 个 seed均值
X1终检诊断52.2全部真值 / 1 个 seed单次
X4终检诊断44.4全部真值 / 1 个 seed单次
X5终检诊断38.6全部真值 / 1 个 seed单次
X6终检诊断32.3全部真值 / 1 个 seed单次
proxy诊断记录46.8真值 B 半 / 1 个 seed单次
T1:val官网结果49.5提交预测对应的评分

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子
ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
搜索目标分 50.65 · X3 50.65 · 3 次复测均分 48.87
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n11 改进
local_ot: PCA 空间逐细胞位移 + 残差保留解码(moscot 耦合),λ=3、kNN=30、addnz
搜索目标分 62.24(+11.6) · X3 62.24(+11.6) · 3 次复测均分 60.51
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 PCA 耦合空间做逐细胞位移外推(重心祖先 vs kNN 平滑),λ≈3 时 cell_state 可从 ~50 提到 ~90,而基因空间同样外推(父节点 λ=1)只有 ~50:位移必须在低维耦合空间里算。
审查意见 通过 1 越界读取:未发现问题——run.py/g37_common.py 仅通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 读视图内数据(run.py:42,74-76),无绝对路径、'..'、/mnt、data/raw、评分器或 src/common/evaluation 访问,无联网代码(grep 全源码无 open/np.load/urllib/
↓
n14 改进 终选程序提交的节点?官网提交用的预测文件来自这个节点(运行的终选程序)。
local_ot 逐PC自适应收缩位移(ANOVA shrinkage):全部 γ/归一化变体显著劣于父节点,默认提交父节点等价配置(γ=0),阴性结果如实报告
搜索目标分 62.24(+0.0) · X3 62.24(+0.0) · 3 次复测均分 60.51
分析员结论:在两输入阶段仅差 ~0.25 天的数据上,ANOVA 式逐 PC 信噪比收缩(Vb/(Vb+γ·Vw))中 Vb 天然趋零(γ=0.5 时 raw shrink 中位 0.035),任何 γ>0 都等效于全局砍 λ,cell_state 从 89 崩到 ~55,de_recovery 只回收 ~1.5 分——用阶段间均值差估计 PC 级 SNR 在短时间间隔下不可行。
审查意见 通过 1 越界读取:未发现问题——所有数据访问经 src.task1_temporal.view_io(load_manifest/read_stage/panel_genes,run.py:47、g37_common.py:16),无绝对路径、'..'、/mnt、/home、下载或打分器路径;grep 无 open/np.load/requests/h5py 命中。; 2 硬编码目标统计量:未发现问题——run.py:49-62 仅为超参(

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,47.921n2 种子,已打分,50.652n3 改进,已打分,49.423n4 改进,已打分,52.374n5 改进,已打分,48.035n6 草稿,已打分,50.666n7 改进,已打分,50.667n8 改进,已打分,62.248n9 改进,已打分,54.379n10 改进,已打分,56.2810n11 改进,已打分,62.2411n12 改进,已打分,54.3712n13 改进,已打分,49.4213n14 改进,已打分,62.2414n15 草稿,生成失败15n16 改进,已打分,54.3716n17 改进,已打分,57.1117n18 草稿,已打分,47.5618n19 改进,已打分,52.7819n20 改进,已打分,50.2820终选 · 已提交
已打分?程序正常跑完并拿到分数。生成失败?会话没能产出可用的程序。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
47.55052.55557.56062.5010203040506070从开始算起的分钟数20261002-202908-search-t1-scr-B20261002-202908-search-t1-scr-B:2 分钟 47.9220261002-202908-search-t1-scr-B:2 分钟 50.6520261002-202908-search-t1-scr-B:19 分钟 52.3720261002-202908-search-t1-scr-B:74 分钟 62.24
全部节点与对话(20)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分47.9—47.948.4通过不到 1 分seed copy_last
n2—种子已打分50.7—50.748.9通过不到 1 分ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation
n3n1改进已打分49.4+1.549.450.0通过14 分双阶段 KMeans 簇配对 + 经验贝叶斯收缩逐簇漂移(仅 HVG、只作用于非零表达项),α=2.0,单输入时退化为 copy_last。
n4n2改进已打分52.4+1.752.450.4通过17 分local_ot: top-k 祖先截断 + 逐细胞位移收缩(λ_base=0.75)
n5n1改进已打分48.0+0.148.0—未审查33 分低秩投影逐簇Delta外推:双阶段KMeans簇配对,簇间伪批量差投影到目标簇自身前15个PC并乘α=2.0,仅加到非零表达项,单输入或α=0时逐比特退化为copy_last。
n6—草稿已打分50.7—50.751.2通过30 分ot_cfm 族:whiten-PCA(25) 上 minibatch 精确 OT 配对训练 MLP 速度场,自最后输入阻尼 Euler 外推(α=0.65、t 钳 1),PCA 逆变换+逐细胞残差解码;单输入退化为 copy_last。
n7n6改进已打分50.7+0.050.7—未审查17 分ot_cfm 位移结构滤波搜索(逐PC分层阻尼×9、平滑指数×2、kNN平滑×2)全部不优于中性滤波,默认提交父节点等价配置并报告阴性结果。
n8n2改进已打分62.2+11.662.260.5通过20 分local_ot: 耦合 PCA 空间祖先重心 + 解码放大位移(λ=3.0, ε=1e-3),位移仅沿耦合拟合的 30 维方向
n9n7改进已打分54.4+3.754.453.5未审查24 分ot_cfm 潜空间容量与外推强度重调:PCA 25→60、α 0.65→0.85(X3 A 半 50.29→53.46);PLAN 零掩码软化搜索后证实有害,默认关闭。
n10n1改进已打分56.3+8.456.355.3通过24 分OT 耦合 PCA 空间逐细胞位移(top-k 祖先重心)+ 逆变换解码回基因空间,λ=5、ε=1e-3、30 维、仅作用于非零项,单输入或 λ=0 逐比特退化为 copy_last。
n11n2改进已打分62.2+11.662.260.5通过21 分local_ot: PCA 空间逐细胞位移 + 残差保留解码(moscot 耦合),λ=3、kNN=30、addnz
n12n9改进已打分54.4+0.054.4—未审查25 分ot_cfm 训练端正则化搜索:OT 配对目标加噪(熵正则)、steps=800、HVG=2000 全部阴性且单调变差,提交父节点等价默认(pair_sigma=0、steps=1500、dim60、α0.85),关闭对照逐比特一致。
n13n3改进已打分49.4+0.049.4—未审查29 分阴性结果:PLAN 的 PCA 空间逐簇漂移(低秩解码回基因空间)cov +1.7 但 cell_state −2.9,总分全不优于父节点基因空间漂移,提交父节点等价配置。
n14n11改进已打分62.2+0.062.260.5通过20 分local_ot 逐PC自适应收缩位移(ANOVA shrinkage):全部 γ/归一化变体显著劣于父节点,默认提交父节点等价配置(γ=0),阴性结果如实报告
n15—草稿生成失败————未审查31 分generative_latent draft: 小型高斯 VAE + 潜空间 OT 位移 + 生成式解码
n16n12改进已打分54.4+0.054.4—未审查33 分ot_cfm 与 moscot 耦合速度凸组合搜索:原始/幅度匹配/逐步步长保持三种混合共 4 个变体全部低于父节点(covariation 与 cell_state 此消彼长),阴性结果,默认提交父节点等价配置(--moscot-w 0,逐比特一致)。
n17n10改进已打分57.1+0.857.156.2通过29 分METHOD
n18—草稿已打分47.6—47.6—未审查33 分manifold_ode: PCA 潜空间神经 ODE + Sinkhorn 分布匹配 + kNN 流形惩罚
n19n4改进已打分52.8+0.452.8—未审查19 分local_ot: 位移幅度秩归一化逐细胞收缩(替代退化的耦合熵信号),λ_base 补偿至 1.0
n20n18改进已打分50.3+2.750.3—未审查20 分manifold_ode v2: OT 耦合逐细胞重心位移作速度回归目标,推理位移由耦合方向锚定(α=2.0),Sinkhorn/kNN 流形项降为辅助
资源消耗与失败情况

生成失败 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员17013 分201,03137,169
工程师1836 小时 12 分1,009,643365,701
调研员18048 分240,655110,425
审查员8011 分164,04330,071
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261002-202908-search-t1-scr-B
10-02 20:29 · 自动搜索 · T1:val · screen_abcd · B 组 · scr
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3;终检 X1、X6、X4、X5;护栏 X3;诊断 proxy
状态已结束
开始 / 结束10-02 20:29 / 10-03 00:43
用时4 小时 14 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。ef9306882c5ce000b0d66dd6ac17a37c661c7ec5
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-B/config_source.yaml
配置指纹 521db0cf3c82b4b4
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。d56c0200bc957bad 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-B/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。fb88301e4aba02c2
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:120 个文件,指纹 a2f6cffa5df8366a
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261002-202908-search-t1-scr-B 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 26 行 · 2026-10-02 · T1:val · 预测文件指纹 2b0ca86d0ecab62a · 官网分 49.5
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告