Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-01 00:42

G6 验收(首批 Spark 运行)

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n4
本运行目标 57.51(种子 0 单次)
节点?搜索树里的每个候选程序。
6
已打分 6
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
13
分析员 3、工程师 3、调研员 4、审查员 3

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X1终检诊断53.8全部真值 / 1 个 seed单次
proxy节点单次评分57.4真值范围未记录 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子
seed heart_jcf_peri
搜索目标分 55.97 · proxy 55.97
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n4 改进 终选程序
父组成 heart_reweight 不变,叠加"按类型沿单快照增殖分化轴的稀疏保形平移"(β=0.3):每类型 d_c=低增殖三分位均值−高增殖三分位均值(早→晚),只对该细胞已非零基因做 clip(x+β·d_c,0),保留稀疏模式护住 covariation。
搜索目标分 57.39(+1.4) · proxy 57.39(+1.4) · 3 次复测均分 57.51
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在只有单输入阶段的 proxy 上,对已重加权组成的输出叠加"逐类型沿增殖三分位差的小步 log 空间位移"(β≈0.3),榜分 +1.42、主要落在 cell_state(+3.66),而目标组 de_recovery 反而 -1.06:单快照增殖轴改善的是细胞分布贴近度,不是 DE 方向精度。
审查意见 通过 1 越界读取:未发现问题——run.py 只经 view_io 的 load_manifest/read_stage/panel_genes 读 manifest 给定的输入(run.py:130-132),无绝对路径、'..'、/mnt、网络访问;导入的 src.task1_temporal.reweight 是任务框架模块而非打分器或 src/common/evaluation。; 2 硬编码目标统计量:未发现问题——代码里没有细胞

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,49.771n2 种子,已打分,55.972n3 种子,已打分,49.773n4 改进,已打分,57.394n5 改进,已打分,57.615n6 改进,已打分,57.616终选
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
5052545658010203040506070从开始算起的分钟数20261001-004247-search-t1-spark20261001-004247-search-t1-spark:1 分钟 49.7720261001-004247-search-t1-spark:1 分钟 55.9720261001-004247-search-t1-spark:40 分钟 57.3920261001-004247-search-t1-spark:73 分钟 57.61
全部节点与对话(6)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分49.8—49.8—通过1 分seed copy_last
n2—种子已打分56.0—56.0—通过1 分seed heart_jcf_peri
n3—种子已打分49.8—49.8—通过1 分seed pseudobulk_shift
n4n2改进已打分57.4+1.457.457.5通过37 分父组成 heart_reweight 不变,叠加"按类型沿单快照增殖分化轴的稀疏保形平移"(β=0.3):每类型 d_c=低增殖三分位均值−高增殖三分位均值(早→晚),只对该细胞已非零基因做 clip(x+β·d_c,0),保留稀疏模式护住 covariation。
n5n4改进已打分57.6+0.257.657.4通过32 分父组成/抽样 RNG 不变,逐类型方向 d_c 改为按 t=d/se 可靠性收缩并重标定幅度,并把输出细胞数 4000→3000(de_recovery 52.0→52.53、cell_state 60.6→61.4)。
n6n5改进已打分57.6+0.057.657.4通过39 分交付父等价配置(FILL_CAP=0,逐位复现 node5,proxy 57.6112);新增并实测了「检出率曲线解锁稀疏模式」机制:给强上调基因补少量非零,de_score 完全不动,仅 cell_state +1.28 / covariation −1.10 / 榜分 +0.
资源消耗与失败情况

没有失败节点

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员302 分43,4216,239
工程师311 小时 8 分157,67561,138
调研员4132 分120,77352,245
审查员304 分53,3138,295
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261001-004247-search-t1-spark
10-01 00:42 · 自动搜索 · T1:val · G6 验收(首批 Spark 运行)
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy;终检 X1
状态已结束
开始 / 结束10-01 00:42 / 10-01 02:49
用时2 小时 6 分 / 预算 4 小时
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo
目的?这次运行为了回答什么问题,写在配置文件里。[回填] G6 acceptance 4: real search on the DGX Spark, opencode + qwen3.8-max (Token Plan), 3 seeds + 3 nodes, one node at a time, Engineer thinking budget 4096 (note 10 §4.7).

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。d3bd71c64308aeefb5d059545a832d2babe8a591 代码有未提交改动
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件agent/configs/search_t1_spark.yaml
配置指纹 94fa710f222cdb95
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。ce2f80961136fbec 锁定格式 v5
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本)
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max
工程师:alibaba-token-plan-cn/qwen3.8-max
调研员:alibaba-token-plan-cn/qwen3.8-max
审查员:alibaba-token-plan-cn/qwen3.8-max
运行目录/home/spark-longxinyang/vec/2026_virtual_embryo/agent/runs/20261001-004247-search-t1-spark 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告