Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-01 11:44

G18 验收(接续搜索)

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n8
本运行目标 58.13(种子 0 单次)
节点?搜索树里的每个候选程序。
12
已打分 12
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
12
分析员 4、工程师 3、调研员 3、审查员 2

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X1终检诊断48.1全部真值 / 1 个 seed单次
proxy节点单次评分57.9真值范围未记录 / 1 个 seed单次
proxy2节点单次评分57.9真值范围未记录 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子 导入自 20261001-032558-search-t1-spark-c3#2
seed heart_jcf_peri
搜索目标分 55.97 · proxy 55.97 · proxy2 55.97 · 3 次复测均分 56.06
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n8 改进 终选程序导入自 20261001-032558-search-t1-spark-c3#8
冻结父本类型配额,类内按增殖打分做成熟端加权无放回抽样(θ=0.5,E-S 算法),3-seed 均值 56.06→58.13。
搜索目标分 57.89(+1.9) · proxy 57.89(+1.9) · proxy2 57.89(+1.9) · 3 次复测均分 58.13
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在类型配额逐位冻结的前提下,只改『类内选谁』这一自由度即可提升榜分:E2F 增殖打分反向加权(选成熟端)θ=+0.5 使 cell_state +4.54(超噪声)、榜分 +1.92(单 seed 在噪声边缘),且 covariation 不受伤——证明『选真实细胞的子集』类方法不会触发位移类方法的均值塌缩。
审查意见 通过 1 越界读取:未发现问题。唯一的文件读取是 mature.py:29-48 从 manifest['prior'] 的相对路径拼 Path(view) 读 msigdb GMT,属视图内 prior;无绝对路径/..//mnt/downloads/打分器路径,无网络调用(grep 全源码无 urllib/requests/socket)。; 2 硬编码目标统计量:未发现问题。类型权重 heart=1.6/edge=0.25 是规则型家族

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,49.771n2 种子,已打分,55.972n3 种子,已打分,49.773n4 改进,已打分,55.974n5 改进,已打分,53.035n6 改进,已打分,51.586n7 改进,已打分,54.437n8 改进,已打分,57.898n9 改进,已打分,57.929n10 改进,已打分,58.0310n11 改进,已打分,57.8911n12 改进,已打分,57.7612终选
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
5656.55757.55805101520253035从开始算起的分钟数20261001-114429-search-t1-g18-continue20261001-114429-search-t1-g18-continue:0 分钟 55.9720261001-114429-search-t1-g18-continue:0 分钟 57.9220261001-114429-search-t1-g18-continue:37 分钟 58.03
全部节点与对话(12)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分49.8—49.849.8—通过1 分导入自 20261001-032558-search-t1-spark-c3#1 seed copy_last
n2—种子已打分56.0—56.056.056.1通过1 分导入自 20261001-032558-search-t1-spark-c3#2 seed heart_jcf_peri
n3—种子已打分49.8—49.849.8—通过1 分导入自 20261001-032558-search-t1-spark-c3#3 seed pseudobulk_shift
n4n2改进已打分56.0+0.056.056.056.1未审查32 分导入自 20261001-032558-search-t1-spark-c3#4 增殖驱动的组成重加权(负结果):类型权重×(1+γ·增殖z),γ=0 复现父本 55.97,γ=±0.25/0.35/1.0 与 5118 细胞均降分。
n5n1改进已打分53.0+3.353.053.0—未审查29 分导入自 20261001-032558-search-t1-spark-c3#5 数据导出的组成重加权(生长率轴)+ 保底分层抽样
n6n3改进已打分51.6+1.851.651.6—未审查37 分导入自 20261001-032558-search-t1-spark-c3#6 按类型单快照伪时间(根=最增殖细胞)回归逐基因斜率并 EB 收缩,以线性空间倍数 exp(s·slope·w_g)(s=0.15)乘法位移抽样细胞、零结构保留;两阶段时改用 α=0.25 收缩 delta 并按与斜率的余弦门控;增殖重加权 γ 测无收益置 0。
n7n5改进已打分54.4+1.454.454.454.5未审查39 分导入自 20261001-032558-search-t1-spark-c3#7 单边生长率倾斜(非对称 κ)+ 保底分层抽样:只压低生长率轴高端的类型,低端严格保持原比例
n8n2改进已打分57.9+1.957.957.958.1通过36 分导入自 20261001-032558-search-t1-spark-c3#8 冻结父本类型配额,类内按增殖打分做成熟端加权无放回抽样(θ=0.5,E-S 算法),3-seed 均值 56.06→58.13。
n9n4改进已打分57.9+1.957.957.957.4通过31 分导入自 20261001-032558-search-t1-spark-c3#9 类型内细胞周期退出重加权:每类型内以 exp(-0.5·z) 权重(z=深度残差化的周期分稳健 z,clip±2)加权无放回抽样,解剖组成不变;proxy 3-seed 56.06→57.42。
n10n9改进已打分58.0+0.158.058.057.5通过33 分在节点9(β=0.5类型内周期退出重加权)之上,叠加沿成熟轴(-z)的逐基因EB收缩斜率乘法位移 exp(0.10·slope·w),抬cell_state、de_recovery中性。
n11n8改进已打分57.9+0.057.957.958.1通过21 分在 node 8 上加两个独立开关部件:跨阶段 δ 秩投影(两输入视图)与深度残差化增殖分;均未过预注册门槛,默认全关,出货路径与 node 8 逐位一致。
n12n4改进已打分57.8+1.857.857.857.5未审查21 分移植节点9的类内成熟度加权抽样(周期分深度残差化稳健z,w=exp(-0.5z),E-S无放回)为主干;新增跨阶段伪批量位移分支(Qiu E9.0/两官方阶段,批校+EB收缩),实测有害,默认α=0关闭。
资源消耗与失败情况

没有失败节点

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员402 分45,5366,195
工程师3059 分220,507100,015
调研员3012 分48,44125,705
审查员202 分48,0235,969
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261001-114429-search-t1-g18-continue
10-01 11:44 · 自动搜索 · T1:val · G18 验收(接续搜索) · continue
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy+proxy2 等权;终检 X1
状态已结束
开始 / 结束10-01 11:44 / 10-01 12:24
用时40 分 / 预算 2 小时
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。g18_wt
目的?这次运行为了回答什么问题,写在配置文件里。[回填] G18 acceptance 3: a short real run continued from 20261001-032558-search-t1-spark-c3 (3 new nodes, concurrency 3, qwen3.8-max), node score = 0.5 proxy + 0.5 proxy2, promotion of the top 5 with seeds 1 and 2. harness.py launch --config agent/configs/search_t1_g18_continue.yaml --continue-from 20261001-032558-search-t1-spark-c3

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。b8e4103fc93f683098226171b3d86e6c842042d2 代码有未提交改动
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件agent/configs/search_t1_g18_continue.yaml
配置指纹 c1fbcb437b966bd6
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。02e573a2ea801d77 锁定格式 v6
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本)
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。c3552e1b7c6f642a
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max
工程师:alibaba-token-plan-cn/qwen3.8-max
调研员:alibaba-token-plan-cn/qwen3.8-max
审查员:alibaba-token-plan-cn/qwen3.8-max
运行目录/home/spark-longxinyang/vec/g18_wt/agent/runs/20261001-114429-search-t1-g18-continue 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。2026-10-01_20261001-114429-search-t1-g18-continue.md