Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T2:heart:val_extrap / 10-03 07:02

G24 T2/T3 首跑 / D 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

搜索尚未完成终选

下方分数代表当前搜索进度,不能作为最终提交结果。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n22
本运行目标 59.09(种子 0 单次),还在搜索,暂时最好
节点?搜索树里的每个候选程序。
25
已打分 18
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
72
分析员 16、工程师 15、调研员 16、审查员 7、tune 18

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

分数均值± 标准差次数
搜索目标分59.09—1
proxy59.09—1

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子
seed damped_shift
搜索目标分 49.51 · proxy 49.51 · 3 次复测均分 49.52
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n4 改进
表达匹配型伪批量位移(α=0.05,覆盖全部细胞)+ 坐标尺度取各输入阶段观测到的最大 RMS 半径(形状不变,仅整体缩放)。
搜索目标分 52.98(+3.5) · proxy 52.98(+3.5) · 3 次复测均分 52.98
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:PLAN 前提在本视图被证伪:proxy 两输入 33 个类型全部同名,父节点 n_shifted 已覆盖全部细胞,'只剩 5 个同名类型'只发生在 final 视图——设计前应先在打分视图上核实覆盖率假设。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 view_io(load_manifest/panel_genes/read_stage/extrap_step/inputs_by_time,run.py:42-49,125-152)访问 --data 视图内路径,未触碰 external/、prior/、绝对路径或评分器代码,无联网。; 2 硬编码目标统计量:未发现问题。常量仅 ALPHA=0.05、MIN_CELL_FRAC=0.0
↓
n10 调参
tune of #4: α from 0.05 to 0.02 (recover expression_change and cell_state gains seen in rounds 0-1), and target RMS scale factor from 1.0 to 0.95 (round 1 showed factor>1.0 hurts shape_scale; try slig
搜索目标分 53.94(+1.0) · proxy 53.94(+1.0) · 3 次复测均分 53.94
分析员结论:shape_scale 对目标 RMS 敏感且方向明确:factor 1.2→54.84、1.05→60.16、1.0→62.83、0.95→66.27,越接近参考尺度 335 越好,超过 max(输入 radii) 一定变差。
↓
n12 改进
去除伪批量位移(α=0)+ 确定性 PCA 坐标规范化 + 各向同性缩放到 0.946×max_k RMS(input_k),shape_scale 66.60
搜索目标分 54.15(+0.2) · proxy 54.15(+0.2) · 3 次复测均分 54.00
分析员结论:在T2:heart:val_extrap上,去掉伪批量表达位移(α 0.02/0.05 → 0)使cell_state从49.04-49.40回到50.00:沿prev→last伪批量方向做阻尼位移在本proxy上方向为负,不应再调参,应整族删除。
审查意见 通过 1 越界读取:未发现问题。run.py 仅通过框架 view_io(load_manifest/panel_genes/read_stage/extrap_step/inputs_by_time)读视图内输入阶段,无绝对路径、'..'、external/、prior/、目标阶段文件或网络访问(run.py:41-51, 100-116)。; 2 硬编码目标统计量:未发现问题。唯一常量 FACTOR=0.946(run.py:53)是作用
↓
n13 改进
实现T2HX-03基因级趋势外推,proxy证伪(α=0.2→52.05、de_direction−0.06,与幅度无关),按停止规则提交α=0;坐标机制保留,输出=父节点12(54.15)。
搜索目标分 54.15(+0.0) · proxy 54.15(+0.0)
分析员结论:在本视图(T2:heart:val_extrap,proxy=E8.25_late+E8.75→E9.5)上,沿 prev→last 逐基因伪批量差做线性外推,任何 α>0 都使榜分单调下降(α=0.05→53.02、α=0.2→52.05 vs α=0→54.15),且 de_direction=−0.0596 在两个 α 上完全相同——方向指标与幅度无关,缩小 α 只能稀释损失不能翻正,故不必扫更大的 α 网格。
↓
n16 改进
实现T2HX-05逐主轴幅度趋势外推:两输入阶段PCA谱比值r_j对末阶段坐标做阻尼逐轴缩放(只改轴比);proxy双向证伪,按停止规则提交γ=0,输出=父节点13,机制留VEC_GAMMA开关。
搜索目标分 54.15(+0.0) · proxy 54.15(+0.0)
分析员结论:在本榜上,对两输入阶段的 PCA 谱比值做阻尼外推(趋向各向同性,r_j=[0.558,0.610,0.751])使 shape_scale 单调恶化(γ=1 时 66.60→54.37),说明目标 E9.5 的形状谱基本停在 last 阶段自身,沿 prev→last 谱趋势再走一步是错方向。
↓
n19 改进
METHOD
搜索目标分 58.26(+4.1) · proxy 58.26(+4.1) · 3 次复测均分 58.17
分析员结论:当树内所有 prev→last 时序趋势族证伪、表达三组钉死 50.00 地板时,换用与之正交的外部同阶段跨平台数据(corr(δ, 时序差)=−0.04)锚定逐基因偏移,一次性使三个表达组全部脱离地板(+3.7~+6.8)。
审查意见 通过 1 越界读取:未发现问题——数据只经 read_stage(args.data,...) 和 external_same_stage()(run.py:125-143,os.path.join(view, ent['path']) 仅拼接 manifest['external'] 声明的 qiu2024_heart_early_v1/E8.75.h5ad)读取;无绝对路径/..//mnt//home/data/raw/downloads
↓
n21 改进
METHOD
搜索目标分 59.09(+0.8) · proxy 59.09(+0.8) · 3 次复测均分 59.01
分析员结论:在 T2HX-09 族中,δ 的 official 侧限定心脏谱系细胞(消除组成混淆)方向被证伪:proxy 53.58、de_direction 从 +0.215 跌到 −0.068;反而是只取非心脏匹配类型(锐化全胚 vs 纯心脏的组成对比)单调更优(53.58 < 57.86 < 58.76),说明该视图下组成对比本身携带与真实时序方向一致的信号,不应作为混淆去除。
审查意见 通过 1 未发现问题:run.py 只经 view_io(load_manifest/read_stage/panel_genes)读 --data 视图内输入阶段,外部数据仅通过 os.path.join(view, ent['path'])(run.py:150)读取 manifest['external'] 挂载的 external/qiu2024_heart_early_v1/E8.75.h5ad;无绝对路径、..、/mnt、/hom
↓
n22 改进 当前最好
T2HX-09b 细胞类型条件乘性修正(w_t=1−κ·s_t,s_t 为类型谱与外部心脏质心余弦):proxy 双向证伪(κ>0 单调降、κ<0 亦低于父),按停止规则提交 κ=0,输出与父节点 21 逐字节一致。
搜索目标分 59.09(+0.0) · proxy 59.09(+0.0)
分析员结论:在该管线中,对逐基因乘性修正引入按细胞类型的异质乘子(w_t 调制)会双向劣化:κ∈{0.3,0.5,0.8,1.0} 四组分单调下降,κ∈{-0.3,-0.5} 也低于父(58.75/58.70 < 59.09),κ=0 是局部最优——统一(秩-1)修正优于任何类型异质乘子。
审查意见 通过 检查1(越界读取):run.py 只从视图内读取——read_stage/load_manifest/panel_genes 读输入阶段(E8.25_late、E8.75),external_same_stage 用 os.path.join(view, ent['path']) 读 manifest['external'] 挂载的 external/qiu2024_heart_early_v1/E8.75.h5ad(run.py:15

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,50.001n2 种子,已打分,49.512n3 改进,已打分,50.003n4 改进,已打分,52.984n5 改进,已打分,52.135n6 改进,已打分,54.156n7 调参,没有改动7n8 调参,没有改动8n9 改进,已打分,53.929n10 调参,已打分,53.9410n11 调参,没有改动11n12 改进,已打分,54.1512n13 改进,已打分,54.1513n14 调参,没有改动14n15 改进,已打分,54.1515n16 改进,已打分,54.1516n17 改进,已打分,54.1517n18 改进,已打分,54.1518n19 改进,已打分,58.2619n20 改进,已打分,54.5220n21 改进,已打分,59.0921n22 改进,已打分,59.0922n23 调参,没有改动23n24 改进,编写中24n25 改进,调研中25终选
已打分?程序正常跑完并拿到分数。没有改动?这次会话没有对代码做任何修改。调研中?大模型正在查资料、想改进思路。编写中?大模型正在修改程序代码。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
50525456580255075100从开始算起的分钟数20261003-070222-search-t2-heart-extrap-g24-D20261003-070222-search-t2-heart-extrap-g24-D:0 分钟 50.0020261003-070222-search-t2-heart-extrap-g24-D:18 分钟 52.9820261003-070222-search-t2-heart-extrap-g24-D:34 分钟 54.1520261003-070222-search-t2-heart-extrap-g24-D:100 分钟 58.2620261003-070222-search-t2-heart-extrap-g24-D:115 分钟 59.09
全部节点与对话(25)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分50.0—50.050.0通过不到 1 分seed copy_last
n2—种子已打分49.5—49.549.5通过不到 1 分seed damped_shift
n3n1改进已打分50.0+0.050.0—未审查8 分按细胞类型伪批量收缩/扩张(T2HX-01):机制在 proxy 上双向证伪,默认 α=0(= copy_last)
n4n2改进已打分53.0+3.553.053.0通过17 分表达匹配型伪批量位移(α=0.05,覆盖全部细胞)+ 坐标尺度取各输入阶段观测到的最大 RMS 半径(形状不变,仅整体缩放)。
n5n1改进已打分52.1+2.152.153.0未审查20 分T2HX-02:按细胞类型质心位移的坐标线性外推(DRIFT_MULT=0.5)
n6n4改进已打分54.1+1.254.154.0通过14 分去除表达位移(α=0,表达照抄末阶段),坐标各向同性缩放到 0.946×max_k RMS(input_k)(proxy 上 335,scale_log_ratio≈0),加确定性 PCA 规范化(定手性与轴朝向);shape_scale 62.8→66.6,总分 53.2→54
n7n5调参没有改动————未审查3 分—
n8n5调参没有改动————未审查2 分—
n9n6改进已打分53.9-0.253.954.2未审查20 分在节点 6(表达照抄末阶段 + 各向同性缩放到 0.946·max RMS + PCA 规范化)之上,新增去尺度 kNN 残差形变场,把末阶段点云沿 prev→last 的形状变化方向前向外推 β=−0.5 倍,只改相对几何;proxy 54.15→54.76,shape_sca
n10n4调参已打分53.9+1.053.953.9未审查3 分tune of #4: α from 0.05 to 0.02 (recover expression_change and cell_state gains seen in rounds 0-1), and target RMS scale factor from 1.0 to
n11n4调参没有改动————未审查1 分—
n12n10改进已打分54.1+0.254.154.0通过8 分去除伪批量位移(α=0)+ 确定性 PCA 坐标规范化 + 各向同性缩放到 0.946×max_k RMS(input_k),shape_scale 66.60
n13n12改进已打分54.1+0.054.1—未审查17 分实现T2HX-03基因级趋势外推,proxy证伪(α=0.2→52.05、de_direction−0.06,与幅度无关),按停止规则提交α=0;坐标机制保留,输出=父节点12(54.15)。
n14n6调参没有改动————未审查4 分—
n15n9改进已打分54.1+0.254.154.0未审查9 分对去尺度 kNN 残差形变场新增逐细胞位移上限(cap_frac×kNN 中位距离),扫 β∈{−0.15,−0.2,−0.25}×cap∈{0.4,0.6},全族在榜单证伪,提交默认 β=0(形变关闭,=尺度+PCA 基线)。
n16n13改进已打分54.1+0.054.1—未审查17 分实现T2HX-05逐主轴幅度趋势外推:两输入阶段PCA谱比值r_j对末阶段坐标做阻尼逐轴缩放(只改轴比);proxy双向证伪,按停止规则提交γ=0,输出=父节点13,机制留VEC_GAMMA开关。
n17n9改进已打分54.1+0.254.154.0未审查14 分实现 PLAN T2HX-05「PCA 主轴长宽比趋势外推(各向异性缩放)」:由两输入阶段 PCA 逐轴 σ 比值 r_j 推 a_j=r_j^γ 对末阶段点云各向异性缩放;榜单双向证伪(γ=+0.5→52.46、γ=−0.25→53.95,均低于 γ=0 的 54.15),按停
n18n17改进已打分54.1+0.054.1—未审查10 分实现 T2HX-04 局部 Laplacian 平滑:输出点云每细胞向 k=10 近邻质心移动 λ 比例、RMS 等向修正保全局尺度;榜单双向证伪,按停止规则提交 λ=0(=等向缩放+PCA 规范化基线,表达照抄末阶段)。
n19n16改进已打分58.3+4.158.358.2通过13 分METHOD
n20n18改进已打分54.5+0.454.554.8通过18 分T2HX-08 组成趋势重加权:由两输入阶段细胞类型比例差反向(η=−1)外推末阶段组成(TV≤0.05),按空间冗余度确定性地重采样同数细胞;表达与坐标值不动。proxy 55.63(基线 54.15)。
n21n19改进已打分59.1+0.859.159.0通过12 分METHOD
n22n21改进已打分59.1+0.059.1—通过13 分T2HX-09b 细胞类型条件乘性修正(w_t=1−κ·s_t,s_t 为类型谱与外部心脏质心余弦):proxy 双向证伪(κ>0 单调降、κ<0 亦低于父),按停止规则提交 κ=0,输出与父节点 21 逐字节一致。
n23n19调参没有改动————未审查2 分—
n24n20改进编写中————未审查——
n25n22改进调研中————未审查——
资源消耗与失败情况

没有改动 5

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员16011 分209,75333,046
工程师1502 小时 40 分869,563323,847
调研员16047 分181,159117,937
审查员7012 分151,74733,987
tune18013 分135,94533,115
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261003-070222-search-t2-heart-extrap-g24-D
10-03 07:02 · 自动搜索 · T2:heart:val_extrap · G24 T2/T3 首跑 · D 组
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T2:heart:val_extrap
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy;终检 X2;护栏 proxy
状态已停止
开始 / 结束10-03 07:02 / 10-03 09:15
用时2 小时 12 分 / 预算 4 小时
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。5cfaf4bf99c58c41777a94be118980727ee7cfcc
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261003-070222-search-t2-heart-extrap-g24-D/config_source.yaml
配置指纹 d8eb95b2bd72a258
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。7a636109aa2994da 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261003-070222-search-t2-heart-extrap-g24-D/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。979cc0eb56dc19ce
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:23 个文件,指纹 376654f75fd9ced3
proxy:20 个文件,指纹 2ede018e6fae19d3
test:19 个文件,指纹 7982bdcbdbe0a565
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261003-070222-search-t2-heart-extrap-g24-D 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告