运行档案 / T1:val / 10-02 03:42
A/B/C 框架对比 / B 组
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n23
本运行目标 57.25(种子 0 单次)
节点?搜索树里的每个候选程序。
29
已打分 29
官网分?官网 P2 返回的真实分数。
47.7
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
98
分析员 28、工程师 28、调研员 29、审查员 13
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X3 | 搜索目标复测 | 56.2 | 真值 B 半 / 3 个 seed均值 |
| proxy | 搜索目标复测 | 57.8 | 真值 B 半 / 3 个 seed均值 |
| proxy2 | 搜索目标复测 | 57.8 | 真值 B 半 / 3 个 seed均值 |
| X1 | 终检诊断 | 45.2 | 全部真值 / 1 个 seed单次 |
| T1:val | 官网结果 | 47.7 | 提交预测对应的评分 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
n17 草稿
logit 组成反向趋势外推(GAMMA=-2.4,dt 封顶 1)+ 心脏解剖重加权(内皮并入心脏族×1.3、神经管/表面外胚层×0、旁轴×0.1)+ 分层重采样真实细胞,n=3000,表达值不改。
搜索目标分 55.69 · proxy 56.74 · proxy2 56.74 · X3 53.59 · 3 次复测均分 55.97
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:对照是节点1(best_seed)而非节点12:四组全部大幅变好只说明该配方远优于种子基线,不能证明 logit外推+偏差校正优于节点12的简单乘法外推——榜分55.69 vs 节点12的56.32、cell_state 57.94 vs 58.53,差距都在2分噪声内。
↓
n20 改进
在节点17配方上加型内转录活性反倾斜抽样(GAMMA_RNA=-0.45:低检测基因数细胞被适度多选),其余不变(logit 反向趋势 GAMMA=-2.4、心脏解剖重加权、n=3000,表达值不改)。
搜索目标分 56.93(+1.2) · proxy 57.92(+1.2) · proxy2 57.92(+1.2) · X3 54.96(+1.4) · 3 次复测均分 56.69
分析员结论:PLAN 假设'高转录活性细胞倾斜提升 de_recovery'方向错误:GAMMA_RNA=+0.3 实测掉分(56.69→56.19,de_recovery 52.48),反向 -0.45 才涨分——型内抽样倾斜的符号必须实测确定,不能靠生物学直觉先验。
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 检查1(越界读取):run.py 仅通过 vio.load_manifest/panel_genes/read_stage/covered_genes 读取 --data 视图,超参取自环境变量,无绝对路径/`..`/`/mnt`/`/home`/`data/raw`/downloads/打分器/src/common/evaluation 访问,无联网下载;未发现问题。; 检查2(硬编码目标统计量):type_props/counts/
↓
在节点20配方上加小池精确输出(池<N_OUT 时输出 0.75×池、不重复补齐),proxy/proxy2 输出与父节点逐位一致,X3 多种子 +1.9;型内标记典型性倾斜(BETA)与深度分层抽样实测无效已默认关闭。
搜索目标分 57.30(+0.4) · proxy 57.92(+0.0) · proxy2 57.92(+0.0) · X3 56.06(+1.1) · 3 次复测均分 57.25
分析员结论:在 node20 配方(GAMMA=-2.4 趋势外推 + 解剖重加权 + GAMMA_RNA=-0.45)下,型内标记典型性倾斜(top-50 一-vs-余 logFC 标记、BETA 扫 0.15–0.8)proxy s0 全部 ≈ 父节点(57.70–58.08 vs 58.01),de_recovery 无提升——稀疏数据上型内配额倾斜对 de_recovery(53.5 档)已饱和/免疫。
审查意见 通过 1 越界读取:未发现问题——run.py 只经 --data 与 src.task1_temporal.view_io 读取视图内阶段/manifest(run.py:151-162),无绝对路径、..、/mnt、raw、打分器路径,无联网(全文 grep 无 open/urllib/socket/download)。; 2 硬编码目标统计量:未发现问题——无任何写死的比例表/细胞数/基因列表常量;解剖权重是按类型名子串的族规则(ana
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(29)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。 | X3?用外部公开数据造的同类型题。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 39.3 | — | 50.0 | 27.4 | 40.5 | 39.4 | 通过 | 不到 1 分 | seed pseudobulk_shift |
| n2 | n1 | 改进 | 已打分 | 50.0 | +10.7 | 50.0 | 50.0 | 50.0 | 50.1 | 未审查 | 19 分 | 输出群体一律取最新官方阶段(proxy2 的 Qiu E9.0 心脏细胞只当参考、不作输出),位移改成保零的乘法式并按 α 收缩,实测 α=0 最优。 |
| n3 | n1 | 改进 | 已打分 | 50.0 | +10.7 | 50.0 | 50.0 | 50.0 | 50.4 | 通过 | 13 分 | 官方最新阶段分层按型抽样复制;外部阶段只在无官方输入时作底;伪批量平移默认关闭(X3 实测任何幅度都掉分)。 |
| n4 | n3 | 改进 | 已打分 | 50.0 | +0.0 | 50.0 | 50.0 | 50.0 | 50.4 | 未审查 | 13 分 | 官方最新阶段分层按型抽样复制;实测计数空间乘法修正(top-DE 基因、保零)在 X3 任何幅度均掉分(delta 外推与真值反相关),已删除;分层抽样优于均匀抽样(proxy 双种子 +0.65)。 |
| n5 | n1 | 改进 | 已打分 | 50.6 | +11.3 | 49.9 | 49.9 | 52.1 | 50.6 | 通过 | 33 分 | 组成趋势外推重采样(多时间点视图)+ 单输入退路 |
| n6 | n3 | 改进 | 已打分 | 53.7 | +3.7 | 55.6 | 55.6 | 50.0 | 54.2 | 通过 | 24 分 | 官方最新阶段按心脏解剖组成重加权抽样复制(心脏谱系↑、边缘类型↓、神经管丢弃),不改任何表达值;外部阶段仅在无官方输入时作底。 |
| n7 | n5 | 改进 | 已打分 | 54.3 | +3.7 | 55.5 | 55.5 | 52.1 | 54.5 | 通过 | 15 分 | 最新官方阶段分层抽样复制 + 组成趋势外推(GAMMA=-0.6,仅词表可比的多阶段视图) + 谱系组成重加权(神经管丢弃、非心脏边缘类型x0.1、心脏类型x1.0)。 |
| n8 | n3 | 改进 | 已打分 | 52.2 | +2.2 | 53.3 | 53.3 | 50.0 | 52.2 | 未审查 | 19 分 | 心脏进展签名(prior GO/Reactome cardiac+heart 基因集)给细胞打分,按类型 exp(β·z) 重加权配额抽样,只选真实细胞不改表达;类型间对比不足时(gate=0)自动退回分层 copy_last。 |
| n9 | — | 草稿 | 已打分 | 55.6 | — | 56.3 | 56.3 | 54.2 | 55.6 | 通过 | 15 分 | 组成重加权复制(官方基座)+ 反向组成趋势外推(外部测试题);表达值从不修改,n≈3000,GAMMA=-1.2。 |
| n10 | n7 | 改进 | 已打分 | 55.2 | +0.9 | 56.8 | 56.8 | 52.1 | 55.3 | 未审查 | 17 分 | 在 node 7 基座上把边缘类型权重组拆细实测:EXEM 由 x0.1 改 x1.0(单调剂量曲线峰值)、Surface Ectoderm 由 x0.1 改 x0(丢弃),Paraxial 保持 x0.1;其余机制(分层抽样复制、GAMMA=-0.6 趋势、心脏/神经管权重)不 |
| n11 | n8 | 改进 | 已打分 | 54.3 | +2.1 | 53.7 | 53.7 | 55.3 | 53.8 | 未审查 | 21 分 | 节点8签名倾斜(β=0.23)上加反向组成趋势外推(GAMMA=-1.35,两阶段视图按类型占比差乘法复合,单阶段退化为1),并把CollecTRI心脏TF激活靶基因并入签名(798→904);只改抽样配额,表达值从不修改。 |
| n12 | n5 | 改进 | 已打分 | 55.9 | +5.3 | 57.1 | 57.1 | 53.5 | 56.3 | 通过 | 26 分 | 官方最新阶段分层抽样复制(表达不改)+ 心脏解剖重加权(神经管/表面外胚层丢弃、旁轴×0.1、心脏×1.3)+ 反向组成趋势外推 GAMMA=-1.2 + 输出数下限 3000。 |
| n13 | n9 | 改进 | 已打分 | 55.2 | -0.4 | 55.8 | 55.8 | 54.2 | 55.9 | 未审查 | 10 分 | 组成重加权复制(官方基座)+ CM 亚型二级降权 ×0.8 + 边缘族拆分(丢 Surface Ectoderm、EXEM 回升 ×1.0);外部测试题反向趋势外推 GAMMA=-1.2;表达值从不修改,n≈3000。 |
| n14 | n12 | 改进 | 已打分 | 55.8 | -0.1 | 57.5 | 57.5 | 52.3 | 55.5 | 未审查 | 14 分 | 官方最新阶段分层按型抽样复制 + 心脏解剖重加权(神经管/表面外胚层×0、旁轴×0.1、心脏谱系×1.3)+ 反向组成趋势外推 GAMMA=-1.2(仅词表可比的多阶段视图)+ 输出下限 3000;表达值不改。 |
| n15 | n6 | 改进 | 已打分 | 55.7 | +2.0 | 56.8 | 56.8 | 53.7 | 55.6 | 未审查 | 14 分 | 官方最新阶段按精化心脏解剖权重重加权抽样(心脏×1.3、神经管/表面外胚层丢弃、旁轴×0.1、EXEM×1.0)+ 同词表多阶段视图反向组成趋势外推 GAMMA=-1.2 + 输出上限3000 + 型地板5;只选真实细胞,表达值从不修改。 |
| n16 | — | 草稿 | 已打分 | 55.9 | — | 57.1 | 57.1 | 53.4 | 56.0 | 通过 | 11 分 | 最新官方阶段分层抽样复制 + 名称组成重加权(心脏×1.3、内皮×1.3、NT/SE 丢弃、旁轴×0.1)+ 反向组成趋势外推(GAMMA=-2.5,仅词表可比多阶段视图);表达值默认不改,EB 收缩位移已实现但实测无效默认关闭。 |
| n17 | — | 草稿 | 已打分 | 55.7 | — | 56.7 | 56.7 | 53.6 | 56.0 | 未审查 | 14 分 | logit 组成反向趋势外推(GAMMA=-2.4,dt 封顶 1)+ 心脏解剖重加权(内皮并入心脏族×1.3、神经管/表面外胚层×0、旁轴×0.1)+ 分层重采样真实细胞,n=3000,表达值不改。 |
| n18 | n9 | 改进 | 已打分 | 55.4 | -0.2 | 56.5 | 56.5 | 53.2 | — | 未审查 | 14 分 | 组成重加权复制:官方最新阶段按关键词族权重(心脏×1.6、旁轴×0.1、神经管/表面外胚层丢弃、EXEM×1.0)分层抽样 n=3000;外部测试题反向趋势外推 GAMMA=-1.2、n=2174;表达值从不修改。 |
| n19 | n12 | 改进 | 已打分 | 56.5 | +0.6 | 57.1 | 57.1 | 55.4 | 56.6 | 通过 | 14 分 | 在 node 12 上只改小池输出策略:池<下限时不再重复补齐到 3000,改为输出 0.95×池、组成保持精确(重复只落在占比上升的少数类型),proxy/proxy2 输出与父节点逐字节一致。 |
| n20 | n17 | 改进 | 已打分 | 56.9 | +1.2 | 57.9 | 57.9 | 55.0 | 56.7 | 通过 | 9 分 | 在节点17配方上加型内转录活性反倾斜抽样(GAMMA_RNA=-0.45:低检测基因数细胞被适度多选),其余不变(logit 反向趋势 GAMMA=-2.4、心脏解剖重加权、n=3000,表达值不改)。 |
| n21 | n12 | 改进 | 已打分 | 56.7 | +0.8 | 57.4 | 57.4 | 55.4 | 57.0 | 通过 | 16 分 | 在 node 12 上加两个已验证部件:小池视图(X3)不再重复补齐到 3000,改输出 0.95×池、组成精确(重复只落在占比上升的类型);大池视图(proxy/proxy2/final)型内转录活性反倾斜抽样(GAMMA_RNA=-0.45,低检测基因数细胞被适度多选,Gum |
| n22 | n16 | 改进 | 已打分 | 56.8 | +0.9 | 57.3 | 57.3 | 55.8 | 56.9 | 通过 | 12 分 | node16 基座(名称重加权+反向趋势 GAMMA=-2.5+n=3000)上加两个抽样杠杆:型内转录活性反倾斜加权抽样(GAMMA_RNA=-0.45,低检测基因数细胞适度多选)+ 小池精确输出(池<3000 时输出 0.95×池、不重复补齐);表达值不改。 |
| n23 | n20 | 改进 | 已打分 | 57.3 | +0.4 | 57.9 | 57.9 | 56.1 | 57.3 | 通过 | 16 分 | 在节点20配方上加小池精确输出(池<N_OUT 时输出 0.75×池、不重复补齐),proxy/proxy2 输出与父节点逐位一致,X3 多种子 +1.9;型内标记典型性倾斜(BETA)与深度分层抽样实测无效已默认关闭。 |
| n24 | n18 | 改进 | 已打分 | 56.4 | +1.0 | 57.6 | 57.6 | 54.1 | — | 未审查 | 16 分 | node18 基座加型内转录活性反倾斜抽样(GAMMA_RNA=-1.0:型内按细胞检出基因数 nnz^-1.0 加权、Gumbel top-k 无放回,低检出细胞多选);组成权重/反向趋势/表达值全不改。 |
| n25 | n16 | 改进 | 已打分 | 56.4 | +0.5 | 57.1 | 57.1 | 55.1 | — | 未审查 | 11 分 | node16 基座(名称重加权+反向趋势 GAMMA=-2.5)+ 型内转录活性反倾斜抽样(GAMMA_RNA=-0.45)+ 小池精确输出(0.75×池);PLAN 核心机制型内 kNN 表达平滑实测有害(covariation -10、de_recovery 不动),默认关闭 |
| n26 | n17 | 改进 | 已打分 | 57.0 | +1.3 | 57.5 | 57.5 | 56.0 | 57.1 | 通过 | 18 分 | 节点17基座(logit 反向组成趋势 GAMMA=-2.4 + 心脏解剖重加权 + n=3000)上加三个型内抽样杠杆:转录活性反倾斜 GAMMA_RNA=-1.5(实测由 -0.45 加强,proxy/X3 双升)、型内高方差基因覆盖倾斜 VAR_BETA=0.6(de_re |
| n27 | n18 | 改进 | 已打分 | 56.0 | +0.6 | 57.4 | 57.4 | 53.2 | — | 未审查 | 8 分 | node18基座加型内转录活性反倾斜抽样(GAMMA_RNA=-1.0,Gumbel top-k无放回,低检出基因数细胞多选);X3趋势公式改为双侧ε平滑+显式归一化(输出逐字节不变);组成权重与表达值全不改。 |
| n28 | n12 | 改进 | 已打分 | 56.5 | +0.6 | 57.8 | 57.8 | 54.0 | — | 未审查 | 9 分 | node 12 基座(分层复制+心脏解剖重加权)上加三个已验证部件:logit 组成趋势 GAMMA_LOGIT=-2.4、型内转录活性反倾斜抽样 GAMMA_RNA=-1.0(Gumbel top-k 无放回,gate n<0.5×池)、小池精确输出 0.75×池不重复;表达值 |
| n29 | n17 | 改进 | 已打分 | 56.4 | +0.7 | 57.8 | 57.8 | 53.6 | — | 未审查 | 6 分 | 节点17基座(logit 反向趋势 GAMMA=-2.4 + 心脏解剖重加权 + n=3000,表达值不改)上加型内转录活性反倾斜抽样 GAMMA_RNA=-0.8(nnz^-0.8 加权 Gumbel top-k 无放回);小池精确输出实测在 X3 掉分(48.3 vs 53. |
资源消耗与失败情况
没有失败节点
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 28 | 0 | 22 分 | 321,094 | 56,496 |
| 工程师 | 28 | 1 | 5 小时 36 分 | 1,560,990 | 593,897 |
| 调研员 | 29 | 0 | 1 小时 14 分 | 370,683 | 173,176 |
| 审查员 | 13 | 0 | 29 分 | 269,101 | 68,096 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261002-034201-search-t1-abc-r1-B-population 10-02 03:42 · 自动搜索 · T1:val · A/B/C 框架对比 · B 组 · r1-population |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | proxy+proxy2+X3 等权;终检 X1 |
| 状态 | 已结束 |
| 开始 / 结束 | 10-02 03:42 / 10-02 07:41 |
| 用时 | 3 小时 59 分 / 预算 4 小时 30 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | a3935ba50ec7aa51d88cffe46f526585058d9edd |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | /home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-B-population/config_source.yaml 配置指纹 c5b0c3a3b811e1e6 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | d56dcd13050c7566 锁定格式 v8 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-B-population/code |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | 3337117a6cf3c4db |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:22 个文件,指纹 edb68fc794d79881 proxy:18 个文件,指纹 166d21c45cc35ede proxy2:20 个文件,指纹 3a64c6f141374179 test:38 个文件,指纹 f706ad2858ee7264 |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/runs/formal/20261002-034201-search-t1-abc-r1-B-population 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 第 11 行 · 2026-10-02 · T1:val · 预测文件指纹 c9320f01fc39cf85 · 官网分 47.7 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |