运行档案 / T1:val / 10-02 13:54
新目标机制检查
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
照抄基线
本运行目标 48.45(3 种子均值)
节点?搜索树里的每个候选程序。
25
已打分 25
官网分?官网 P2 返回的真实分数。
46.9
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
82
分析员 23、工程师 23、调研员 24、审查员 12
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X1 | 护栏基线复测 | 48.7 | 全部真值 / 3 个 seed均值 |
| X3 | 护栏基线复测 | 48.4 | 真值 B 半 / 3 个 seed均值 |
| X1 | 终检诊断 | 45.8 | 全部真值 / 1 个 seed单次 |
| X4 | 终检诊断 | 49.7 | 全部真值 / 1 个 seed单次 |
| X5 | 终检诊断 | 48.5 | 全部真值 / 1 个 seed单次 |
| proxy | 诊断记录 | 50.0 | 真值 B 半 / 1 个 seed单次 |
| T1:val | 官网结果 | 46.9 | 提交预测对应的评分 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
最终选中基线,没有获选节点祖先链。下面保留整次搜索的全部节点与轨迹。
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(25)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | X3?用外部公开数据造的同类型题。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 47.9 | — | 47.9 | 48.4 | 通过 | 不到 1 分 | seed copy_last |
| n2 | — | 种子 | 已打分 | 40.4 | — | 40.4 | 40.6 | 通过 | 不到 1 分 | seed pseudobulk_shift |
| n3 | n1 | 改进 | 已打分 | 48.5 | +0.6 | 48.5 | 48.7 | 通过 | 9 分 | 保守 per-type 线性空间缩放位移(alpha=0.4,保稀疏),单输入退路 copy_last。 |
| n4 | n2 | 改进 | 已打分 | 48.5 | +8.1 | 48.5 | 48.7 | 未审查 | 15 分 | nnz_pseudobulk_shift:copy_last 抽样后,把每类型伪批量差值只加到该细胞原本非零的元素上(负值截 0),保留 dropout 稀疏结构。 |
| n5 | n1 | 改进 | 已打分 | 49.5 | +1.6 | 49.5 | 48.7 | 通过 | 22 分 | METHOD |
| n6 | n3 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | 48.7 | 未审查 | 23 分 | 保持父节点均匀乘法位移 alpha=0.4;本节点实测 EB 基因级收缩/加法/混合位移均不优于它,确认均匀乘法位移为最优。 |
| n7 | n4 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | 48.7 | 未审查 | 10 分 | nnz_pseudobulk_shift(与父节点 4 逐位一致):copy_last 抽样后,把每类型伪批量差值只加到细胞原本非零的元素上(截 ≥0),保留 dropout 稀疏结构;新增 hybrid/fold/cap 机制均经 X3 实验否定,默认不启用。 |
| n8 | n5 | 改进 | 已打分 | 49.5 | +0.0 | 49.5 | 48.7 | 通过 | 17 分 | 保持父节点5方法(Top-K EB收缩伪批量位移);本节点系统检验11个变体(软阈值、自适应α、通路平滑等)均不优于父配置,故代码不变。 |
| n9 | n4 | 改进 | 已打分 | 48.4 | -0.1 | 48.4 | — | 未审查 | 20 分 | EB 软收缩 nnz-only 伪批量平移:对每类型逐基因差值乘 δ²/(δ²+0.5·se²) 连续降权噪声基因,再只加到细胞自身非零元素(截 ≥0),保留 dropout 稀疏结构。 |
| n10 | n3 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 8 分 | 保守 per-type 线性空间乘法位移(alpha=0.4,全基因,保稀疏),单输入退路 copy_last;本节点验证 top-K 选择、软截断、行和保持均不优于它。 |
| n11 | n8 | 改进 | 已打分 | 49.5 | +0.0 | 49.5 | 48.7 | 通过 | 6 分 | 保持父节点5/8方法(Top-K EB收缩伪批量位移)不变;本节点按 PLAN 检验 DE 覆盖率偏向抽样(β=1/2)与输出细胞数取 min_cells,均显著变差,故代码回退到父配置。 |
| n12 | n6 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 10 分 | 保持父节点均匀乘法位移 alpha=0.4;实测 prior/ 基因集(Reactome/GO/hallmark/CollecTRI)通路平滑 delta 的 7 个变体均不优于它(差距 ≤0.03,噪声内),代码回退为与父一致。 |
| n13 | n3 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 11 分 | 保持父节点乘法位移(alpha=0.4,保稀疏,单输入退路 copy_last);实测 delta 的 PCA 低秩投影平滑无效,代码回退父配置。 |
| n14 | n11 | 改进 | 已打分 | 49.5 | +0.0 | 49.5 | 48.7 | 通过 | 11 分 | 保持父节点5/8方法(Top-K EB收缩伪批量位移、原比例均匀抽样);本节点按 PLAN 检验组成趋势外推 COMP_ALPHA∈{0.05…1.0},seed0/seed1 配对裁决为负结果,COMP_ALPHA 回退为 0,仅保留抽样计数的池上限加固。 |
| n15 | n6 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 16 分 | 保持父节点均匀乘法位移 alpha=0.4;本节点实测 PCA 主轴投影 delta(k=30/50/100、alpha 0.4/0.8、raw×proj 混合)均不优于它,回退为与父代码逐元素一致。 |
| n16 | n7 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 10 分 | nnz-only 加性平移保持父节点 7 默认(--top-k 0 时逐位一致,X3 seed0 A 半 48.1073 与父记录完全吻合);新增 per-type Top-K z 选择开关,实测 Top-K、alpha>1、frac-floor 幅度放大均为负结果。 |
| n17 | n14 | 改进 | 已打分 | 49.7 | +0.1 | 49.7 | 48.8 | 通过 | 11 分 | 在父节点 Top-K EB 位移上新增每细胞进度调制:把细胞 Top-K 中心化表达投影到归一化位移方向,f=clip(1−γ·(proj−0.5),0.5,1.5),γ=−1(领先细胞位移放大、落后细胞缩小);γ∈[−2,0.5] 扫描后 3 种子配对裁决保留 γ=−1(均值 |
| n18 | n3 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 12 分 | 保持父节点均匀乘法位移 alpha=0.4(保稀疏、单输入退路 copy_last);按 PLAN 实测加法 nnz-only + EB 收缩 + Top-K 与分层 alpha 乘法型共 7 个变体,均不优于它,代码回退为与父节点逐元素一致。 |
| n19 | n6 | 改进 | 已打分 | 48.5 | +0.0 | 48.5 | — | 未审查 | 13 分 | 保持父节点均匀乘法位移 alpha=0.4;本节点实测 kNN 图扩散 per-cell delta(beta 0.2/0.3/0.5/1.0)对该视图完全无信号(board 差 ≤0.01),按 PLAN 回退为与父代码一致,负结果记录如下。 |
| n20 | n17 | 改进 | 已打分 | 49.7 | +0.0 | 49.7 | 48.8 | 通过 | 18 分 | 实现 per-type 自适应 α(按 Top-K EB 置信度缩放位移)并扫描后回退:型间置信比仅 ±3–5%,β 调制无增益,α≠0.5 一律损 de_recovery,代码回退为与父节点 17 逐位一致。 |
| n21 | n3 | 改进 | 已打分 | 48.9 | +0.4 | 48.9 | 49.1 | 通过 | 18 分 | 在父节点乘法位移(alpha=0.4,保稀疏)上加每细胞进度调制:细胞在 delta 方向上的投影分位决定其位移倍率 f∈[0.5,1.5](GAMMA=-4),领先细胞多移、落后细胞少移。 |
| n22 | n6 | 改进 | 已打分 | 49.2 | +0.8 | 49.2 | 49.4 | 通过 | 15 分 | 每细胞进度调制的乘法位移:把细胞在自己类型 delta 方向上的秩百分位映射成 alpha_i(均值仍 0.4),领先细胞位移更大、落后细胞更小。 |
| n23 | n20 | 改进 | 已打分 | 49.7 | +0.0 | 49.7 | 48.8 | 通过 | 17 分 | 按 PLAN 实现 prior/ 通路加权 Top-K 支撑集重选(Reactome/GO/hallmark/CollecTRI 成员计数),X3 上 λ∈{-0.5,1,5} 与 TopK∈{300,800} 全部劣于基线,代码回退为与父节点 20/17 逐位一致(md5 校验 |
| n24 | n22 | 改进 | 已打分 | 49.3 | +0.0 | 49.3 | 49.5 | 通过 | 18 分 | 每细胞进度调制的加法位移(β=1 增益):alpha_i 由细胞在类型 delta 方向的秩百分位决定(GAMMA=6,均值仍 0.4),更新 x'=clip(x+alpha_i·delta·(1+x),0) 只作用于非零元。 |
| n25 | n21 | 改进 | 已打分 | 48.9 | +0.0 | 48.9 | 49.1 | 通过 | 16 分 | 保持父节点21(乘法位移alpha=0.4+每细胞进度调制GAMMA=-4);实测"检出率外推随机点亮零元"在X3上板分48.60→46.54、covariation -4.65,代码回退为与父逐位一致。 |
资源消耗与失败情况
没有失败节点
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 23 | 0 | 12 分 | 202,753 | 34,299 |
| 工程师 | 23 | 0 | 4 小时 5 分 | 1,112,129 | 425,490 |
| 调研员 | 24 | 0 | 1 小时 14 分 | 264,981 | 161,555 |
| 审查员 | 12 | 0 | 12 分 | 206,286 | 34,119 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261002-135403-search-t1-x3-era-mechcheck 10-02 13:54 · 自动搜索 · T1:val · objective_x3 · x3-era-mechcheck |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | X3;终检 X1、X4、X5;护栏 X3、X1;诊断 proxy |
| 状态 | 已结束 |
| 开始 / 结束 | 10-02 13:54 / 10-02 16:05 |
| 用时 | 2 小时 11 分 / 预算 2 小时 30 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | f312d09a427702175c5322c0cf405af4c64f106f |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | /home/spark-longxinyang/vec/runs/formal/20261002-135403-search-t1-x3-era-mechcheck/config_source.yaml 配置指纹 4cb82dab9bd3db59 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | 462984e03856ec14 锁定格式 v8 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-135403-search-t1-x3-era-mechcheck/code |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | 0a9b4e1e7c02f474 |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:24 个文件,指纹 1ea9a3d2b62ff9fd proxy:19 个文件,指纹 604f04735239a30a test:97 个文件,指纹 cb0b348a20b38a54 views:2 个文件,指纹 c5e4e0bbc78dbabe |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/runs/formal/20261002-135403-search-t1-x3-era-mechcheck 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 第 9 行 · 2026-10-02 · T1:val · 预测文件指纹 27f82d0164a67e9b · 官网分 46.9 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |