运行档案 / T1:val / 10-01 23:37
A/B/C 框架对比 / C 组
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n43
本运行目标 53.34(种子 0 单次)
节点?搜索树里的每个候选程序。
61
已打分 59
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
264
分析员 59、native 180、审查员 25
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X3 | 搜索目标复测 | 50.3 | 真值 B 半 / 3 个 seed均值 |
| proxy | 搜索目标复测 | 54.8 | 真值 B 半 / 3 个 seed均值 |
| proxy2 | 搜索目标复测 | 54.8 | 真值 B 半 / 3 个 seed均值 |
| X1 | 终检诊断 | 50.3 | 全部真值 / 1 个 seed单次 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
n1 种子
seed pseudobulk_shift
搜索目标分 39.34 · proxy 50.04 · proxy2 27.43 · X3 40.53 · 3 次复测均分 39.42
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n8 改进
改了什么
搜索目标分 48.83(+9.5) · proxy 50.04(+0.0) · proxy2 50.04(+22.6) · X3 46.39(+5.9) · 3 次复测均分 48.91
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 T1 上用 inputs_by_time 取输入阶段时必须 include_external=False(无官方阶段时回退全部输入):父节点以外部 Qiu E9.0 作预测基底导致 proxy2 只有 27.43,本节点过滤后 proxy2=50.04、cell_state 32.67->49.78、covariation 22.56->46.18。
审查意见 通过 1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 read_stage/load_manifest 等助手访问 --data 内清单声明的输入,无绝对路径、..、/mnt、/home、打分器路径或联网行为; 2 硬编码目标统计量:未发现问题——常量仅为方法超参(ALPHA_MAX=0.75、ALPHA_MIN=0.1、SIGN_THRESHOLD=0.05、GENE_SHRINK
↓
n32 改进
改了什么
搜索目标分 50.03(+1.2) · proxy 50.04(+0.0) · proxy2 50.04(+0.0) · X3 50.00(+3.6) · 3 次复测均分 50.09
分析员结论:在多视图任务里,先确认改动的代码分支被哪些视图执行:本节点 proxy/proxy2 分数逐位不变(+0.00),而 X3 与 covariation 各 +3.6/+3.9,说明逐细胞缩放只在两阶段路径生效,用 proxy 判好坏会完全看不到信号。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 view_io 的 load_manifest/panel_genes/read_stage 读取 manifest 给定的输入阶段,无绝对路径、'..'、/mnt、/home、data/raw、打分器路径,无联网代码(grep 无 http/socket/requests/download)。; 2 硬编码目标统计量:未发现问题。全部常量(ALPHA_MAX、GENE_SHRINK_K、
↓
改了什么
搜索目标分 52.90(+2.9) · proxy 54.13(+4.1) · proxy2 54.13(+4.1) · X3 50.45(+0.4) · 3 次复测均分 53.34
分析员结论:在单阶段回退(proxy/proxy2)上做温和的家族组成重加权(上调心脏谱系 1.4、下调外胚层/胚外 0.4、几乎丢弃 Neural Tube 0.05)可把 proxy 从 copy_last 的 50 提升到 54,且比 Program 2 的激进权重(1.6/0.25/0.0,covariation 崩到 41.31)安全,covariation 反而 +3.57。
审查意见 通过 检查1(越界读取):未发现问题。run.py 只通过 view_io 的 load_manifest/inputs_by_time/read_stage 读取 --data 视图内输入(约100-118行),无绝对路径、无 ..、不读目标阶段文件或打分器代码,无联网。; 检查2(硬编码目标统计量):未发现问题。run.py 顶部只定义按类型家族的子串规则权重(CARDIAC_SUBSTRINGS×1.4、DOWNWEIGHT×0.4、N
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。格式不合格?输出文件不符合提交格式(基因、细胞数、坐标等)。生成失败?会话没能产出可用的程序。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(61)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。 | X3?用外部公开数据造的同类型题。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 39.3 | — | 50.0 | 27.4 | 40.5 | 39.4 | 通过 | 不到 1 分 | seed pseudobulk_shift |
| n2 | n1 | 改进 | 已打分 | 47.6 | +8.2 | 50.0 | 50.0 | 42.7 | 47.7 | 通过 | 9 分 | 改了什么 |
| n3 | n1 | 改进 | 已打分 | 46.9 | +7.5 | 50.0 | 50.0 | 40.5 | 47.0 | 通过 | 5 分 | 改了什么 |
| n4 | n3 | 改进 | 已打分 | 47.3 | +0.4 | 50.0 | 50.0 | 41.7 | 47.3 | 未审查 | 5 分 | 改了什么 |
| n5 | n1 | 改进 | 已打分 | 47.2 | +7.9 | 50.0 | 50.0 | 41.6 | 47.3 | 未审查 | 3 分 | 改了什么 |
| n6 | n2 | 改进 | 已打分 | 47.8 | +0.2 | 50.0 | 50.0 | 43.3 | 47.9 | 通过 | 7 分 | 改了什么 |
| n7 | n4 | 改进 | 已打分 | 47.6 | +0.3 | 50.0 | 50.0 | 42.7 | 47.7 | 未审查 | 5 分 | 改了什么 |
| n8 | n1 | 改进 | 已打分 | 48.8 | +9.5 | 50.0 | 50.0 | 46.4 | 48.9 | 通过 | 5 分 | 改了什么 |
| n9 | n3 | 改进 | 已打分 | 47.8 | +0.9 | 50.0 | 50.0 | 43.3 | 47.9 | 未审查 | 4 分 | 改了什么 |
| n10 | n6 | 改进 | 已打分 | 48.0 | +0.2 | 50.0 | 50.0 | 44.0 | 48.1 | 未审查 | 6 分 | 改了什么 |
| n11 | n3 | 改进 | 已打分 | 48.8 | +2.0 | 50.0 | 50.0 | 46.4 | 48.9 | 通过 | 5 分 | 改了什么 |
| n12 | n6 | 改进 | 已打分 | 48.8 | +1.0 | 50.0 | 50.0 | 46.4 | 48.9 | 未审查 | 5 分 | 改了什么 |
| n13 | n8 | 改进 | 已打分 | 49.0 | +0.2 | 50.0 | 50.0 | 46.9 | 49.1 | 通过 | 7 分 | 改了什么 |
| n14 | n10 | 改进 | 已打分 | 48.8 | +0.8 | 50.0 | 50.0 | 46.3 | 48.9 | 未审查 | 6 分 | 改了什么 |
| n15 | n8 | 改进 | 已打分 | 48.6 | -0.2 | 50.0 | 50.0 | 45.8 | — | 未审查 | 6 分 | 改了什么 |
| n16 | n13 | 改进 | 已打分 | 48.9 | -0.1 | 50.0 | 50.0 | 46.7 | 49.0 | 未审查 | 6 分 | 改了什么 |
| n17 | n1 | 改进 | 已打分 | 48.9 | +9.6 | 50.0 | 50.0 | 46.7 | 49.0 | 未审查 | 5 分 | 改了什么 |
| n18 | n8 | 改进 | 已打分 | 48.8 | -0.0 | 50.0 | 50.0 | 46.3 | — | 未审查 | 6 分 | 改了什么 |
| n19 | n11 | 改进 | 已打分 | 49.1 | +0.3 | 50.0 | 50.0 | 47.2 | 49.2 | 通过 | 4 分 | 改了什么 |
| n20 | n17 | 改进 | 已打分 | 49.0 | +0.1 | 50.0 | 50.0 | 46.9 | 49.1 | 未审查 | 6 分 | 改了什么 |
| n21 | n8 | 改进 | 已打分 | 48.8 | +0.0 | 50.0 | 50.0 | 46.4 | — | 未审查 | 10 分 | 改了什么 |
| n22 | n17 | 改进 | 已打分 | 49.1 | +0.2 | 50.0 | 50.0 | 47.2 | 49.2 | 通过 | 6 分 | 改了什么 |
| n23 | n17 | 改进 | 已打分 | 49.1 | +0.2 | 50.0 | 50.0 | 47.3 | 49.2 | 通过 | 6 分 | 改了什么 |
| n24 | n22 | 改进 | 已打分 | 49.1 | +0.0 | 50.0 | 50.0 | 47.2 | 49.2 | 未审查 | 7 分 | 改了什么 |
| n25 | n8 | 改进 | 已打分 | 49.1 | +0.3 | 50.0 | 50.0 | 47.2 | 49.2 | 未审查 | 6 分 | 改了什么 |
| n26 | n24 | 改进 | 已打分 | 49.0 | -0.1 | 50.0 | 50.0 | 47.0 | — | 未审查 | 7 分 | 改了什么 |
| n27 | — | 草稿 | 已打分 | 49.9 | — | 54.5 | 54.5 | 40.7 | 49.9 | 通过 | 8 分 | 改了什么 |
| n28 | n22 | 改进 | 已打分 | 49.2 | +0.1 | 50.0 | 50.0 | 47.5 | 49.3 | 通过 | 5 分 | 改了什么 |
| n29 | n22 | 改进 | 已打分 | 49.3 | +0.2 | 50.0 | 50.0 | 47.8 | 49.4 | 通过 | 5 分 | 改了什么 |
| n30 | n23 | 改进 | 已打分 | 49.2 | +0.1 | 50.0 | 50.0 | 47.6 | 49.3 | 未审查 | 5 分 | 改了什么 |
| n31 | n27 | 改进 | 格式不合格 | — | — | — | — | — | — | 未审查 | 3 分 | 改了什么 |
| n32 | n8 | 改进 | 已打分 | 50.0 | +1.2 | 50.0 | 50.0 | 50.0 | 50.1 | 通过 | 5 分 | 改了什么 |
| n33 | n23 | 改进 | 已打分 | 49.1 | +0.0 | 50.0 | 50.0 | 47.4 | — | 未审查 | 4 分 | 改了什么 |
| n34 | n31 | 修复 | 已打分 | 49.9 | — | 54.5 | 54.5 | 40.7 | 49.9 | 通过 | 8 分 | 改了什么 |
| n35 | n32 | 改进 | 已打分 | 50.0 | +0.0 | 50.0 | 50.0 | 50.0 | 50.1 | 通过 | 12 分 | 改了什么 |
| n36 | n34 | 改进 | 已打分 | 51.9 | +2.0 | 54.5 | 54.5 | 46.7 | 51.9 | 通过 | 6 分 | 改了什么 |
| n37 | — | 草稿 | 已打分 | 49.2 | — | 50.0 | 50.0 | 47.6 | — | 未审查 | 7 分 | 改了什么 |
| n38 | n30 | 改进 | 已打分 | 50.0 | +0.8 | 50.0 | 50.0 | 50.0 | 50.1 | 通过 | 6 分 | 改了什么 |
| n39 | n32 | 改进 | 已打分 | 50.0 | +0.0 | 50.0 | 50.0 | 50.0 | 50.1 | 未审查 | 6 分 | 改了什么 |
| n40 | n34 | 改进 | 已打分 | 53.1 | +3.3 | 54.5 | 54.5 | 50.4 | 53.1 | 通过 | 4 分 | 改了什么 |
| n41 | n32 | 改进 | 生成失败 | — | — | — | — | — | — | 未审查 | 5 分 | — |
| n42 | — | 草稿 | 已打分 | 46.6 | — | 49.7 | 49.7 | 40.4 | — | 未审查 | 7 分 | 改了什么 |
| n43 | n32 | 改进 | 已打分 | 52.9 | +2.9 | 54.1 | 54.1 | 50.4 | 53.3 | 通过 | 7 分 | 改了什么 |
| n44 | n29 | 改进 | 已打分 | 53.1 | +3.9 | 54.5 | 54.5 | 50.4 | 53.1 | 通过 | 5 分 | 改了什么 |
| n45 | n31 | 修复 | 已打分 | 49.9 | — | 54.5 | 54.5 | 40.7 | — | 未审查 | 7 分 | 改了什么 |
| n46 | n43 | 改进 | 已打分 | 53.1 | +0.2 | 54.4 | 54.4 | 50.4 | 53.1 | 通过 | 5 分 | 改了什么 |
| n47 | n27 | 改进 | 已打分 | 51.6 | +1.7 | 54.0 | 54.0 | 46.8 | — | 未审查 | 6 分 | 改了什么 |
| n48 | n36 | 改进 | 已打分 | 53.1 | +1.3 | 54.5 | 54.5 | 50.4 | 53.1 | 通过 | 5 分 | 改了什么 |
| n49 | n32 | 改进 | 已打分 | 52.9 | +2.9 | 54.1 | 54.1 | 50.4 | — | 未审查 | 3 分 | 改了什么 |
| n50 | n8 | 改进 | 已打分 | 52.5 | +3.7 | 53.7 | 53.7 | 50.2 | — | 未审查 | 4 分 | 改了什么 |
| n51 | n32 | 改进 | 已打分 | 53.1 | +3.1 | 54.5 | 54.5 | 50.4 | 53.1 | 通过 | 4 分 | 改了什么 |
| n52 | n44 | 改进 | 已打分 | 53.1 | +0.0 | 54.5 | 54.5 | 50.4 | 53.1 | 通过 | 5 分 | 改了什么 |
| n53 | n32 | 改进 | 已打分 | 52.9 | +2.9 | 54.1 | 54.1 | 50.4 | — | 未审查 | 4 分 | 改了什么 |
| n54 | — | 草稿 | 已打分 | 49.3 | — | 50.0 | 50.0 | 47.8 | — | 未审查 | 9 分 | 改了什么 |
| n55 | n46 | 改进 | 已打分 | 53.1 | +0.0 | 54.4 | 54.4 | 50.4 | — | 未审查 | 4 分 | 改了什么 |
| n56 | n46 | 改进 | 已打分 | 53.1 | +0.0 | 54.4 | 54.4 | 50.4 | — | 未审查 | 3 分 | 改了什么 |
| n57 | n22 | 改进 | 已打分 | 52.9 | +3.8 | 54.1 | 54.1 | 50.4 | — | 未审查 | 2 分 | 改了什么 |
| n58 | — | 草稿 | 已打分 | 47.1 | — | 50.5 | 50.5 | 40.4 | — | 未审查 | 10 分 | 改了什么 |
| n59 | n46 | 改进 | 已打分 | 53.1 | +0.0 | 54.4 | 54.4 | 50.4 | — | 未审查 | 5 分 | 改了什么 |
| n60 | n46 | 改进 | 已打分 | 53.1 | +0.0 | 54.4 | 54.4 | 50.4 | — | 未审查 | 3 分 | 改了什么 |
| n61 | n27 | 改进 | 已打分 | 53.4 | +3.5 | 54.9 | 54.9 | 50.4 | 53.3 | 通过 | 4 分 | 改了什么 |
资源消耗与失败情况
格式不合格 1 生成失败 1
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 59 | 0 | 47 分 | 480,422 | 100,668 |
| native | 180 | 0 | 3 小时 49 分 | 4,035,375 | 650,291 |
| 审查员 | 25 | 0 | 31 分 | 381,870 | 67,789 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261001-233757-search-t1-abc-r0-C-native 10-01 23:37 · 自动搜索 · T1:val · A/B/C 框架对比 · C 组 · r0-native |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | proxy+proxy2+X3 等权;终检 X1 |
| 状态 | 已结束 |
| 开始 / 结束 | 10-01 23:37 / 10-02 03:03 |
| 用时 | 3 小时 25 分 / 预算 4 小时 30 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | a3935ba50ec7aa51d88cffe46f526585058d9edd |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | /home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native/config_source.yaml 配置指纹 348457eb0e281a83 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | b37139e7e5ca41ef 锁定格式 v8 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 目录存在 /home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native/code |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | 3337117a6cf3c4db |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:22 个文件,指纹 edb68fc794d79881 proxy:18 个文件,指纹 166d21c45cc35ede proxy2:20 个文件,指纹 3a64c6f141374179 test:38 个文件,指纹 f706ad2858ee7264 |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 这次运行没有提交过官网 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |