运行档案 / T1:val / 10-01 14:05
G23 验收
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n14
本运行目标 54.14(种子 0 单次)
节点?搜索树里的每个候选程序。
16
已打分 16
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
47
分析员 13、工程师 13、调研员 13、审查员 8
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X3 | 搜索目标复测 | 52.3 | 真值 B 半 / 3 个 seed均值 |
| proxy | 搜索目标复测 | 55.1 | 真值 B 半 / 3 个 seed均值 |
| proxy2 | 搜索目标复测 | 55.1 | 真值 B 半 / 3 个 seed均值 |
| X1 | 终检诊断 | 53.9 | 全部真值 / 1 个 seed单次 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
n3 种子
seed pseudobulk_shift
搜索目标分 46.87 · proxy 50.04 · proxy2 50.04 · X3 40.53 · 3 次复测均分 46.61
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n6 改进
阻尼伪批量位移(线性空间乘性 + EB 逐基因收缩):X3 上调 α 网格后发现任何位移都劣于复制,α 定为 0,退化为 copy_last,但保留完整位移机制。
搜索目标分 50.03(+3.2) · proxy 50.04(+0.0) · proxy2 50.04(+0.0) · X3 50.00(+9.5) · 3 次复测均分 49.72
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 X3(E8.75+E9.0→E9.5,2174 细胞、0.25 天间隔)上,任何非零 α 的伪批量位移都劣于 copy_last:de_score 在 α>=0.1 时恒饱和于 -0.0857,即使 EB 收缩后 mean|δ|≈0.003 也足以把 de_recovery 从 50 压到 ~47.3——小样本短时距下 delta 方向对目标基本无益。
↓
n9 改进
组成重加权(数据内禀增殖打分,负 β):按各细胞类型"增殖−凋亡"打分差以 f=clip(exp(β·Δp),0.5,2)、β=-4 重加权 copy_last 抽样;表达原样复制(α=0)。
搜索目标分 53.64(+3.6) · proxy 54.79(+4.7) · proxy2 54.79(+4.7) · X3 51.35(+1.3) · 3 次复测均分 53.54
分析员结论:PLAN 假设上调高增殖类型(正 β)有利,实测相反:正 β 在 proxy 上掉到 45.81/43.56,负 β(下调快循环祖细胞)单调改善至 β≈-3~-5 平台;打分驱动的组成重加权机制本身成立,但效应方向必须靠网格实测,不能靠生物学直觉预设符号。
↓
在节点9类型级增殖重加权(β=-4)不变的基础上,加类型内细胞级加权抽样:同一增殖打分在类型内标准化后以 f_i=clip(exp(-0.75·s_i),1/3,3) 做 Gumbel top-k 加权无放回抽样,偏好类型内低增殖(更分化)细胞;表达矩阵仍原样复制。
搜索目标分 54.19(+0.5) · proxy 55.01(+0.2) · proxy2 55.01(+0.2) · X3 52.54(+1.2) · 3 次复测均分 54.14
分析员结论:细胞级'下调高增殖'方向与类型级一致:负 β_cell 在 proxy(+0.6~0.7)和 X3(+1.0~1.2)两尺子同向为正、正号显著劣化(52.0/51.7),说明增殖打分下沉到细胞级仍携带真实信号,但幅度全部低于 2 分噪声线,单点无法判定有效。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 src.task1_temporal.view_io 的 load_manifest/panel_genes/read_stage/inputs_by_time 读取视图内数据(run.py:28-36, 262-265),无绝对路径、..、/mnt、目标阶段文件或网络访问;external 输入被显式忽略(run.py:264)。; 2 硬编码目标统计量:未发现问题。无写死的细胞比例/表
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(16)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。 | X3?用外部公开数据造的同类型题。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 50.0 | — | 50.0 | 50.0 | 50.0 | 49.7 | 通过 | 不到 1 分 | seed copy_last |
| n2 | — | 种子 | 已打分 | 53.1 | — | 56.2 | 56.2 | 46.8 | 53.3 | 通过 | 不到 1 分 | seed heart_jcf_peri |
| n3 | — | 种子 | 已打分 | 46.9 | — | 50.0 | 50.0 | 40.5 | 46.6 | 通过 | 不到 1 分 | seed pseudobulk_shift |
| n4 | n2 | 改进 | 已打分 | 54.2 | +1.1 | 56.2 | 56.2 | 50.0 | 54.0 | 通过 | 11 分 | 父节点重加权不动;细胞不足时改为原样输出全部真实细胞(X3 46.85→50.0),位移类改动经测试全部否决。 |
| n5 | n1 | 改进 | 已打分 | 53.0 | +3.0 | 54.5 | 54.5 | 50.0 | 52.6 | 未审查 | 14 分 | 抗增殖加权组成重采样 + 可选阻尼伪批量位移(默认关):按细胞类型增殖分反比重采样输入细胞(g=-0.6),多官方输入时支持 EB 收缩的 per-type delta 位移。 |
| n6 | n3 | 改进 | 已打分 | 50.0 | +3.2 | 50.0 | 50.0 | 50.0 | 49.7 | 未审查 | 10 分 | 阻尼伪批量位移(线性空间乘性 + EB 逐基因收缩):X3 上调 α 网格后发现任何位移都劣于复制,α 定为 0,退化为 copy_last,但保留完整位移机制。 |
| n7 | n2 | 改进 | 已打分 | 54.2 | +1.1 | 56.2 | 56.2 | 50.0 | 54.0 | 通过 | 14 分 | 词表守卫:官方标签视图沿用父节点心脏重加权(proxy 逐位相同);外来标签视图(如 X3 的 Qiu 标签)改为原样复制最新输入阶段全部细胞,不做重采样。 |
| n8 | n2 | 改进 | 已打分 | 53.1 | +0.0 | 56.2 | 56.2 | 46.9 | 53.3 | 未审查 | 15 分 | METHOD |
| n9 | n6 | 改进 | 已打分 | 53.6 | +3.6 | 54.8 | 54.8 | 51.3 | 53.5 | 未审查 | 12 分 | 组成重加权(数据内禀增殖打分,负 β):按各细胞类型"增殖−凋亡"打分差以 f=clip(exp(β·Δp),0.5,2)、β=-4 重加权 copy_last 抽样;表达原样复制(α=0)。 |
| n10 | n4 | 改进 | 已打分 | 54.2 | +0.1 | 56.3 | 56.3 | 50.0 | 54.1 | 通过 | 19 分 | 父节点重加权/pass-through 不动;在每个细胞类型内部按"工作心肌−祖细胞"成熟度得分倾斜重采样(β=0.5,只重排真实细胞、不改表达)。 |
| n11 | n7 | 改进 | 已打分 | 54.2 | +0.0 | 56.2 | 56.2 | 50.0 | 54.0 | 通过 | 13 分 | 词表守卫双分支与父节点逐位相同;组成权重网格(HEART/EDGE/N_CELLS 共 12 点,proxy 查分)全部在噪声内未达 +2 采纳线,提交父节点等值版本并记录负结果。 |
| n12 | n8 | 改进 | 已打分 | 54.2 | +1.0 | 56.2 | 56.2 | 50.0 | 54.0 | 通过 | 15 分 | METHOD |
| n13 | n2 | 改进 | 已打分 | 54.2 | +1.1 | 56.2 | 56.2 | 50.0 | 54.0 | 通过 | 11 分 | METHOD |
| n14 | n9 | 改进 | 已打分 | 54.2 | +0.5 | 55.0 | 55.0 | 52.5 | 54.1 | 通过 | 8 分 | 在节点9类型级增殖重加权(β=-4)不变的基础上,加类型内细胞级加权抽样:同一增殖打分在类型内标准化后以 f_i=clip(exp(-0.75·s_i),1/3,3) 做 Gumbel top-k 加权无放回抽样,偏好类型内低增殖(更分化)细胞;表达矩阵仍原样复制。 |
| n15 | n11 | 改进 | 已打分 | 54.0 | -0.1 | 56.1 | 56.1 | 50.0 | 53.9 | 未审查 | 7 分 | 在节点 11 词表守卫双分支上,对官方词表分支追加谱系先验合成细胞注入(r=5%):把输入中计数为 0 的目标阶段新生类型(Hepatocyte←Foregut、Proepicardium←Pericardium+JCF、V-CM←LV/RV-CM、Endocardium←End |
| n16 | n13 | 改进 | 已打分 | 54.3 | +0.2 | 56.5 | 56.5 | 50.0 | 53.5 | 通过 | 6 分 | METHOD |
资源消耗与失败情况
没有失败节点
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 13 | 0 | 8 分 | 130,092 | 26,726 |
| 工程师 | 13 | 2 | 1 小时 50 分 | 547,281 | 215,851 |
| 调研员 | 13 | 0 | 36 分 | 214,767 | 113,725 |
| 审查员 | 8 | 0 | 10 分 | 154,650 | 29,906 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261001-140531-search-t1-g23-spark 10-01 14:05 · 自动搜索 · T1:val · G23 验收 |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | proxy+proxy2+X3 等权;终检 X1 |
| 状态 | 已结束 |
| 开始 / 结束 | 10-01 14:05 / 10-01 14:43 |
| 用时 | 37 分 / 预算 1 小时 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | g23_wt |
| 目的?这次运行为了回答什么问题,写在配置文件里。 | [回填] G23 acceptance (also the G7 concurrency test): a 1-hour real T1 run on the DGX Spark, concurrency 5, qwen3.8-max. Temporary objective until G21 decides: equal weights proxy / proxy2 / X3 (truth half B), holdout X1 (final only). harness.py launch --config agent/configs/search_t1_g23_spark.yaml [--allow-dirty] |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | e8d2570dc26d3e72d3a62f4efe30f0afeced8ed7 代码有未提交改动 |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | agent/configs/search_t1_g23_spark.yaml 配置指纹 bb8c46c2a74effe3 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | 185ca41d6eb6ff02 锁定格式 v7 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本) |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | cb5e01b153b197bf |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:22 个文件,指纹 edb68fc794d79881 proxy:18 个文件,指纹 166d21c45cc35ede proxy2:20 个文件,指纹 3a64c6f141374179 test:38 个文件,指纹 f706ad2858ee7264 |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/g23_wt/agent/runs/20261001-140531-search-t1-g23-spark 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 这次运行没有提交过官网 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |