运行档案 / T1:val / 10-03 09:34
t1_round2 / D 组
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n21
本运行目标 56.77(种子 0 单次)
节点?搜索树里的每个候选程序。
21
已打分 14
官网分?官网 P2 返回的真实分数。
55.0
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
56
分析员 11、工程师 14、调研员 14、审查员 7、tune 10
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X3 | 搜索目标复测 | 55.6 | 真值 B 半 / 3 个 seed均值 |
| proxy10 | 搜索目标复测 | 59.1 | 真值 B 半 / 3 个 seed均值 |
| X1 | 终检诊断 | 57.9 | 全部真值 / 1 个 seed单次 |
| X4 | 终检诊断 | 44.1 | 全部真值 / 1 个 seed单次 |
| X5 | 终检诊断 | 41.3 | 全部真值 / 1 个 seed单次 |
| X6 | 终检诊断 | 42.8 | 全部真值 / 1 个 seed单次 |
| proxy | 诊断记录 | 54.3 | 真值 B 半 / 1 个 seed单次 |
| T1:val | 官网结果 | 55.0 | 提交预测对应的评分 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
n3 种子
composition_trend — type-level composition reweighting + within-type maturity selection
搜索目标分 53.69 · X3 48.71 · proxy10 63.66 · 3 次复测均分 53.91
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n4 改进
composition_trend + 型内拟时序表达平移(已实现并筛查;λ>0 均降 X3 加权分,默认 λ=0 出厂)
搜索目标分 53.69(+0.0) · X3 48.71(+0.0) · proxy10 63.66(+0.0)
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在composition_trend已用成熟度轴(z_met+z_fate)做组成/细胞选择的基础上,再沿同一型内拟时序轴做表达平移是重复放大同一信号:X3上de_score/de_direction随λ单调恶化(-0.182→-0.214,0.026→0.011),四项无一改善,proxy10仅+0.3(噪声内)且被X3权重×2压倒。
↓
n8 改进
composition_trend + 型内表达重锚定:加权抽样后按型把表达均值锚回输入全细胞均值(α=2 出厂,α=0 为关闭对照)
搜索目标分 55.48(+1.8) · X3 52.51(+3.8) · proxy10 61.42(-2.2) · 3 次复测均分 55.55
分析员结论:去除加权抽样的型内选择偏差(逐型均值重锚定)主要改善分布指标 mmd_u(X3 +2.25 分),而不是 PLAN 预期的 de_score 回升(X3 de_score 仅 -0.182->-0.117,得分 +0.46);预期机制与实际收益路径不同时以分项数字为准。
审查意见 通过 1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/panel_genes/read_stage 读取视图数据,全文无绝对路径、`..`、external/prior 目录、打分器路径或网络访问。; 2 硬编码目标统计量:未发现问题——常量仅为规则权重(A_TP/A_CM/A_FATE/K_STRAT/α 等,run.py:35-55),CYCLE/OX
↓
n10 改进
composition_trend + 型内表达重锚定,α 扫描延伸至拐点:α=3.0 出厂(α=2.5/3.0/3.5 → 节点分 55.78/55.87/55.72),新增按型收缩开关 k(出厂关)
搜索目标分 55.86(+0.4) · X3 54.40(+1.9) · proxy10 58.80(-2.6) · 3 次复测均分 56.02
分析员结论:对一个已扫描 5 点且单调的标量旋钮再延伸 3 点找拐点:A 半收益(+0.60)本就低于单次查分噪声,官方榜分最终只 +0.39(55.48→55.86,在 T1 约 2 分噪声内)——饱和旋钮的继续调参产出噪声级收益,不值得整节点预算。
审查意见 通过 1 越界读取:未发现问题——run.py 仅通过官方 view_io 助手 load_manifest/read_stage/panel_genes 读 manifest['inputs'](run.py:352-355),grep 全文无 open/np.load/h5py/http/urllib/subprocess、无绝对路径/'..'//mnt//home/data/raw/src/common/evaluation,仅读最新输
↓
n14 改进
composition_trend + α=3 重锚定 + 两阶段逐基因方向位移(按细胞型 EB 收缩,β=1;仅双输入视图激活,X3 A 半 54.51→54.88,proxy10 与父逐字节一致)
搜索目标分 56.39(+0.5) · X3 55.19(+0.8) · proxy10 58.80(+0.0) · 3 次复测均分 56.70
分析员结论:在 X3 上把两阶段(E8.75→E9.0 Qiu)全胚胎伪批量差按 β≥0.5 放大叠加会四项全面变差(global β=0.5/5/20 → 54.27/47.46/38.53 vs 父 54.51),证实 PLAN 风险 #3:小样本、跨阶段的全局 Δμ 方向与真实发育方向不一致时,放大位移是净伤害。
审查意见 通过 1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 load_manifest/read_stage/panel_genes 读取 manifest['inputs'] 给定的视图文件(run.py:470-473, 519-525),无绝对路径、'..'、external/prior 之外的读取,无联网。; 2 硬编码目标统计量:未发现问题——常量均为算法超参(A_TP/A_CM
↓
composition_trend + α=3 重锚定 + 置信度加权稀疏型内位移:按 (型,基因) 两阶段 Welch t 连续缩放 conf=|t|/(|t|+3),每型只位移 |t| 前 200 基因(β=3;仅双输入视图激活;X3 A 半 54.88→55.67,proxy10 与父逐字节一致)
搜索目标分 56.83(+0.4) · X3 55.84(+0.7) · proxy10 58.80(+0.0) · 3 次复测均分 56.77
分析员结论:在 X3 型内两阶段位移上,用 Welch t 连续缩放 + 每型截尾(top-200)替代均匀 β 位移,使 de_score 原始值首次由地板下转正(-0.026→0.039),且位移稀疏 32 倍(36.8K vs 1.18M 条目)后 variogram 几乎不受损——统计门控比放大幅度更有效。
审查意见 通过 1 越界读取:未发现问题——所有数据读取均通过 view_io 的 load_manifest/read_stage/panel_genes(run.py:26-33, 577-580, 629-643),无绝对路径、无 '..'、无 prior/external/评分器路径访问,无网络代码。; 2 硬编码目标统计量:未发现问题——常量仅为规则权重(A_TP/A_CM/A_FATE/α/β/T0/TMIN/TOPG,run.py:35-
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。生成失败?会话没能产出可用的程序。没有改动?这次会话没有对代码做任何修改。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(21)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | X3?用外部公开数据造的同类型题。 | proxy10 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 49.5 | — | 47.9 | 52.7 | 49.7 | 通过 | 不到 1 分 | seed copy_last |
| n2 | — | 种子 | 已打分 | 50.3 | — | 50.7 | 49.7 | 49.0 | 通过 | 不到 1 分 | ot_moscot — Waddington-OT / moscot coupling, one-step displacement extrapolation |
| n3 | — | 种子 | 已打分 | 53.7 | — | 48.7 | 63.7 | 53.9 | 通过 | 3 分 | composition_trend — type-level composition reweighting + within-type maturity selection |
| n4 | n3 | 改进 | 已打分 | 53.7 | +0.0 | 48.7 | 63.7 | — | 未审查 | 30 分 | composition_trend + 型内拟时序表达平移(已实现并筛查;λ>0 均降 X3 加权分,默认 λ=0 出厂) |
| n5 | n1 | 改进 | 已打分 | 49.3 | -0.2 | 47.6 | 52.7 | 49.5 | 未审查 | 30 分 | n5: local_ot — damped OT displacement, mover-gene masked decoding (α=0.3, k=10) |
| n6 | n3 | 改进 | 已打分 | 54.0 | +0.3 | 48.9 | 64.2 | 53.9 | 通过 | 37 分 | composition_trend — type-level composition reweighting + within-type maturity selection |
| n7 | — | 草稿 | 生成失败 | — | — | — | — | — | 未审查 | 11 分 | OT-CFM 状态相关速度场:PCA 空间 minibatch-OT 配对训练 + 阻尼欧拉外推 |
| n8 | n4 | 改进 | 已打分 | 55.5 | +1.8 | 52.5 | 61.4 | 55.6 | 通过 | 37 分 | composition_trend + 型内表达重锚定:加权抽样后按型把表达均值锚回输入全细胞均值(α=2 出厂,α=0 为关闭对照) |
| n9 | n6 | 改进 | 已打分 | 54.7 | +0.7 | 52.0 | 60.2 | 54.7 | 未审查 | 31 分 | composition_trend + A_FATE=0;两阶段组成 log-ratio 机制已实现但在 X3 上为负、默认关闭 |
| n10 | n8 | 改进 | 已打分 | 55.9 | +0.4 | 54.4 | 58.8 | 56.0 | 通过 | 22 分 | composition_trend + 型内表达重锚定,α 扫描延伸至拐点:α=3.0 出厂(α=2.5/3.0/3.5 → 节点分 55.78/55.87/55.72),新增按型收缩开关 k(出厂关) |
| n11 | n9 | 改进 | 已打分 | 54.7 | +0.0 | 52.0 | 60.2 | — | 未审查 | 31 分 | composition_trend + 方差门控类型重加权(PLAN 机制已实现并量化:全网格净负,出厂默认关闭 = 父配置) |
| n12 | n8 | 调参 | 没有改动 | — | — | — | — | — | 未审查 | 15 分 | — |
| n13 | n8 | 调参 | 没有改动 | — | — | — | — | — | 未审查 | 9 分 | — |
| n14 | n10 | 改进 | 已打分 | 56.4 | +0.5 | 55.2 | 58.8 | 56.7 | 通过 | 28 分 | composition_trend + α=3 重锚定 + 两阶段逐基因方向位移(按细胞型 EB 收缩,β=1;仅双输入视图激活,X3 A 半 54.51→54.88,proxy10 与父逐字节一致) |
| n15 | n3 | 调参 | 没有改动 | — | — | — | — | — | 未审查 | 7 分 | — |
| n16 | — | 草稿 | 生成失败 | — | — | — | — | — | 未审查 | 31 分 | composition_program: EB-shrunk two-part decomposition (composition + PCA within-type) |
| n17 | n14 | 改进 | 已打分 | 56.1 | -0.3 | 54.8 | 58.8 | 56.1 | 通过 | 28 分 | 在父节点基础上,把两阶段型内位移的方向来源从原始伪批量 Δμ 换成 CollecTRI TF→靶基因网络传播方向(typed,β_net=4,EB 收缩+稀疏门控;仅双输入视图激活,单输入与父逐字节一致) |
| n18 | n3 | 调参 | 没有改动 | — | — | — | — | — | 未审查 | 5 分 | — |
| n19 | — | 草稿 | 生成失败 | — | — | — | — | — | 未审查 | 17 分 | manifold_ode: PCA-space damped neural ODE with kNN manifold penalty |
| n20 | n17 | 改进 | 已打分 | 56.4 | +0.3 | 55.2 | 58.8 | 56.7 | 通过 | 20 分 | 实现 sign-agreement 融合(稠密 Δμ 基 + 网络符号门控,冲突基因按 γ 收缩);X3 A 半未超 node 14,按 PLAN step8 出厂纯 node-14 稠密 Δμ 路径(NET_BETA=0)。 |
| n21 | n14 | 改进 | 已打分 | 56.8 | +0.4 | 55.8 | 58.8 | 56.8 | 通过 | 27 分 | composition_trend + α=3 重锚定 + 置信度加权稀疏型内位移:按 (型,基因) 两阶段 Welch t 连续缩放 conf=|t|/(|t|+3),每型只位移 |t| 前 200 基因(β=3;仅双输入视图激活;X3 A 半 54.88→55.67,prox |
资源消耗与失败情况
没有改动 4 生成失败 3
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 11 | 0 | 8 分 | 167,873 | 26,363 |
| 工程师 | 14 | 4 | 5 小时 16 分 | 858,569 | 313,320 |
| 调研员 | 14 | 0 | 35 分 | 238,749 | 84,174 |
| 审查员 | 7 | 0 | 13 分 | 199,682 | 28,554 |
| tune | 10 | 0 | 7 分 | 85,934 | 18,880 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261003-093415-search-t1-r2-D-s0 10-03 09:34 · 自动搜索 · T1:val · t1_round2 · D 组 · r2-s0 |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | X3×2 + proxy10×1;终检 X1、X4、X5、X6;护栏 objective;诊断 proxy |
| 状态 | 已结束 |
| 开始 / 结束 | 10-03 09:34 / 10-03 13:51 |
| 用时 | 4 小时 17 分 / 预算 4 小时 30 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | 659a312f976e24cbff26537f513684c07241768d |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | /home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s0/config_source.yaml 配置指纹 e32944a401075e6b |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | 7dd826f8a845c367 锁定格式 v8 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 目录存在 /home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s0/code |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | 5a6042c362b04ecb |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:24 个文件,指纹 1ea9a3d2b62ff9fd proxy:19 个文件,指纹 604f04735239a30a test:120 个文件,指纹 3fbdd3e4a74a0d83 views:2 个文件,指纹 a67144954f88da68 |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/runs/formal/20261003-093415-search-t1-r2-D-s0 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 第 45 行 · 2026-10-03 · T1:val · 预测文件指纹 5b61a49ee1fe2234 · 官网分 55.0 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |