← 返回总览 · 运行 20261001-114429-search-t1-g18-continue
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 2026-10-01_20261001-114429-search-t1-g18-continue.md
notes/reports/runs 里的报告(Markdown 源文件已渲染),由报告程序根据事实包生成。
迭代报告 · 20261001-114429-search-t1-g18-continue
run 报告 · 榜 T1:val · 模式 search · 配置 search-t1-g18-continue 生成 2026-10-01 06:12 UTC · 写作 alibaba-token-plan-cn/qwen3.8-max · 事实包 facts/2026-10-01_20261001-114429-search-t1-g18-continue.json
1. 本轮目的与改动
目的:G18 acceptance 3——从 20261001-032558-search-t1-spark-c3 续跑一次短搜索(3 新节点、concurrency 3、qwen3.8-max),验证续跑流程与 promotion 机制。节点得分 = 0.5 proxy + 0.5 proxy2,promotion 取 top 5 用 seeds 1、2 复测。
继承自 20261001-032558-search-t1-spark-c3(9 节点),全部 9 个导入节点在启动时重打分(continue_rescore_top_k: 20),重打分结果与原分数完全一致(差值均为 0.0)。fingerprint_diff 包含 candidate_modeling、proxy_weights、scorer_snapshot_hash、views,故标记为不可比(comparable: false)。
主要配置改动(vs 上一 run):
- 新增
promotion(enabled、seeds [1,2]、top_k 5、max_concurrent 1) - 新增
scoring.proxy_weights(proxy 0.5 / proxy2 0.5)、scoring.engine: "fast"、scoring.threads: 4、scoring.proxy_cache budget.wall_clock_hours3.0→2.0、budget.max_nodes6→3、budget.final_reserve_minutes45→30scoring.memory_max_by_task.T1:val36G→12G- 新增
research.lit_search(enabled、7 个 sources、max_queries 3) - 新增
research.knowledge_exclude: ["k014"] models.researcher.options.thinking_budget→ 8192- 新增
stall_seconds: 180.0
文件变动:代码 18 改 14 增(含 agent/search/continuation.py、modeling/src/common/evaluation/fast_proxy.py 等);知识库 1 改 34 增(agent/knowledge/ 下新增 k031–k063);ideas 1 改(agent/prompts/ideas_T1__val.md);prompts 3 改(agent/prompts/researcher_spec.md、review_spec.md、search_spec.md);configs 1 改 6 增。
2. 结果(表:各尺子与官网)
| 节点 | 来源 | seed0 | proxy | proxy2 | rank3 | X1(外部) | 官网 |
|---|---|---|---|---|---|---|---|
| 8(终选胜者) | 导入 | 57.887 | 57.887 | 57.887 | 58.1291 | 48.119 | — |
| 11(本轮新节点最好) | 新 | 57.887 | 57.887 | 57.887 | 58.1291 | 48.119 | — |
| 8(开始前最好,导入) | 导入 | 57.887 | 57.887 | 57.887 | 58.1291 | 48.119 | — |
| 8(上一 run 胜者) | 上轮 | 57.887 | 57.887 | 57.887 | 58.1291 | — | — |
proxy 与 proxy2 在全部 12 个 scored 节点上逐位相同(rulers_identical_on_all_scored_nodes)。本轮未提交官网。外部测试 X1 所有候选均低于地板 50.0(节点 8/11:48.119,低于地板 1.881;节点 10:47.1038,低于地板 2.8962)。校准台账仅有一条历史记录(20260927-172643-grok-t1,官网 47.2,official_minus_ruler proxy −8.77、X1 +0.41)。
3. 是否超过噪声/是否算提升
不算提升。 比较口径为 rank3(3-seed 均值)。本轮新节点最好(节点 11,rank3 58.1291)与开始前最好(节点 8,rank3 58.1291)差值为 0.0,exceeds_noise: false,verdict: "within noise"。噪声约 2 分(来源 agent/prompts/analyst_spec.md)。
逐新节点 vs 父节点(seed0 口径):
- 节点 10 vs 父 9:+0.1134,噪声内
- 节点 11 vs 父 8:+0.0(逐位一致),噪声内
- 节点 12 vs 父 4:+1.7884,噪声内(<2)
三个新节点均未超过噪声门槛。
4. 有效与无效的方法(引用节点和 Analyst 经验)
有效
- 节点 8(导入):类内 E2F 增殖打分反向加权无放回抽样(θ=0.5),cell_state +4.54、direction +2.19 vs 父 2;rank3 58.1291 为全树最高。Analyst 经验:选低增殖(成熟端)方向正确,峰值约 θ=0.5;配对 u_i 设计有效压低抽样噪声。
- 节点 12(新):移植节点 9 的类内成熟度加权抽样到新父本(节点 4),独立复现 3-seed 均值 57.48 ≈ 节点 9 的 57.42,cell_state +3.70、direction +2.36 vs 父 4。Analyst 经验:方法可迁移,但 de_recovery 仍不动。
无效/负结果
- 节点 11(新):跨阶段 δ 秩投影(两输入视图)与深度残差化增殖分两个部件均未过预注册门槛,默认全关,输出与父节点 8 逐位一致(d=0.0)。Analyst 经验:δ 与 E2F 打分共线(cos≈+0.13),冗余无增益;深度残差化后 cell_state 大跌(59.5–60.7 vs 61.4),路线证伪。
- 节点 10(新):成熟轴 EB 收缩斜率乘法位移(s=0.10),seed0 仅 +0.1134 vs 父 9,远低于噪声。Analyst 经验:重加权与乘法位移共享同一条成熟推力,两杠杆不正交;且纯抽样/重标定路线无法抬 de_recovery。
- 节点 12 的跨阶段伪批量位移分支(Qiu E9.0):α=0→0.5→1.0 在 proxy2 单调降(57.76→56.78→55.91),实测有害,默认 α=0 关闭。Analyst 经验:scArches 式批校假设不成立,残留类型×技术交互盖过 0.5 天时间信号。
未定
- 节点 12 的 θ=1.0 变体:de_score 反降(0.111→0.056),提示更成熟≠更对的 DE,但仅单次观测,未做 3-seed 确认。
5. 异常与运维
无异常。关键运行数字:
- 状态
finished,exit_code 0,无中断、无 OOM、无熔断、无日志告警(log_warnings_count: 0) - 运行时长 0.67 h / 预算 2.0 h(用 33.6%);final 阶段启动时剩余 81.6 min
- 节点执行:3 个新节点共 77.6 min(均值 25.9、最大 33.8);代码执行 3.2 min(均值 1.1)
- Promotion:8 次,共 12.6 min(均值 1.6、最大 2.1)
- 角色耗时:Engineer 3 calls / 59.1 min(均值 19.7);Researcher 3 calls / 12.5 min;Analyst 4 calls / 2.9 min;Reviewer 2 calls / 3.0 min
- Engineer slot 利用率 48.8%(concurrency 3)
- slice 内存峰值 79.47 GB,最低可用 76.9 GB
- egress_denied 24 次(目标
models.opencode.ai、registry.npmjs.org),未影响运行 - 单节点运行峰值内存 ≤1.71 GB、耗时 ≤2.3 s(节点 7),无资源瓶颈
- 工作区标记
dirty: true、submittable: false
6. 下一轮建议(具体到改哪个文件/参数)
- 组成侧手调参数网格:修改
agent/prompts/ideas_T1__val.md,新增 HEART_WEIGHT ∈ {1.3, 1.6, 2.0} × EDGE_WEIGHT ∈ {0.1, 0.25, 0.5} 网格(叠加在 β=0.5 / θ=0.5 基座上),每点 3-seed,接受条件 rank3 差 ≥ +2 且 de_recovery 不降。依据:组成是唯一被证明有效的杠杆(49.77→55.97),尚未系统扫过;预期看 proxy/proxy2(当前逐位相同)及 covariation(55.67,第二弱组)。 - de_recovery 需表达合成而非重标定:在
agent/prompts/ideas_T1__val.md中添加方向:在类型内用两阶段 δ2 筛 |δ2| top-N(N≈200–500)基因,按exp(c·δ2_g)(c∈{0.1, 0.2})做乘法位移。Analyst 经验明确"重标定真实细胞无法抬 de_recovery"(节点 9、10、12 三节点实测 ±0)。预期看 de_recovery(当前 52.53,地板 50.0)。 - 解决 proxy≡proxy2 逐位相同问题:检查
agent/configs/search_t1_g18_continue.yaml中scoring.proxy_weights与views配置。当前 12 个节点两尺子完全相同,等于 0.5+0.5 退化为单尺子,双尺子设计无信息增量。若确认是配置/代码问题,修复后重跑 1 个节点验证。 - θ 细网格确认:在
agent/prompts/ideas_T1__val.md添加 θ ∈ {0.4, 0.5, 0.6} × 3-seed 细网格(基座为节点 8),仅当 3-seed 均值差 >2 才换 θ。Analyst 经验:θ 峰值约 0.5,证据强度为"弱过线"(节点 8,3-seed +2.07 刚过自设门槛)。预期看 rank3。 - 降低 Engineer 单节点耗时:当前 Engineer 均值 19.7 min / 最大 28.3 min,占运行主体。可在
agent/prompts/search_spec.md中收紧 Engineer 查分协议(如强制粗筛 ≤4 次即定方向、出货前必须 3-seed),减少无效网格。预期看timing.roles.engineer.mean_min。
7. 需要人决定的问题
- 是否修复/启用真正的双尺子? 当前 proxy 与 proxy2 在全部 12 节点逐位相同,
scoring.proxy_weights形同虚设。选项:(a) 排查fast_proxy.py或 view 配置,使 proxy2 使用不同输入视图(如 Qiu E9.0);(b) 确认设计如此,去掉 0.5/0.5 权重简化目标为单 proxy。 - 节点 8 是否值得提交官网? 当前
submittable: false(dirty),rank3 58.1291,外部 X1 48.119(低于地板 1.881)。历史校准显示官网比 proxy 低约 8.77 分。选项:(a) 清理 dirty 状态后提交,获取第二个校准点;(b) 暂不提交,等 de_recovery/外部测试改善后再提。 - 是否将
research.knowledge_exclude: ["k014"]永久化? k014 是噪声定义条目("T1 约 2 分"),当前被排除在 Researcher 可见知识外。选项:(a) 保持排除(避免 Researcher 把噪声值当作搜索目标);(b) 恢复(让 Researcher 知道噪声以合理设定门槛)。 - 续跑可比性标记为 false,是否接受?
fingerprint_diff包含proxy_weights、views、scorer_snapshot_hash、candidate_modeling,导致本 run 与父 run 不可比。选项:(a) 接受,后续续跑不再依赖可比性;(b) 固定打分指纹(锁定fast_proxy.py哈希),使续跑可比。
数字核对(程序生成)
- 核对数字 217 个:在事实包中找到 217 个,找不到 0 个。
- 写作调用:alibaba-token-plan-cn/qwen3.8-max {"thinking_budget": 8192},120.0 s,tokens out 3225 reasoning 2093,尝试 1 次