运行档案 / T1:val / 10-01 00:25
假模型流程测试
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n2
本运行目标 56.06(种子 0 单次)
节点?搜索树里的每个候选程序。
24
已打分 16
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
59
分析员 17、工程师 20、调研员 20、审查员 2
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| X1 | 终检诊断 | 46.8 | 全部真值 / 1 个 seed单次 |
| proxy | 节点单次评分 | 56.0 | 真值范围未记录 / 1 个 seed单次 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
seed heart_jcf_peri
搜索目标分 55.97 · proxy 55.97 · 3 次复测均分 56.06
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。程序报错?候选程序运行时出错。格式不合格?输出文件不符合提交格式(基因、细胞数、坐标等)。没有改动?这次会话没有对代码做任何修改。被中断?因重启或大模型接口故障中断,不计入搜索。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(24)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 49.8 | — | 49.8 | — | 通过 | 1 分 | seed copy_last |
| n2 | — | 种子 | 已打分 | 56.0 | — | 56.0 | 56.1 | 通过 | 1 分 | seed heart_jcf_peri |
| n3 | — | 种子 | 已打分 | 49.8 | — | 49.8 | — | 通过 | 1 分 | seed pseudobulk_shift |
| n4 | n2 | 改进 | 没有改动 | — | — | — | — | 未审查 | 不到 1 分 | fake-plan-4 |
| n5 | n1 | 改进 | 已打分 | 55.6 | +5.8 | 55.6 | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x2.0, edge x0.3 (fake Engineer, node 5) |
| n6 | — | 草稿 | 格式不合格 | — | — | — | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.8, edge x0.2 (fake Engineer, node 6) |
| n7 | n2 | 改进 | 已打分 | 56.0 | +0.0 | 56.0 | 55.6 | 通过 | 2 分 | heart_jcf_peri reweighting, heart x1.6, edge x0.1 (fake Engineer, node 7) |
| n8 | — | 草稿 | 被中断 | — | — | — | — | 未审查 | 不到 1 分 | — |
| n9 | n5 | 改进 | 已打分 | 55.0 | -0.6 | 55.0 | — | 未审查 | 2 分 | heart_jcf_peri reweighting, heart x1.2, edge x0.25 (fake Engineer, node 9) |
| n10 | n7 | 改进 | 程序报错 | — | — | — | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.9, edge x0.15 (fake Engineer, node 10) |
| n11 | n7 | 改进 | 已打分 | 55.8 | -0.3 | 55.8 | — | 未审查 | 1 分 | heart_jcf_peri reweighting, heart x1.7, edge x0.4 (fake Engineer, node 11) |
| n12 | n2 | 改进 | 没有改动 | — | — | — | — | 未审查 | 不到 1 分 | fake-plan-12 |
| n13 | n2 | 改进 | 已打分 | 55.2 | -0.8 | 55.2 | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.3, edge x0.2 (fake Engineer, node 13) |
| n14 | n7 | 改进 | 格式不合格 | — | — | — | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x2.0, edge x0.1 (fake Engineer, node 14) |
| n15 | n7 | 改进 | 已打分 | 55.3 | -0.7 | 55.3 | — | 未审查 | 1 分 | heart_jcf_peri reweighting, heart x1.8, edge x0.35 (fake Engineer, node 15) |
| n16 | n11 | 改进 | 已打分 | 56.0 | +0.2 | 56.0 | 56.1 | 通过 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.6, edge x0.25 (fake Engineer, node 16) |
| n17 | n16 | 改进 | 已打分 | 55.2 | -0.7 | 55.2 | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.4, edge x0.15 (fake Engineer, node 17) |
| n18 | n7 | 改进 | 程序报错 | — | — | — | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.2, edge x0.4 (fake Engineer, node 18) |
| n19 | n7 | 改进 | 已打分 | 55.6 | -0.4 | 55.6 | — | 未审查 | 不到 1 分 | heart_jcf_peri reweighting, heart x1.9, edge x0.3 (fake Engineer, node 19) |
| n20 | n16 | 改进 | 没有改动 | — | — | — | — | 未审查 | 不到 1 分 | fake-plan-20 |
| n21 | n16 | 改进 | 已打分 | 55.4 | -0.5 | 55.4 | — | 未审查 | 2 分 | heart_jcf_peri reweighting, heart x1.5, edge x0.1 (fake Engineer, node 21) |
| n22 | n18 | 修复 | 已打分 | 55.1 | — | 55.1 | — | 未审查 | 1 分 | heart_jcf_peri reweighting, heart x1.3, edge x0.35 (fake Engineer, node 22) |
| n23 | n18 | 修复 | 已打分 | 55.7 | — | 55.7 | — | 未审查 | 1 分 | heart_jcf_peri reweighting, heart x2.0, edge x0.25 (fake Engineer, node 23) |
| n24 | — | 草稿 | 已打分 | 55.9 | — | 55.9 | — | 未审查 | 1 分 | heart_jcf_peri reweighting, heart x1.8, edge x0.15 (fake Engineer, node 24) |
资源消耗与失败情况
没有改动 3 格式不合格 2 程序报错 2 被中断 1
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 17 | 0 | 不到 1 分 | 357 | 85 |
| 工程师 | 20 | 0 | 4 分 | 982 | 237 |
| 调研员 | 20 | 0 | 不到 1 分 | 340 | 80 |
| 审查员 | 2 | 0 | 不到 1 分 | 24 | 6 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261001-002549-search-t1-fake-kill 10-01 00:25 · 自动搜索 · T1:val · 假模型流程测试 · kill |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 测试 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | proxy;终检 X1 |
| 状态 | 已结束 |
| 开始 / 结束 | 10-01 00:25 / 10-01 00:41 |
| 用时 | 15 分 / 预算 24 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
| 目的?这次运行为了回答什么问题,写在配置文件里。 | [回填] TEST ONLY (G6 acceptance 3, kill test): = search_t1_fake.yaml with more drafts; the controller is killed with kill -9 during an execution and resumed. |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | d3bd71c64308aeefb5d059545a832d2babe8a591 代码有未提交改动 |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | agent/configs/search_t1_fake_kill.yaml 配置指纹 c6fd01d6b1b31a73 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | 6c36e1e0fafaeb79 锁定格式 v5 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本) |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:fake 工程师:fake 调研员:fake 审查员:fake |
| 运行目录 | /home/spark-longxinyang/vec/2026_virtual_embryo/agent/runs/20261001-002549-search-t1-fake-kill 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 这次运行没有提交过官网 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |