运行档案 / T2:embryo:val_interp / 10-02 20:45
G24q
先看终选决定,再沿节点查看方法、代码改动和对话证据。
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n5
本运行目标 61.49(种子 0 单次)
节点?搜索树里的每个候选程序。
5
已打分 5
官网分?官网 P2 返回的真实分数。
60.0
官网 P2 返回
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
12
分析员 3、工程师 3、调研员 3、审查员 3
实际结果与评分依据
搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。
| 尺子 | 用途 | 分数 | 评分上下文 |
|---|---|---|---|
| proxy | 搜索目标复测 | 61.5 | 真值 B 半 / 3 个 seed均值 |
| X2 | 终检诊断 | 56.4 | 全部真值 / 1 个 seed单次 |
| T2:embryo:val_interp | 官网结果 | 60.0 | 提交预测对应的评分 |
来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。
括号里的分差只表示变化方向,不代表统计显著性。
n2 种子
seed mix
搜索目标分 57.23 · proxy 57.23 · 3 次复测均分 57.47
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n3 改进
METHOD
搜索目标分 60.63(+3.4) · proxy 60.63(+3.4) · 3 次复测均分 60.25
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:PLAN 的 T2EI-01 假设(端点细胞沿型特异方向 d_type 移向中间态可提升 cell_state)在本榜被证伪:α=0.25/0.5/1.0 使 cell_state 单调从 36.2 降到 30.0/27.3/23.4,尽管每型 ||d|| 不同(13.6–26.1)、63.7% 细胞被移位(机制确实生效而非退化为常数位移),mmd_u 0.017→0.022、variogram 0.031→0.078 同步变差。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 --data/--out 和框架库(src.task2_spatial.*)读视图数据,无绝对路径、'..'、网络下载或打分器路径(run.py:115-137)。; 2 硬编码目标统计量:未发现问题。仅有的常数是超参 MIX_S=0.5、scale_damp=0.5(run.py:42-43),为 proxy 查分调出的比例/阻尼系数,非细胞类型比例、表达量、基因列表等目标统计量;t_g
↓
n4 改进
METHOD
搜索目标分 61.82(+1.2) · proxy 61.82(+1.2) · 3 次复测均分 61.49
分析员结论:PLAN 假设的校正方向可以整体反号仍属同一机制族:T2EI-05 的乘性分组尺度形式(corr ∝ t-t_mix)成立,但 MIX_S<1 早端占多数时占据域收缩,需要放大(而非缩小)占多数的早端云(负 SHAPE_CORR)才能恢复二阶形状矩——方向应由 proxy 扫描确定,不应信任先验符号。
审查意见 通过 1 越界读取:未发现问题——run.py 全部数据访问都经 src.task2_spatial.view_io 的 load_manifest/panel_genes/read_stage(args.data, ...) 包装(第 157-168 行),AST 检查确认无 open/subprocess/socket/urllib 调用,无绝对路径、'..'、/mnt、/home、data/raw、downloads、打分器或 src/
↓
METHOD
搜索目标分 61.82(+0.0) · proxy 61.82(+0.0) · 3 次复测均分 61.49
分析员结论:在 T2 插值榜上,对已选细胞做表达空间 OT 位移(无论早端推向晚端 fwd,还是晚端拉回早端 rev)都单调劣化 cell_state:proxy board 从 α=0 的 61.48 掉到 fwd α=0.05/0.1/0.2 的 56.87/54.74/48.98、rev α=0.2 的 59.97,与 node 3 的 per-type 常向量位移(T2EI-01)同源失败。
审查意见 通过 1 越界读取:未发现问题——run.py 只经 view_io 的 load_manifest/panel_genes/read_stage/interp_bracket 读取 args.data 下的清单与输入阶段(run.py:240-251),无绝对路径、'..'、/mnt、/home、data/raw、downloads、打分器或 src/common/evaluation 引用,无联网;未读取目标阶段文件(只 read_sta
搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。
蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。
已打分?程序正常跑完并拿到分数。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
全部节点与对话(5)
| 节点 | 父节点 | 操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。 | 状态 | 搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。 | 比父节点?这个节点的分数减去它父节点的分数;正数是变好。 | proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | 3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。 | 审查 | 用时?从运行开始到结束(或到现在)的挂钟时间。 | 方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。 |
|---|---|---|---|---|---|---|---|---|---|---|
| n1 | — | 种子 | 已打分 | 49.1 | — | 49.1 | 49.4 | 通过 | 不到 1 分 | seed copy_last |
| n2 | — | 种子 | 已打分 | 57.2 | — | 57.2 | 57.5 | 通过 | 不到 1 分 | seed mix |
| n3 | n2 | 改进 | 已打分 | 60.6 | +3.4 | 60.6 | 60.2 | 通过 | 15 分 | METHOD |
| n4 | n3 | 改进 | 已打分 | 61.8 | +1.2 | 61.8 | 61.5 | 通过 | 13 分 | METHOD |
| n5 | n4 | 改进 | 已打分 | 61.8 | +0.0 | 61.8 | 61.5 | 通过 | 17 分 | METHOD |
资源消耗与失败情况
没有失败节点
| 角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。 | 大模型调用次数 | 失败 | 总用时 | 输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。 | 输出 token |
|---|---|---|---|---|---|
| 分析员 | 3 | 0 | 2 分 | 36,838 | 7,574 |
| 工程师 | 3 | 0 | 35 分 | 188,203 | 66,067 |
| 调研员 | 3 | 0 | 7 分 | 26,171 | 16,727 |
| 审查员 | 3 | 0 | 9 分 | 74,387 | 24,224 |
运行配置与来源
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20261002-204524-search-t2-embryo-interp-g24q 10-02 20:45 · 自动搜索 · T2:embryo:val_interp · G24q |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T2:embryo:val_interp |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 自动搜索 |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | proxy;终检 X2;护栏 proxy |
| 状态 | 已结束 |
| 开始 / 结束 | 10-02 20:45 / 10-02 21:42 |
| 用时 | 57 分 / 预算 1 小时 30 分 |
| 所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。 | 2026_virtual_embryo |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | db589274e0080508aa963cf0e77e8f05dd2147ef |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | /home/spark-longxinyang/vec/runs/formal/20261002-204524-search-t2-embryo-interp-g24q/config_source.yaml 配置指纹 8ff5d31182eee002 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | b6fbca0a74aef2b5 锁定格式 v8 |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 目录存在 /home/spark-longxinyang/vec/runs/formal/20261002-204524-search-t2-embryo-interp-g24q/code |
| 打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。 | 99224eb70c9ad059 |
| 数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。 | final:22 个文件,指纹 f22303ef65f51939 proxy:19 个文件,指纹 e0ec78408ba34231 test:19 个文件,指纹 7982bdcbdbe0a565 |
| 大模型?每个角色用的大模型;括号里是接口实际报告的模型名。 | 分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) 审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max) |
| 运行目录 | /home/spark-longxinyang/vec/runs/formal/20261002-204524-search-t2-embryo-interp-g24q 主机 spark-ad3f |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 第 19 行 · 2026-10-02 · T2:embryo:val_interp · 预测文件指纹 d37f305d05256bfe · 官网分 60.0 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 还没有迭代报告 |