Virtual Embryo Challenge更新于 10-03 20:13(北京时间) / 每 5 分钟更新

← 工作原理 · 原文件 notes/reports/dev/2026-10-03_lessons_table.md(Markdown 源文件已渲染;链接到其他文档的会跳转,指向源码的只显示路径)

跨 run 教训表(2026-10-03)

用户决定:允许官网分以方法族相对差的形式进入 run 内的教训表(decisions.tsv 同日行)。依据规则 §10:分数可以用来选择,不能用来反推目标性质。

生成了什么

文件来源 run 数方法族表行数字数
agent/prompts/lessons_T1__val.md2215(14 族 + 其余合并行)约 4400
agent/prompts/lessons_T2__embryo__val_interp.md59约 3400
agent/prompts/lessons_T2__heart__val_extrap.md27约 1650

来源是 Spark ~/vec/runs/formal 下已结束(有 final_done)的 search run;经 ssh spark 以 tar 只读复制 archive.sqlite 到临时目录再读。fake / smoke / 未结束 run 不进表。每份文件含:文首用法、官网冠军与对照、方法族汇总、本地差 vs 官网差、失败与教训(每族至多 3 条)。T1 的参照是台账中 guard 交 copy_last 那一行(46.9);T2 两榜台账里没有 copy_last 官网行,改用本榜已交官网分的中位数,文件里写明,并同时给官网分。心脏外推冠军段写「尚无超过照抄的程序」,并注明早期 run 本地尺子含可利用的尺度项。

T1 本地差 vs 官网差(被提交的程序)

方法族提交数本地差官网差
composition_program(r2-D-s0 节点 21,冠军)1+7.0+8.1
lowrank_shape1+14.8+5.1
growth_dynamics(r2-D-s1 节点 25,对照)1+8.9+3.2
local_ot(scr-B 节点 14,对照)1+13.8+2.6
stochastic_bridge1+2.4+0.9
other(早期没有 family 字段的 run)6+14.3+2.4

本地差大而官网差小的是 local_ot、lowrank_shape;本地最小的 composition_program 官网最大。T2 全胚插值:T2EI-01 / T2EI-02 / local_ot 的官网分 60.8 / 61.7 / 60.0,本地差都在 +12.5 至 +12.9,本地分几乎区分不了族。

实现

  • agent/meta/lessons.py:build / all,--runs-root(可重复)或 --spark,--max-runs 40、--max-chars,--stdout;rebuild_for_run() 供 meta 调用。家族取 Analyst 判定的族,Analyst 判 other 时退回 PLAN 的族,都没有则 other;tune / debug 节点继承父节点的族。本地差 = 节点各 seed 平均目标分 − 同 run 的 copy_last 种子节点;「最好」优先取跑满 3 seed 的节点,否则标 *。冠军 = 本榜官网分最高的已提交程序(winner 取 final_guard.selected / final_done.winner,旧 run 退回 final_seeds 最高均值);对照 = 同一时期、本地差不低于冠军 3 分以内、官网低 2 分以上的程序,取官网最低的两个。
  • Analyst 教训只保留一个完整分句,含分项指标名、T2 指标名、阶段名、基因符号、细胞数、小数或百分数的一律丢弃(clean_lesson)。METHOD 首行同样过滤。
  • agent/search/controller.py(只改附件默认值一小段):KNOWLEDGE_ROLES 加 analyst;T1 / T2 默认给 Researcher 与 Analyst 附 lessons_<榜>.md,Engineer 不附;文件不存在则跳过并向 stderr 打 WARNING(launch 日志);Analyst 的 prompts_by_role 追加附件。test_g39_search_fixes.py 里 3 处断言随之改动。
  • agent/meta/policy.py:新增 WHITE_ACTIONS = regenerate_lessons(进入 policy_text()),lessons 文件本身不接受补丁提案(黑名单)。agent/meta/__main__.py:all / apply 结束后自动重建本榜文件(--no-lessons 关闭,失败只告警)。
  • scripts/check_knowledge.py:扫描 agent/prompts/lessons_*.md(按榜取禁窗,阶段 + 数量组合规则照旧;proxy 目标审计也覆盖)。现状 PASS,未新增白名单。
  • 单元测试 agent/meta/lessons_test.py(9 个,fixture archive + 假台账 + check_knowledge 扫描 + controller 默认附件)和 agent.meta.meta_test、test_g39_search_fixes(37)通过。
  • notes/changelogs/decisions.tsv 追加一行;notes/competition/12_p3_protocol.md §4 加注。

注意

  • 「other」是没有标族的节点(早期 run 没有 family 字段),T1 里占大多数,不代表一类方法。
  • 各 run 的目标函数不同,只比同 run 内的差;冠军 / 对照的「由此可学的」是机械拼出的机制层面对比,不推测目标阶段。
  • 没有启动 run,没有 git commit,Spark 只读。

审查修订(2026-10-03)

  • 两张表都按本地目标(由 run 锁的 objective_resolved 归一,如 X3、proxy、2X3+proxy10)分开:族表的"本地最好差"按目标列出,"本地差 vs 官网差"按目标分组,组内一句对比,删掉全局性的"高估"结论。
  • 对照只取与冠军同一目标的已提交程序(T1:r2-D-s1 节点 25,本地 +8.9 对 +7.0,官网 +3.2 对 +8.1);"由此可学的"写成"同一尺子下,A 族本地更高但官网更低"。
  • 每个官网差标 n,n=1 加 †(单次提交,官网噪声未测);冠军段写"领先第二名 x 分,单次提交,未经重复"。
  • other 挪到表末并注明只作背景,不再显示机制生效 / 假设成立。
  • 方法族统一为 PLAN 的 family_id 优先、Analyst 判定其次(冠军链节点 10 现为 composition_program)。
  • 注意:上面"T1 本地差 vs 官网差"那张旧表混了不同目标,以文件中的分组表为准;X3 组内 lowrank_shape 本地 +14.8 官网 +5.1,local_ot +13.8 / +2.6,stochastic_bridge +2.4 / +0.9,本组本地与官网排序一致。