Virtual Embryo Challenge更新于 10-03 20:13(北京时间) / 每 5 分钟更新

← 工作原理

决策记录 decisions.tsv

仓库里的拍板记录,新的在上。原文件 notes/changelogs/decisions.tsv(TSV)。

日期主题决定
2026-10-03官方 KG 在 run 内可用(第 8 问由官网自身回答)官网 /kg 页写明比赛 agent 推理时可只读查询 KG;限制只在保留阶段 / 条件的实测数据(Data 页通则)。做法:run 内 Researcher 经宿主端按任务过滤的 KG 工具查询(答案取自已审索引,实时 API 在 run 外发现新知识、审核后进下一版);自动审核只 reject / hold,测量型新边人工批准;本体层无阶段边可自动接受。作为单独一项改动从下一环起启用(不与今晚 T1 第一环的跨环改动同批)
理由与否决的方案

用户("官方的KG可以直接用")+ 官网核对

否决:

裁定: · 文档:

2026-10-03额度用尽的处理各模型都是套餐,不设预警阈值;任何额度一旦耗尽(回退链也用尽)就:立刻发邮件、run 进入"额度暂停"——不再派新节点,在飞的执行照常完成,保存状态(PAUSED_QUOTA.json:哪个额度、时间、在飞与待续的节点),定时用便宜探针检测额度是否恢复(用户更新 API 后),恢复即自动续跑;暂停期间 run 的截止照常计时,到点未完成的工作按跨环续做带到下一环。只换密钥/端点、模型不变属于凭据更新,不改锁;换模型需开新环
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03邮件节奏节点邮件:启动 / 停止 run(harness 启动钩子自动发)、run 结束分数总结(打包后自动发)、提交与官网分、合入改动、回退、暂停、需人决定;日常健康汇报改为每 3 小时(Spark 定时器 00/3)。邮件都从 Spark 的 vec-notify 发
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03跨 run 索引库(G57)建派生、可重建的 SQLite 索引(data/index/vec_index.sqlite,不进 git),汇总各 run archive 与台账;教训表、校准表、单 run 总结、外层循环查询都从它生成;run 内 agent 不直接查库,仍只读进锁的 lessons markdown。排在当前修复之后,B 级改动,新旧输出须一致
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03官网分项分数(Per-metric skill)的用法三层:(1) run 外(外层循环 / 人)可用:同一程序本地分项 vs 官网分项,校准本地尺子、调整本地目标组成;(2) run 内教训表只给方法族级、定性的分项短板(不给数值、不给单次提交的分项);(3) 永不:同一分项跨提交做差或拟合求目标参数、程序读取官网分项、把 scale_log_ratio 等直接对应单个目标量的分项写给 agent。尺度扫描只能按总分在预登记点中选,不得用分项插值新尺度(规则 §10)
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03自主外层循环(G56)以后由虚拟机上的 Claude Code 无人值守推进:run 结束 → run 外审计 → 单 run 总结 → 根因追查 → 跨 run 比较 → 改进(A/B/C 级自动,C 级须 Codex 审阅无 P0;D 级禁区等人)→ 提交(P2 每榜每天自动 ≤3;P3 正式提交等人)→ 下一环 → 邮件。先空跑一天再开启。设计 notes/architecture/19_outer_loop_autonomy.md
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03GSE156001(Gata4 带标签等位基因 bioChIP / ATAC)暂不使用:规则 §10 把同一基因的其他等位基因按保留条件对待;加入给主办方的问题清单(11_data_use_scope §4),得到答复前留在隔离区,不挂进任何视图
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03外部数据下载路径下载慢的来源(figshare 等,Spark 直连受限)改在 Mac 上下载,落到 Mac 上的仓库 data/external/<id>/,再按 sync 同步到 Spark;NCBI 等 Spark 能快速访问的仍在 Spark 下载。虚拟机磁盘不落数据。今天经虚拟机中转写进 Spark 的 GSE197353 E9.0 接受(未在 VM 落盘)
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03T1 链启动时机Codex 实现审阅(notes/reports/reviews/2026-10-03_codex_g45_impl.md)发现 4 个 P0 + 护栏 seed 指纹问题;T1 24 h 链等这些修复与三环回归通过后再启动,不做"第一环关闭续做"的折中
理由与否决的方案

用户

否决:

裁定: · 文档:

2026-10-03允许官网分以方法族相对差的形式进入 run 内的教训表每个榜一份 agent/prompts/lessons_<榜>.md(由 python -m agent.meta.lessons 从已结束 run 的 archive 与 submissions.tsv 生成),按方法族列:试过次数、机制是否生效、本地最好 3 seed 差、失败计数、Analyst 教训,以及该族被提交程序相对我们 copy_last 的官网差(T1 参照 46.9;无 copy_last 官网行的榜用已交官网分的中位数),并列出本地差 vs 官网差、当前官网冠军的祖先链与对照。附给 Researcher 与 Analyst,不给 Engineer;G44 apply 流程把重新生成列为白名单动作,每环 `python -m agent.meta all <run>` 后自动重建。不给分项、逐基因、逐细胞信息,不写保留阶段取值;check_knowledge 照扫
理由与否决的方案

官网规则 §10:分数可以用来选择预测,不能用来反推目标性质;“trying a parameter, seeing how it scores, and trying another is ordinary leaderboard work”。方法族级相对差只用于在族间分配精力

否决:继续“官方分不写进 run 的任何输入”:太保守,研究者看不到哪类方法在官网上兑现,本地尺子高估的族会被反复重投

裁定:用户(2026-10-03) · 文档:agent/meta/lessons.py;notes/reports/dev/2026-10-03_lessons_table.md;notes/competition/12_p3_protocol.md §4

2026-10-03Spark 禁窗数据落盘规则改写:下载不违规、使用才违规;外部数据可下载到 Spark 隔离区 data/external/_quarantine/<qid>/,第一步按本任务禁窗删样本 / 细胞(data.post_filter 默认 true),原始下载随即删除,只挂删窗后经 Compliance 放行的派生文件GEO _RAW.tar 与多阶段 h5ad 无法在元数据阶段拆开,按 10-02 字面规则只能整包不下;用户定稿的 Data agent 流程是“下载 → 隔离区 → 删窗”
理由与否决的方案

notes/architecture/15_data_agent_compliance.md §4;data/external/SPARK_EXCLUDE;notes/competition/11_data_use_scope.md §3

否决:维持 2026-10-02“任务禁窗的数据不得落到 Spark”(等价于 data.post_filter: false)

裁定:用户(2026-10-03 grilling Q9、Q18) · 文档:G52 集成(notes/reports/dev/2026-10-03_integration.md)

2026-10-03外部数据全要,Data Scout 在 Spark 下载到隔离区、删窗后由 VM 上的 Opus 判定并自动挂载:GSE278603(只留 E8.0 两个胚胎,E7.5 / E7.75 四个下载后立即删)、Qiu E8.0–8.5(X7)、GSE208162 + GSE156001(仅限 T3)、GSE197353 E9.0;抽样实验不交官网验证数据侦察第一轮;禁窗按任务判定;下载不违规使用才违规
理由与否决的方案

notes/research/data_scout_2026-10-03.md

否决:只产清单不下载;挂载前人点一次

裁定:用户(grilling Q6、Q9、Q18) · 文档:G46

2026-10-03用量与花费只统计不设限:看板加“用量与花费”页(按模型 / run / 日的 token 与折算费用);邮件通知 747937110@qq.com:每 2 h 健康汇报、每条 run 终选结果与分项、任一额度(Token Plan / Opus / ChatGPT)耗尽即时告警;提交由 Claude Code 在 VM 用 Playwright 上传并读回分数自动入账,选哪个 run 提交仍由人点一次用户要求
理由与否决的方案

—

否决:设日上限;人工填分

裁定:用户(grilling Q25、Q26、Q29) · 文档:G51 用量与邮件;G13 提交自动化

2026-10-03Engineer 不设固定时限:健康即继续(180 s 无动作计一次停顿,3 次终止),只受 run 截止约束;GPU 训练的 draft 先小样本再全量最近 5 个 run 仅约 20% 节点用 GPU,全是 OT / CFM / VAE draft,正是 30 min 内写不完被判超时的那些
理由与否决的方案

Spark engineer.jsonl 统计

否决:improve 45 / draft 60 / debug 20 固定时长

裁定:用户(grilling Q32) · 文档:G39.4 改写

2026-10-03两级合规审计:run 内 Compliance(每节点)+ Reviewer(前 10% 源码);run 外轨迹审计 agent(Opus 经中继)扫全部轨迹、代码、数据披露,作 prepare_submission 的门,疑似泄漏阻止进队列待人放行区分 run 内与 run 外;只记录和拦截不改代码
理由与否决的方案

—

否决:只出报告不阻止;合进 G44

裁定:用户(grilling Q19、Q27) · 文档:G50 轨迹审计

2026-10-03外层循环全自动:G44 分析 agent(Opus 经中继)每 run 结束出 findings / proposals,白名单内改动(提示词、方法卡、知识表、方向库、种子取舍、搜索参数、draft 顺序、run 链接续)改前过合规审查、自动应用并开下一环、记 decisions.tsv;黑名单(评分器与尺子、视图与禁窗规则、合规检查器、锁与账本、提交流程、预算上限、ERA 核心、官网规则)须人批准用户要求 agent 自主运行、优化、分析轨迹;规则 §9 锁与锁之间由 agent 改配置不违规;撤销 2026-09-30“取消自动化第二层”的决定
理由与否决的方案

rules.md §9

否决:分级(第一周人批提示词改动);维持人工拍板

裁定:用户(grilling Q13、Q15、Q24) · 文档:G44、G45

2026-10-03强模型:VM 上的 LLM 中继持 Anthropic 凭据,Spark 经反向隧道调用,Spark 不存 Anthropic / OpenAI 凭据;draft 节点用 Opus,其余千问;回退链 Token Plan 千问 → 百炼按量千问 → Opus;Astra / Codex 只在 VM 小试;每次调用记 token 与轨迹对账Spark 能直连 api.anthropic.com 但连不上 OpenAI;用户要求所有 Claude / Codex 流量与凭据只在 VM;harness 无回退逻辑
理由与否决的方案

本次 curl 测试

否决:Spark 直接登录 Opus;只做网络隧道凭据留 Spark;全部换强模型;统一千问(会议建议)

裁定:用户(grilling Q5、Q11、Q20、Q22) · 文档:G42.5、新任务 G49 中继与回退

2026-10-03Researcher 开 lit-search 与 vec-data search,PLAN 写 data_requests;新增 Compliance 角色(正则 + 单轮 LLM)审 PLAN、检索文本、数据元数据,测量值删句标记,整段违规退回重写一次;新增 Data agent(多轮)执行 fetch → 隔离区 → 删窗 → 哈希 → catalog → 挂 external/dynamic/,数据永久存 data/external/ 跨 run 复用;节点记数据纪元;首批放行 GEO、CELLxGENE、figshare、CNGB;不设下载额度run 内角色之间此前没有合规检查环节;抓数据工具在锁内即不算人干预;中途挂载由 agent 自己完成,不违反 §9
理由与否决的方案

rules.md §9、§10

否决:Researcher 自己 fetch;不加 Data 角色(省会话);不检查靠 Reviewer 兜底;接受一天延迟不中途挂载

裁定:用户(grilling Q17、Q21、Q23、Q28) · 文档:G46 → 改为 run 内 Data agent + run 外 Scout 模式

2026-10-03知识口径按官网规则:允许带 DOI 的教科书发育事件顺序与细胞状态标记程序;仍禁保留阶段数据集的测量值(比例、表达量、类型清单、调色板);修 11 号文 §2、方向库、Researcher / Reviewer 任务书、check_knowledge;恢复 k048–k060 的顺序行;复审 k057 / k059(k061 继续排除);新增 T1 发育事件表作固定附件官网只禁实测数据;T1 难点是新状态出现而本地尺子新类型占比 0;10-03 用户“按官网要求就好”;本地规则与官网不一致时以官网为准,不过度解读,也不泄漏
理由与否决的方案

rules.md §10;G39-G43 计划 §0.2

否决:维持现状;只允许顺序不允许标记程序

裁定:用户(grilling Q4、Q10、Q24) · 文档:G42.2

2026-10-03T3 方法卡 v2 主线改为真实 Mab21l2 KO 细胞混入 WT E8.75 + celltype^β 压缩 + WT 稀释;self_zero 降为部件;每天 3 个 agent 模式 run 全交;提交披露输出含训练 KO 真实细胞公开日志该路线 66.6,位移迁移 / 文献先验 / 逐基因编辑全失败;与 T3 校准(lgo875 唯一排对 3 个官网点)一致;Mab21l2 KO 是官方训练数据
理由与否决的方案

notes/reports/dev/2026-10-03_ruler_calibration_t2extrap_t3.md

否决:只写进方向库;先问组委会

裁定:用户(grilling Q3、Q12) · 文档:G41

2026-10-03心脏外推用官网配额预注册扫坐标 RMS 缩放因子:3 个锁定 run,log s 取 0.15 / 0.30 / 0.45,护栏改为 proxy_noscale 非劣(LCB > −1),三份都交公开 Human 日志:改形态 14 族全部 ≤ 52,scale_only 54.5 且尺寸项满分;本地 proxy_noscale 测不到尺度;规则 §10 允许试参数看分
理由与否决的方案

github wqty123/virtual-embryo-challenge-methods;rules.md §10

否决:agent 在一个 run 内自己扫(终选只能交一份);等 10-20 三点拟合

裁定:用户(grilling Q8) · 文档:G40.3

2026-10-03T2 算力重排:心脏插值不再开新 run;四个任务(T1、T2 全胚插值、T2 心脏外推、T3)各一条 12 h run 链,每 run 并发 2、memory_max 32G,T3 用 agent 模式官网任务页:决赛 T2 只计全胚插值(E7.75)+ 心脏外推(E12.5);A 在 3 h 内从 58.6 爬到 63.2,12 h 够一条链
理由与否决的方案

tasks.md 官网快照

否决:心脏插值当试验田继续跑;4.5 h run 每天两环;四个 run 各 48G 靠准入排队

裁定:用户(grilling Q2、Q7) · 文档:G40、G45

2026-10-03tune 默认关闭(tune.p 0);工程仍叫 D;做 G39 八处搜索循环修正全部 D 组 run 40 个 tune 节点仅 1 个被接受(r2-D-s1 #16 +0.8);D 冠军祖先链无 tune;T2 D run 里 tune 占约 1/4 节点槽;去重 / 备选机制 / draft 时限 / 查分规则 / 相同代码树不执行 / --ablate 对照 / 删 B、C 默认入口
理由与否决的方案

轨迹报告 abcd_screen_trajectories_2026-10-03;Spark 全部 D run 的 archive

否决:保留 tune;改造版 tune(证据只有 2 个负样本);全删 tune 代码

裁定:用户(2026-10-03 grilling Q1) · 文档:notes/plan/tasks/G39-G43_plan_2026-10-03.md §1

2026-10-03工程定为 D(ERA + tune);B、C 停止投入同时跑、只差 tune 的三次对照 D 全胜:T1 53.4 vs 52.0、T2 心脏插值 63.9 vs 61.1、全胚插值 61.7 vs 59.9;B 49.5、C 47.8 不如 A。D 是 A 的超集(tune.p=0 即 A),选 D 无损。每榜一次、差 1.4–2.8 分,证据中等;以后不再常规跑 A 对照,需要时偶尔加一组。例外:T3 仍用 agent 模式(无可靠本地尺子,树搜索选不了节点);Codex Engineer 暂不支持 tune
理由与否决的方案

后续各轮官网分

否决:继续 A/D 双臂

裁定:用户确认(2026-10-03) · 文档:notes/changelogs/submissions.tsv

2026-10-03空闲资源再开三件:T2 插值 D 第三次重复(search_seed 2,用整合后的 harness:分项反馈 + T2 打分简报);VM 上换模型小试 2(Qwen 对 Astra,round-2 T1 设置但 tune 关闭,因 Codex Engineer 不支持 tune;4 h、Engineer 45 min,moscot 已装)用户:先继续做后面的(官网登录过期,T2 两份第二组 D 待登录后提交)
理由与否决的方案

T2 新官网分;两组模型的机制完成率与官网分

否决:—

裁定:用户(2026-10-03) · 文档:agent/configs/experiments/model_test/

2026-10-03下一轮 T1 开跑(不等泄漏修复);口径以官网规则为准用户:“不要过于谨慎,根据官网要求就好”。09:34 启动 t1_round2/D(search_seed 0)与 D_s1(search_seed 1),代码 master 659a312:目标 proxy10×1 + X3×2,护栏 objective 在新 seed 3–7 上单侧下界 > 0,起点 copy_last + ot_moscot + composition_trend,tune p 0.25,分项反馈 + T1 打分规则简报,4.5 h、并发 2。已知 proxy10 部分对 composition_trend 一系偏乐观(类型级文字泄漏、在旧 proxy 上调参),不违反官网规则;泄漏修复只做让尺子失效的(T2 外推尺寸项)和触及官网规则的,结果用于后续轮次
理由与否决的方案

两份官网分

否决:等修复后再开

裁定:用户(2026-10-03) · 文档:agent/configs/experiments/t1_round2/

2026-10-03停掉 T2 外推 D 组(20261003-070222),修本地尺子泄漏并全面排查T2 心脏外推的 proxy(E8.25+E8.75→E9.5)被泄漏:方向库/方法卡列出了 E9.5 的尺寸和细胞数,程序用由此算出的生长常数 0.58/天放大坐标,proxy 尺寸项白拿 +4(官网 49.6,无收益)。D 组 proxy 54.0 与此一致,继续跑没有信息量。修复:提示词里不给 proxy 目标阶段的统计量;外推榜目标改为去掉尺寸项的 proxy;加审计(提示词/知识库不得含 proxy 目标阶段统计,程序不得含由其算出的常数);同时排查 T1、T2 插值、T3 的同类问题;T3 方法卡删掉官方 baseline 42.5;T3 加非零比例护栏、打分服务里 Mab21l2 proxy 改名。下一轮 T1 等排查结论再开
理由与否决的方案

排查报告

否决:—

裁定:用户(2026-10-03) · 文档:notes/reports/dev/2026-10-03_ruler_calibration_t2extrap_t3.md

2026-10-03T2 插值榜 A 对 D:D 两个榜都更高(心脏插值 63.9 vs 61.1,全胚插值 61.7 vs 59.9)G24 完整 run(4 h,目标为本榜 proxy,护栏 margin 1),A、D 同时跑,只差 tune。连同 T1 初筛(D 53.4 vs A 52.0),三个榜 D 都高 1.4–2.8 分。主线 D 的证据加强(仍是每榜单次)
理由与否决的方案

下一轮 D

否决:—

裁定:(数据) · 文档:notes/changelogs/submissions.tsv

2026-10-03初筛官网结果:D 53.4、A 52.0、B 49.5、C 47.8(照抄 46.9);主线定为 D(ERA + tune)四组同一冻结设置(目标 X3、新 seed 上 X3 增益护栏、起点照抄 + ot_moscot)。本地 X3 与官网排序一致(D 61.9→53.4、A 63.0→52.0、B 60.5→49.5、C 50.8→47.8);A、D 冠军是同一类程序(类型级 PCA 位移 + 协方差/形状),D 多了调参。判据“D 不低于 A”满足。单次比较,差 1.4 分不作定论,但无反证。B、C 不再单独投入
理由与否决的方案

下一轮 D 的官网分

否决:A 为主线

裁定:用户预设判据(2026-10-02) · 文档:notes/changelogs/submissions.tsv

2026-10-02下一轮 T1:让 Agent 按官网的给分点优化(今晚就开始准备)1) 尺子按官网账本校准:每份已交 T1 预测在 proxy、proxy10、proxy2、X1、X3–X6 上与照抄配对打分,看哪把尺子与官网涨跌一致,选为下一轮目标与护栏(报告 notes/reports/dev/2026-10-03_ruler_calibration_official.md)。2) 把官网四项打分规则写进角色提示词,Agent 自测时显示四项分项分,而不只是总分。3) 方向库主推“组成变化与型内程序分开预测(带收缩)”和“局部谱系 OT(允许基因从关到开)”。4) 从 r1-A 冠军剥出组成趋势种子(去掉视图分支),走准入。均在隔离分支,次日合并后开下一轮(框架 D)
理由与否决的方案

校准报告;种子准入;改动后的回归

否决:等明早再开始

裁定:用户(2026-10-02) · 文档:notes/reports/dev/2026-10-02_mech_split_50.md

2026-10-02换模型小试开跑(VM):Engineer = Qwen 对 Astra(gpt-6-astra,xhigh,经 Codex CLI)两组从 A 派生,2 h、并发 1,其余三角色都是 Qwen;只差 Engineer 后端和 Astra 组多放行 chatgpt.com。Codex 关掉网页搜索、MCP、子 agent 等,只留 shell 和改文件;自带沙箱关闭,外层 bwrap 为边界;凭据放在 run 目录外的私有 CODEX_HOME,打包前扫描 token。代码在分支 worktree-agent-a8dcda2117e2a34ec(c94fb6f),VM 本地副本 ~/vec_vm 启动,23:13 开跑。VM 的 opencode 补上 Token Plan 凭据(gopass 管道写入)。判据:Astra 是否实现了 Qwen 做不出的机制并有可复测收益;这是“模型 + 客户端”组合对照
理由与否决的方案

两组的机制完成率、节点数、X3 分与官网分

否决:Spark 隧道方案

裁定:用户(2026-10-02) · 文档:agent/configs/experiments/model_test/

2026-10-02T3 允许使用模型自身的 Gata4 生物学背景知识(按官网规则)T3 快速基线的 agent 依据自身记忆的已发表 Gata4 生物学(Kuo 1997、Molkentin 1997 等)构建了 128 基因先验表,没有读任何外部数据文件。官网规则 §10 只禁止保留基因型的实测数据(及其训练出的模型、含其的数据集);模型自带的文献背景知识不属于数据。用户判定属于本来的生物背景知识,可以使用;提交时在方法说明里如实写明。这放宽了 2026-10-01 的项目口径(11_data_use_scope.md 第 81 行“Agent 自己记得的知识”一句),仅限通用生物背景知识;保留基因型的实测数据、数据集、在其上训练的模型仍然禁用
理由与否决的方案

T3 官网分

否决:不交并以更严提示重跑;先问组委会

裁定:用户(2026-10-02) · 文档:notes/competition/11_data_use_scope.md

2026-10-02主线框架倾向 D(A + tune),明早用初筛官网分确认D 是 A 的超集(p_tune=0 时与 A 逐位相同),初筛中途 X3 晋级分最高(61.3 vs A 59.6);但单次、X3 不一定迁移。判据:D 的官网分不低于 A 就以 D 为主线。T2 插值(尺子可靠)是 tune 最可能见效的场景,下一轮再试
理由与否决的方案

初筛 A/D 官网分

否决:—

裁定:用户提议(2026-10-02) · 文档:agent/search/tune.py

2026-10-02夜间(01:30–08:00)安排:初筛结束后自动打包,接着跑 G24 完整 T2 两个插值榜(各 4 h,ERA/A)T2 插值榜本地 proxy 与官网接近(59.6→62.9,61.5→60.0),是目前最可靠的提分点;T2 心脏外推本地高估,暂不投入;T1 不加长跑(等机制拆分和初筛官网分)。T3 完整 run 看今晚快速基线的官网分再定;VM 上 Qwen 对 Astra 小试在接入与冒烟通过后再跑。Spark 上的串联脚本 ~/vec/scratch/overnight_chain.sh
理由与否决的方案

两个 T2 插值榜的新官网分

否决:白天再跑

裁定:用户(2026-10-02) · 文档:agent/configs/experiments/g24_t2_t3/

2026-10-02官网 50.1/49.7 后的方向(与 Codex 讨论,notes/reports/reviews/2026-10-02_codex_direction_after_50.md)1) 今晚 ABCD 初筛跑完,不换目标重跑;之后暂停框架对比长跑。2) 撤回“proxy 已证明方向错”“X3 已证明正确”的说法;目标暂留 X3,proxy 作诊断。3) +3 分来源用本地评分器做机制拆分(随机照抄 / 代表性抽样 / 只组成 / 只型内选择 / 重采样无偏移 / 完整冠军),不占官网额度;不采用 Codex 建议的 3 份消融提交(人设计程序套 run 提交有违规风险,规则 §9)。4) 明早官网额度交初筛的不同预测(去重、去照抄回退),检验新 X3 增益是否迁移。5) 换模型做小试:只换 Engineer,Qwen 对 Astra xhigh,各 1.5–2 h,在 VM 上跑;Opus 之后再说
理由与否决的方案

初筛 4 份官网分;机制拆分四项贡献;Astra 小试的机制完成率

否决:立即换 proxy 重跑;四框架各交一份;3 份消融提交

裁定:用户(2026-10-02) · 文档:notes/reports/reviews/2026-10-02_codex_direction_after_50.md

2026-10-02T2/T3 今晚先跑快速基线 run(g24q)用户:“T2T3 先搞个基线,积累点数据”。没交过的榜在总分里算 0,所以每个榜先交一份合规的 Agent 产出最划算。从 G24 配置派生,只缩预算(1.5 h、并发 1、20G);目标、护栏(margin 1)、数据都不变。20:45 启动 4 个(T2 三榜 + T3),快照 db58927。完整的 G24 仍按计划 10-03 跑
理由与否决的方案

T2/T3 首份官网分

否决:等明天的完整 G24 run

裁定:用户(2026-10-02) · 文档:agent/configs/experiments/g24_quick/

2026-10-02ABCD 初筛开跑并预登记 4 份官网提交(用途:框架初筛)20:29 启动 20261002-202907-search-t1-scr-A、-202908-…-scr-B、-202908-…-scr-C、-202908-…-scr-D(代码快照 ef93068,配置 agent/configs/experiments/screen_abcd/)。每组的最终输出各交 1 份(含退回照抄的情况),记入 submissions.tsv,并记录各自在 X1/X3/X4/X5/X6 上的分;用途事先声明为“框架初筛”,单次比较不作定论;官网 T1 配额每天 8 次,本批用 4 次
理由与否决的方案

四份官网分;与 copy_last 46.9 的差

否决:—

裁定:用户(2026-10-02 “先跑 ABCD 初筛”) · 文档:agent/configs/experiments/screen_abcd/

2026-10-02ABCD 初筛起点集合 = copy_last(锚点)+ ot_moscot(探索态)按报告 §2 事先写定的准入规则:ot_moscot 在 X3/X1 上与 copy_last 分不开(X3 +0.53 [−1.45, +2.50],X1 +1.07 [−2.48, +4.63]),视图检查通过;cfm_flow、scvi_shift、composition 在 X3 或 X1 上可靠为负,拒绝;lineage_newtypes 在尺子上与照抄逐位相同但在 final 上改动约 1200 个细胞,尺子测不到,判为证据不足。ot_moscot 在 X4/X5 上为负,所以只给探索态(最多 3 个子节点,之后须有复测 X3 增益)
理由与否决的方案

初筛官网分;各组从 ot_moscot 出发的节点表现

否决:只用 copy_last

裁定:Claude(按用户授权的准入规则) · 文档:notes/reports/dev/2026-10-02_new_seeds_eval.md

2026-10-02G24 T2 三榜护栏 margin 0 → 1假后端端到端里 copy_last×0.98–1.02 的近似照抄在 proxy 上比 copy_last 高 0.8–1.4 分,能过 margin 0,但在 X2 上都低于 50;1 分约等于 T2 单次打分噪声
理由与否决的方案

G24 官网分

否决:margin 0

裁定:用户(2026-10-02) · 文档:agent/configs/experiments/g24_t2_t3/

2026-10-02T2 照常挂外部数据(Qiu 早期心脏 E8.75/E9.0、MOSTA E9.5)官网 2026-10-02 复核与 09-21 快照逐字一致:Rules §10 与 FAQ 允许所有任务使用外部数据,并给出 T2 的禁窗(心脏:严格介于 E8.25 与 E8.75 之间、E9.5 之后至 E13.5(含)、E10.5/E12.5;全胚:严格介于 E7.25 与 E8.0 之间);Data 页“只有 T1 可用外部公开单细胞数据”一句与之冲突,按规则条文和主办方 Slack 答复执行(11_data_use_scope.md 第 1 节)。E8.75/E9.0/E9.5 都在窗外(E8.75、E9.5 是边界阶段,明文允许)。提交时逐项披露来源和阶段
理由与否决的方案

官网首份 T2 分

否决:去掉 T2 外部挂载,只用官方数据

裁定:用户提议、Claude 官网复核(2026-10-02) · 文档:data/external/catalog.yaml; agent/configs/experiments/g24_t2_t3/

2026-10-02A/B/C/D 初筛的终选护栏:只用 X3初筛配置用新护栏但只要求 X3 在新 seed 上相对 copy_last 有提升(require_gain_on X3),X1/X6 只记录不拦;理由:X1 逐 seed 配对差 sd 约 2.4,5 个新 seed 时非劣下界比均值低约 3 分,几乎必回退照抄,初筛将无区分度;且 X1/X6 与官网相对 46.9 的结果不符。X1/X6 是否可靠用初筛的官网分检验,可靠后再加回护栏
理由与否决的方案

新护栏 fake e2e;官网校准

否决:新 seed 加到 10 个;容差放宽到 2 分

裁定:用户(2026-10-02) · 文档:agent/search/final.py

2026-10-02G24(T2/T3 首批 run)提前到 10-03排在 T1 A/B/C/D 初筛之后立即启动;目标是每个 T2 榜和 T3 至少有一份合规的 Agent 提交(总分按三个任务算,T2/T3 空白时即使接近地板也能大幅提升总分)
理由与否决的方案

当前总分只有 T1 47.8,前 10 门槛 188.8

否决:继续推迟

裁定:用户(2026-10-02) · 文档:notes/plan/tasks/G24_t2_t3_runs.md

2026-10-03本地尺子目标泄漏审计;T2 外推目标改 proxy_noscale;T3 本地 proxy 改名 + 稠密度护栏① 审计全部本地尺子目标在智能体可见材料里的统计量:T1 X3 / X1 / X4–X6 无泄漏;T1 proxy / proxy2 / proxy10(目标官方 E9.5)有类型级泄漏(方法卡类型清单、知识 k036/k043–k060 普查句、reweight.py 常数),已改文字、代码不改;T2 三榜方向库 / 方法卡 / 种子 README 给出 proxy 目标阶段的 RMS、细胞数、同名类型数,已全部改为由程序从输入现场计算;T3 方法卡的 Mab21l2 KO 测量值、官网 Gata4 分数(42.5、45.9、前 10 名分数段)删除。② T2:heart:val_extrap 目标改为 proxy_noscale(proxy 的 scale_log_ratio skill 固定为 copy_last 的值 0.5,再按官方聚合),原 proxy 只记录;g24_t2_t3/t2_heart_extrap*.yaml 已改,未启动。③ 打分服务的 T3 本地尺子改名 T3:gata4/proxy_mab21l2,旧 id 按新名字回答和记录,每个分数带 local proxy 标签;旧 run 可加载。④ T3 最终输出非零比例须在 WT 输入的 0.8–1.25 倍(harness verify 与 prepare_submission)。⑤ check_knowledge.py 新增 proxy-target 统计检查,默认只警告(--strict-proxy-targets 才失败)
理由与否决的方案

T2 外推节点 5 的 proxy +4.15 全部来自由 proxy 目标 E9.5 的 RMS 算出的回退增长率 0.58/天(校准报告 §3.2);不违反官方规则(E9.5 已发布),但尺子因此失效

否决:严格失败级的 check_knowledge 规则(用户:只要警告级);修改 heart_jcf_peri / reweight.py 常数(保留为回归与负对照);T1 第二轮等待本修复(用户:按 master 659a312 启动)

裁定:用户 2026-10-03 09:30(范围:按官方规则、不过度谨慎;T2 外推尺寸泄漏 + proxy_noscale;T3 改名 + 稠密度) · 文档:notes/reports/dev/2026-10-03_proxy_target_leak_audit.md; notes/reports/dev/2026-10-03_ruler_calibration_t2extrap_t3.md

2026-10-02目标暂用 X3,取代同日“X3+X6 平均”一行当前配置的搜索目标暂为 X3(真值 B 半);同日较早一行“目标=X3+X6 等权平均、护栏 X3+X1+X6”不再沿用:X4/X6 重叠、X6 方向与官网相对 46.9 的结果不符;不同目标(X3 / X3+X6 / X6)将用 A 做对照比较后再定;终选护栏按冻结前准备实现(X3 选候选,X1/X6 非劣,容差 1 分,置信下界,新 seed)
理由与否决的方案

官网 46.9 校准;Codex 重叠审计

否决:—

裁定:用户(2026-10-02 指示比较不同目标、实现新护栏) · 文档:notes/architecture/14_objective_rulers.md

2026-10-02官网校准后的方向(用户)① 官网评分器固定、结果固定,不测提交噪声、不重交同一文件;官网与本地不一致视为本地尺子的问题。② 先做“抽样 vs 完整”的影响实验(T1 官网上限 5118 细胞,完整 E9.5 无法提交,完整只在本地比较)。③ 撤回方法族禁令;旧版 pseudobulk_shift 仍作负对照;heart_jcf_peri 可申请准入。④ 有计划地攒“官网分 vs 本地尺子分”账本。⑤ 做 A/D 消融;并比较 A/B/C/D 四种方案、比较不同优化目标。⑥ 冻结前准备:统一评分口径、实现新护栏(X3 选候选,X1/X6 非劣)、回放护栏、合并代码。⑦ 文档立即修订
理由与否决的方案

官网 46.9 校准;Codex astra 讨论 notes/reports/reviews(待存档)

否决:—

裁定:用户(2026-10-02) · 文档:notes/changelogs/submissions.tsv

2026-10-02Slack 主办方确认补入现行规则11 号文补录 T2 心脏 >E13.5 外部数据、T3 GSE208162 的特定许可、P3 验证答案、Agent 配置锁、转换数据公开发布条件,以及 T1 文库与 T2 注释和尺度解释;保留预留阶段一切信息禁用的项目口径;12 号文清理已解决的许可待办,将预先备选和不传官方分标为项目策略,并按 10-02 G26 暂定方案记录 Qiu E9.25 训练、E9.5 继续测试
理由与否决的方案

用户同意将 Slack 核对结果补进现有规则文档;记录答复日期、原文和适用边界,避免旧说明覆盖明确更正

否决:将具体许可扩大到所有任务或扰动;把项目保守策略归因于官方禁令;因补录文档自动启用数据或修改运行配置

裁定:用户(同意补充规则);Codex 核对与整理 · 文档:notes/competition/11_data_use_scope.md; notes/competition/12_p3_protocol.md; notes/reports/reviews/2026-10-02_slack_rules_comparison.md

2026-10-02官网校准:我们流水线的 copy_last = 46.9(不是 50)机制检查 run(护栏交 copy_last 基线,5118 个随机 E9.5 细胞)官网 46.9。官方地板 50 = 评分器自己的 10% 参考样本原样提交(data.md:每阶段先抽 10%,E9.5 参考 1706 细胞,上限 5118);我们的照抄是另一批细胞,抽样差异被 DE 组当成错误方向的变化扣分。重算:G21 A/B/C/D 相对我们的 copy_last 为 +0.3/+0.9/+0.1/+0.3(均在单次噪声内)。G36“改错方向、低于照抄”的结论需修正;本地尺子以“低于 50”为参照的符号验证失效:X6、X1 把四个程序都判负(方向与官网相对 46.9 的结果不符),X3 对 B 罚 −5.9 而官网 B 最好
理由与否决的方案

官网提交结果;notes/official/来件/virtualembryo.ai/data.md

否决:—

裁定:Claude(事实记录,待与用户讨论后续) · 文档:notes/changelogs/submissions.tsv

2026-10-02目标改为 X3+X6 平均;护栏 X3+X1+X6;提交机制检查 run① 优化目标 = X3 与 X6(Imaz 心脏区,E8.0+14 体节→24 体节)等权平均(真值 B 半;Engineer 查分 A 半);护栏 = copy_last 基线在 X3、X1、X6 上均需被超过;X4/X5 只记录、作独立检验(消融主指标);proxy 只记录。② 机制检查 run(20261002-135403-search-t1-x3-era-mechcheck,护栏判定后交 copy_last)交 P2 一次,校准流水线 copy_last 的官网分(50 还是约 53)
理由与否决的方案

机制检查 run:X3 +1.0 的候选在 X1 上全部 −1.2 到 −2.8,单尺子目标过拟合;X6 是唯一把 G21 四个赢家全部判为低于 copy_last 的尺子(DE 信号弱,作目标的一半、主要约束方向/状态/共变)

否决:目标只用 X3;X3/X6/X1 三把平均(无独立护栏)

裁定:用户(2026-10-02) · 文档:notes/plan/tasks/G38_x6_whole_embryo_ruler.md

2026-10-02T1 方向库、draft 调度、起点三态① 方向库按 10 个方法族重写(局部 OT、OT-CFM、流形约束动力学、带生长项动力学、随机桥、图上命运转移、谱系约束分支生成、生成式表示、调控程序约束、低秩形状演化),只写定性机制/适用条件/最小预算/失败方式/文献,附“不要做”清单;带分数的实验账本单独管理,X1/X4/X5/X6 结果不写入方向库。② draft 30%:先无放回轮转覆盖(跨类别交错、跨 run 轮换规则锁定前定),覆盖后再按 X3 复测收益做受约束 bandit 并保留最低探索配额;新方法族首节点机制生效且无灾难退化即保证一次 improve 深化;算子分工 draft=新族最小版、improve=结构修复、tune=已证实机制调参、debug=运行修复;PLAN 记录实际实现的方法族与关闭机制的对照。③ 起点:copy_last 永久锚点 + 少量通过准入的方法种子;种子三态:探索(合规、机制生效、无可靠负证据)/ 活跃(X3 可重复收益、X1 无可靠退化)/ 最终(护栏);若无种子准入则只用 copy_last;pseudobulk_shift、heart_jcf_peri 只作回归与负对照;同一起点用于所有路线
理由与否决的方案

Codex gpt-6-astra 审阅 notes/reports/reviews/2026-10-02_codex_astra_ideas_draft.md

否决:保持 15% 与旧方向库;五个参考实现全部入池

裁定:用户(2026-10-02) · 文档:notes/reports/reviews/2026-10-02_codex_astra_ideas_draft.md

2026-10-02外部尺子标签方案与消融时序① 标签:A(修订映射表)与 B(官方 E8.5/E9.5 训练的分类器迁移,带拒判、拒判细胞保留)都做,按 Codex 设计的对照(只换标签,4 个有官网分的程序 + copy_last + 位移种子,检查分支一致、官网符号、≥3 seed 配对置信区间)选主方案;X3/X4/X5/X6 以 B 为主、A 作对照,X1 用保守 A;外部训练数据在模型用标签时统一接口,原作者标签保留审计。② 映射表分三级:精确 / 粗映射 / 未知;不再默认 anterior;统一取 E9.5 名只用于纯改名;原标签存 harness 侧。③ 消融等标签方案定后开;之前先跑一次 A 机制检查(新目标、护栏、伪装视图),不计入消融。不使用评分器冻结探针给输入打标(在目标上训练,会泄露)
理由与否决的方案

Codex 审阅 notes/reports/reviews/2026-10-02_codex_label_strategy.md

否决:只用 A;只用 B;用冻结探针

裁定:用户(2026-10-02 grilling 第 2 轮全部按推荐) · 文档:notes/architecture/14_objective_rulers.md

2026-10-02数据合规按任务执行;G26 暂定;消融主指标① Spark 数据合规按任务:每个任务的视图只用本任务允许的数据,原始文件可留在 Spark(过严会缺关键数据);例外:Qiu 整簇原始文件(含 T1 禁窗细胞、仅用于策展)已移到 Mac 保留,经 data/external/SPARK_EXCLUDE 不再同步到 Spark。② G26 暂定只把 Qiu E9.25 移入 P3 训练,E9.5 继续只做测试,10-20 前再讨论。③ A/D 消融主指标改为 X4/X5(X6 验证后加入)相对 copy_last 的平均提升,X1 因用于护栏降为次指标
理由与否决的方案

用户(2026-10-02 grilling 第 1 轮)

否决:严格模式(任何任务禁窗即移出)

裁定:用户(2026-10-02) · 文档:notes/architecture/14_objective_rulers.md

2026-10-02框架:A 为主线;A 对 D(A + tune)消融B 不再单独投入;C 不再作为独立臂。D = ERA + 廉价调参操作 tune(借鉴 C 修改轮思路,独立实现于 agent/search/tune.py,不依赖 OpenEvolve;p_tune 默认 0 时与 A 逐位一致)。消融:同一新目标(补丁 X3 + 对 copy_last 护栏 + 视图盲检查),两组同时、3 次重复 × 4.5 h;主指标 = 终选程序在未被优化的尺子 X1/X4/X5 上相对 copy_last 的平均提升(检验泛化),次指标 X3 提升、X3 与 X1/X4/X5 差距、效率;D 主指标高 ≥ 1 分且 3 次方向一致才采用,X3 涨而主指标不涨判为过拟合;两组各交 1 份最好结果到官网做最终裁判
理由与否决的方案

深度轨迹报告:A/B 分不出、种群几乎不起作用;C 快而浅、修改轮便宜但提升多 <1 分;tune 有省成本的潜力也有追噪声、过拟合 X3 的风险

否决:三组重跑;直接采用 D

裁定:用户(2026-10-02) · 文档:notes/reports/runs/abc_deep_2026-10-02.md

2026-10-02弃用 proxy / proxy2 作为优化目标proxy(E8.5→E9.5 单输入)与 proxy2(拼入 Qiu E9.0 心脏)不再进入搜索目标、Engineer 查分反馈与终选排序;仅在终选诊断里记录(历史对照)。短期目标:打补丁后的 X3(两输入外推,同发育时期)+ 相对 copy_last 的护栏,X1/X4/X5 记录;中期:新建 X6(Qiu 2024 全胚胎两输入外推,≤E9.5)并用官网分验证后定为正式目标
理由与否决的方案

G36 诊断:proxy 奖励的改动方向在 E9.5→E10.5 上是错的(官网全部 < 地板);proxy 只有一个输入,结构不符合外推;proxy2 程序不用额外输入时与 proxy 相同

否决:保留 proxy 作为目标之一

裁定:用户(2026-10-02) · 文档:notes/reports/dev/2026-10-02_G36_below_floor_diagnosis.md

2026-10-01A/B/C 改为工程对比(G21 快速校准之后)A/B/C 照跑但目的改为框架的工程效率对比:有效节点/小时、失败率、token 与时间成本、本地分爬升速度;不以分数论方法优劣(本地尺子已证实不能预测官网分)。改为 2 次重复 × 4.5 h(搜索 4h10m + 终选 20m),三组同时启动,每组并发 2,临时目标不变;同时 Claude 写“为什么官网低于地板 50”的诊断方案,次日上午给用户
理由与否决的方案

G21 快速校准:四臂官网 47.0–47.8 全部低于地板 50,本地分与官网排序不一致;用户认为训练时间短,Claude 指出 run2/c3 更长但官网同样 ≈47

否决:3 次 × 2h20m;今晚不跑 A/B/C

裁定:用户(2026-10-01,选方案 3) · 文档:scripts/abc_chain.sh

2026-10-01G21 快速校准:结果与判定(按预先写定的规则)官网 P2(T1:val):A proxy 47.2(本地 56.83)、B proxy2 47.8(本地 50.36)、C X3+X4+X5 47.0(本地 50.70)、D 五把等权 47.2(预测与 09-27 run2 逐字节相同,沿用其分数;本地 53.07)。判定:① 最高两臂 B 47.8 与 A/D 47.2 差 0.6 < 1 分 → 分不出,不选目标;③ 四臂官网分都 < 50 → 按规则不开长 run,先回到方法与尺子问题。本地分全部高估官网分(差 2.6–9.6 分),且本地排序(A>D>C>B)与官网排序(B>A=D>C)不一致:现有本地尺子都不能预测官网分
理由与否决的方案

预先登记的规则(同日行);4 次提交均为干净锁定 run 的终选输出

否决:—

裁定:用户提交;Claude 按规则判定 · 文档:notes/changelogs/submissions.tsv

2026-10-01G21 快速校准:判定规则(看结果前写定)4 个 run(A proxy / B proxy2 / C X3+X4+X5 / D 五把等权)各 1 次,1h15m(搜索 60 + 终选 15),并发 2,同时启动,每个会话内存预留 6G;每个 run 的 final 由用户交 P2。判定:① 后续正式 run 的目标 = 官网分最高的臂;若最高两臂差 < 1 分(P2 单次噪声量级)判为“分不出”,对这两臂补跑重复后再定,不硬选;② 各本地尺子(proxy、proxy2、X1、X3、X4、X5,B 半)与官网分的 Spearman ρ 用这 4 点 + 历史提交点计算,样本少,只作参考不作判定;③ 若 4 臂官网分都 < 50,不开长 run,先回到方法与尺子问题
理由与否决的方案

用户要求今晚出结果、先做校准再比较 A/B/C;原 3 次重复版本需约 2 天

否决:原设计 4×3 次重复;更短的 run(50/35 分钟,节点太少可能选中相同程序)

裁定:用户(2026-10-01) · 文档:agent/configs/experiments/g21_calibration/quick/

2026-10-01A/B/C 短试跑方案(今晚)T1:val;种子 pseudobulk_shift;临时目标;种群 60/3 岛/迁移间隔 10/迁移率 0.1;每次重复 A/B/C 三组同时启动、3 次重复串行;每组并发 2(全机 6 个会话);GPU 队列改为全机共用;每 run 2h20m = 搜索 2h + 终选预留 20min;准备好就开跑,至少 2 次重复(凌晨 2 点未就绪则只跑 2 次);通过标准:三组跑完、final/ 与三 seed 复测完成、基础设施失败 ≤10%、无遗留进程、verify 通过、有效节点 A/B≥8、C≥20,不设分数门槛;G21/G24 顺延到用户次日确认后;今晚只自动跑这 3 次重复
理由与否决的方案

用户要求 12 小时内(次日 10:00 前)完成三方案比较;终选实测几分钟(晋级每节点约 40 秒);同时段运行使供应商负载与机器状态相同

否决:串行(27h 跑不完);每组并发 3(9 会话,限流风险);减少数据量(瓶颈在 LLM,不在数据)

裁定:用户(2026-10-01,grilling 第 2 轮全部按推荐) · 文档:notes/plan/tasks/G35_route_c_native_lite.md

2026-10-01OpenEvolve 适配层目录名B/C 代码目录定为 agent/search/openevolve_adapter/(取代同日决定里的 agent/search/openevolve/)
理由与否决的方案

与上游包同名时,PYTHONPATH 含 agent/search 会让 import openevolve 加载本目录;改名比导入保护更简单

否决:保留同名 + 导入保护(upstream.ensure)

裁定:Claude(实施细节) · 文档:agent/search/openevolve_adapter/__init__.py

2026-10-01C 组定义:OpenEvolve 内核 + 查分修改轮C = 上游种群(含灵感程序)+ 上游 prompt/diff;每节点最多 3 轮 diff→沙箱跑+真值 A 半查分→修改,查分计入同一上限(≤20);回复须附 METHOD 说明(改了什么、知识与出处)生成 METHOD.md;灵感程序首轮只给 C,A/B 不给(之后另做消融);公共材料三组相同
理由与否决的方案

用户:内核是 OpenEvolve 即可,不必完全原生,目标是提高分数;METHOD.md 供审查与披露

否决:完全原生单次调用;C 改用 opencode 会话(与 B 重复)

裁定:用户(2026-10-01,grilling) · 文档:notes/plan/tasks/G35_route_c_native_lite.md

2026-10-01A/B/C 对照口径等墙钟 + 相同资源上限(token 只报告);冒烟与 2h 短试跑用临时目标,正式对照等 G21;三组同一个 T1 种子起步;三组串行、每次重复轮换顺序(ABC/BCA/CAB),组内并发 3;迁移用进程内带种子计数器替换 uuid4;上游 prompt 显示 bug 进程内补丁;两个补丁记进锁
理由与否决的方案

可归因、可重放、公平

否决:等节点数;等 token;三组并行

裁定:用户(2026-10-01,grilling) · 文档:notes/plan/tasks/G31L_population_strategy_lite.md

2026-10-01OpenEvolve 对照的仓库与架构分工ERA 是主线,doc 10 保持只写 ERA(只更新过时事实);OpenEvolve 版 harness 架构文档与对照计划放并列仓库 2026_virtual_embryo_openevolve(openevolve_comparison.md 迁过去);B/C 运行代码留主仓库 agent/search/openevolve/ 单目录,经 search.strategy / search.generator 两个接口接入,不配置不 import;比较完删目录即可
理由与否决的方案

一个 run 只依赖一个仓库(锁/快照/同步不变),同时保持 ERA 主线清晰、可整体删除

否决:B/C 代码放并列仓库跨仓 import(锁两个 SHA、快照两仓)

裁定:用户(2026-10-01,grilling 第 1–3 轮) · 文档:notes/plan/tasks/G35_route_c_native_lite.md

2026-10-01G21 预注册判定规则(看结果前写定)4 臂(A proxy / B proxy2 / C X3+X4+X5 / D 五把等权)× 3 次重复(search_seed 0/1/2),T1:val,每 run 2 小时、并发 3、X1 终检;每个 run 的终选输出各交 P2 一次;每个胜者在 proxy、proxy2、X1、X3、X4、X5 上都记分(B 半,seed 0–2 均值)。判定:① 12 小时 run 的目标 = 官网均分最高的臂;若最高两臂均分差 < 1 分(P2 单次噪声量级),选其中在本地尺子上方差更小者;② 本地尺子可信度 = 全部提交点上该尺子分与官网分的 Spearman ρ(bootstrap 95% CI,1000 次);③ 若所有臂官网均分都 < 50,则不开 12 小时 run,先回到方法与尺子问题(报告 Agent 出复盘)。
理由与否决的方案

run2 本地 55.97 → 官网 47.2:T1 替代题方向错;需用干净的锁定 run 校准搜索目标

否决:只跑 1 次/臂(统计太弱,已否决)

裁定:用户(2026-10-01 同意按建议),Claude 设计 · 文档:agent/configs/g21/;notes/plan/tasks/G21_calibration_runs.md

2026-10-01P3 视图以公开的验证答案为输入P3 测试视图输入 = 训练阶段 + 公布的验证阶段(T1 E10.5、心脏 E8.5/E10.5、全胚 E7.5、T3 Gata4 KO);11 号文 §4 对应问题从待问清单划掉
理由与否决的方案

data.md:38、283:最终阶段公布验证答案并成为训练材料;data.md:221:最终阶段心脏每个阶段都是训练输入

否决:先问组委会

裁定:用户(2026-10-01) · 文档:notes/competition/12_p3_protocol.md

2026-10-01P3 启用 p3_final 数据方案P3(10-20 起)T1 训练加入 Qiu E14.0–E18.75 与 E9.25/E9.5;X2/X4/X5 保留为测试题(参考价值下降,已登记跨来源重叠)
理由与否决的方案

rules.md:121 明文:T1 外推禁窗为 E9.5 之后至 E13.5(含),E13.5 之后的数据可用(须披露来源与阶段);规则只限数据时间点,不限插值/外推的建模方式;E14 给 E12.5 提供右端

否决:不启用(只外推)

裁定:用户(2026-10-01) · 文档:notes/plan/tasks/G26_p3_pipeline.md

2026-10-01报告 Agent(G28)每个 run 结束、每次官网分数入账、每次手动调试实验后,由 qwen3.8-max 基于事实包(各尺子分数、谱系、Analyst 经验、与上一 run 的配置差异、健康事件、官网分)生成中文迭代报告到 notes/reports/,数字只能来自事实包(后检查);Claude 审读后向用户汇报并提建议
理由与否决的方案

把每日人工复盘系统化

否决:—

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G28_report_agent.md

2026-10-01实验记录与溯源(G27)run 登记表 runs.tsv(启动/结束/官网分自动登记,配置必填 purpose/hypothesis)、可提交 run 打 git 标签 run/<id>、保存前 5 名与中选谱系的模型权重(含哈希清单)、四类轨迹分开(run 内部、人工操作、开发日志、官网提交)、消融协议(每臂≥3 次、单因素、提升=均差>噪声且 bootstrap CI 不含 0)与 scripts/ablation.py、面板加实验登记页
理由与否决的方案

用户要求一切可溯源、消融明确提升、轨迹区分

否决:—

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G27_records_provenance_ablation.md

2026-10-01P3 管线(G26)现在构建、P3 时启用:测试期视图(含公开验证阶段为输入)、用公开验证真值做本地尺子(P3 主目标)、外部数据 p3_final 配置(Qiu E14+ 与 E9.25–9.5 回到 T1 训练,启用前需用户确认)、P3 两次提交策略文档
理由与否决的方案

data.md:38 验证答案在 P3 成为训练材料;P3 每榜仅 2 次;E14+ 可给 E12.5 提供右端

否决:10-20 后再做

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G26_p3_pipeline.md

2026-10-01T2/T3 提前与运行位置(G24)10-20 前启动 T2 三个榜各一个搜索 run 与 T3 一个 agent run,各自提交 P2 作首个校准点;所有正式 run 只在 DGX Spark 上跑,虚拟机只做开发与假后端测试
理由与否决的方案

未提交的榜按 0 分;Agent 前 10 名 T2 60–68、T3 64–78;P2 到 10-20 结束

否决:等 T1 完成后再做 T2/T3

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G24_t2_t3_runs.md

2026-10-01修复批次(G23)按独立审查执行:真值分 A/B 两半(A 供 Engineer 查分、B 供正式分/复测/终选)、复测换评分器 seed、目标为可配权重的尺子组合并留一把只在终选看(holdout)、终选前 5 名;运维:节点完成后清理工作目录与磁盘水位、LLM 熔断(接口失败不进树)、内存准入、systemd 自动续跑与看门狗、锁记录视图文件哈希与模型 id;合规:操作日志与 tainted 标记、接续证据端到端验证。G21 改为每种目标重复 3 次、判定规则事先登记
理由与否决的方案

G0 显示 T1 替代分方向错误;审查发现同一半真值被反复拟合、多 seed 不换评分器 seed、磁盘 9 节点 16 GB 等

否决:只按原 G21 跑 4 个 run

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G23_objective_ops_compliance.md

2026-10-01跨 run 接续与最终 run 证据跨 run 接续(--continue-from)对开发 run 和最终 run 都允许:导入的旧节点与种子一样是锁定时固定的输入(§9 例二:锁定前读结果、加方法/方向再锁定运行属 Agent Team)。证据要求:中选节点整条祖先链的轨迹都打包(含来自旧 run 的段)并附来源 run 锁哈希,SELECTION.md 写明各祖先来源;被接续的 run 须为干净锁定 run(已提交代码、无人工改码)。tainted 标记照做(防锁定后人工干预)
理由与否决的方案

用户引用 §9:判断标准是锁定后是否有干预、配置是否变化,而非是否利用以往成果;证据须对应产生该文件的 run 且至少两类、含轨迹

否决:审查员建议:最终 run 禁止接续

裁定:人工(用户) · 文档:notes/plan/tasks/G18_search_continuity_promotion_proxy2.md

2026-10-01知识库禁窗审查(G22)按'预留阶段一切信息不能用'审查知识库与方向库:排除 k057、k059、k061;改写 17 条为不带禁窗时间、比例、类型清单的通用机制;T1-23 重写;方法卡与方法全景删去官网'E10.5 有 23 型/13 同名'等禁窗信息;新增 scripts/check_knowledge.py 自动拦截;检索跳过 excluded 条目
理由与否决的方案

用户修订口径:预留阶段的任何信息都不能用

否决:保留文献比例与窗内类型清单

裁定:人工(用户),Claude 审核 · 文档:scripts/check_knowledge.py

2026-10-01数据使用口径(再修订)任务预留阶段(含禁窗)和预留基因型的一切信息都不能用:除数据矩阵外,也包括由这些阶段测量得出的类型清单、比例、标记基因、表达、尺寸(无论来自文献、数据库、检索、模型或记忆);可用:已发布阶段信息、禁窗外数据、不针对禁窗阶段的通用机制知识(谱系、通路、注释)。知识库与方向库按此审查改写(G22);视图剥掉 uns.celltype_palette;Researcher/Engineer/审查提示词同步
理由与否决的方案

独立审查指出 k061(E10.5–E13.5 心脏 scRNA 比例与类型)等条目可能被认定为任何途径使用答案;用户:凡是预留阶段的数据都不能用

否决:文献知识全部放开(10-01 上午口径);先问组委会再定

裁定:人工(用户) · 文档:notes/competition/11_data_use_scope.md

2026-10-01T1 校准方式(G21)G19 校准批次不提交(C1/C2 为人写种子、C6 人工改写、C4/C5 为中间节点、C3 来自 dirty run,均不符合 §9 Agent Team 提交要求),只作本地参考;改为用 4 个干净的短锁定 run(仅搜索目标不同:proxy / proxy2 / 外部测试题 / 组合)各自终选后提交 P2,比较哪个目标搜出的结果官网最高;10-20 后再用公开验证真值全面校准
理由与否决的方案

规则 §9:提交必须是锁定 run 自己选出的最终输出;人只能选择提交哪个已完成的 run

否决:直接提交 C1–C6

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G21_objective_calibration_runs.md

2026-10-01Qiu 早期用途与外部测试扩充(G20)Qiu 早期心脏按阶段分角色:E8.75、E9.0 继续训练并可作测试题输入;E9.25、E9.5 改为只做测试答案(从训练移除);check_catalog 规则改为训练不得与测试答案重叠(输入可重叠)。新建 X3(Qiu E8.75+E9.0→E9.5)并调研再建 1–2 道 T1 类外部测试题(de Soysa 2019、Tyser 2021、Pijuan-Sala 等),用于校准哪把本地尺子跟官网一致
理由与否决的方案

G0:run2 本地替代分 55.97、X1 46.79、官网 47.2;当前替代题可能奖励取材漂移;X1 离 T1 窗口太远

否决:Qiu 早期全部做训练;全部改做测试

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G20_t1_external_tests.md

2026-10-01T1 两输入替代题(R3)新增 T1 proxy2:官方 E8.5 + Qiu E9.0(外部,作输入)→ 官方 E9.5;节点分 = proxy 与 proxy2 均值(权重可配);两分都展示;说明 proxy2 比 final 容易且跨数据集,只为给两时间点方法公平信号
理由与否决的方案

主流动力学方法(OT、ODE、流匹配)需要 ≥2 时间点,原 T1 proxy 只有 1 个输入,会系统性冷落它们

否决:让 X1 参与搜索(失去独立测试集);不动

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G18_search_continuity_promotion_proxy2.md

2026-10-01晋级复测(R2)节点 seed 0 分进入前 5 名时自动补跑 seed 1、2,以 3 seed 均值作排名分;终选沿用
理由与否决的方案

T1 打分噪声约 2 分,单 seed 排名会追噪声;快速评分器让复测成本低

否决:只在终选做多 seed

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G18_search_continuity_promotion_proxy2.md

2026-10-01跨 run 接续存档(R1)新 run 可 --continue-from 导入以往 run 的全部节点(代码、PLAN、ANALYSIS、分数、父子、访问次数),树持续长大;评分口径指纹相同则沿用分数,否则重打前 20 名、其余作历史不可做父节点;最终 run 仍用种子
理由与否决的方案

ERA 树要 300–1000 节点才饱和,单 run 约 60 节点且每次清零

否决:每 run 新树只带最佳程序作种子

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G18_search_continuity_promotion_proxy2.md

2026-10-01T1 方法与知识(G16)新增 T1 方法全景(T1_methods_landscape.md)、知识条目 k031–k063(方法/代码 12、生物学 21,含 E10.5 前后类型与文献比例,Claude 审核)、方向 T1-18~23;Spark venv 预装 moscot/ott-jax+jax[cuda13]、wot、torchcfm、torchdyn、torchsde、torchdiffeq、geomloss、scvi-tools、palantir、cellrank 2.3.3、decoupler、igraph/leidenalg,沙箱断网冒烟 11/11 通过,原有包版本不变;预训练权重无一合格(含小鼠者无法证明排除禁窗,Navigo 点名禁止);JAX 显存需在 gpu_env 设上限(交 G17)
理由与否决的方案

沙箱不能 pip、不能联网,已发表代码必须预装;方法全景让 Agent 知道主流方法

否决:不预装、让 Agent 自写;下载 UCE/GeneCompass 等小鼠基础模型权重

裁定:人工(用户),Claude 审核 · 文档:agent/knowledge/T1_methods_landscape.md

2026-10-01Researcher 文献检索(G17)Researcher 可用 lit-search:宿主机服务持 key(PubMed、OpenAlex、Europe PMC 全文、Exa、Tavily、arXiv、bioRxiv),沙箱只有 socket,网络仍仅 LLM;只取文字不下载文件;每次调用≤10 次;全部检索原文留痕进证据;复用 Gene Vectors 平台 literature 工具的检索部分(剔除补充材料下载与科研通);NCBI/OpenAlex 不附用户邮箱
理由与否决的方案

沙箱不能联网,Researcher 需要最新方法与生物背景;key 不进沙箱

否决:Researcher 直接联网;不开检索

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G17_lit_search.md

2026-10-01并发与 Researcher(H2–H4)默认 concurrency.nodes=3(并发 5 在 G7 冒烟测试);Researcher 上下文内联单轮调用、thinking_budget 8192、时限 15 分钟、180 秒无输出则重试;BM25 检索排除 k014
理由与否决的方案

实测 Researcher 4–9 分钟源于 6–11 轮读文件 + 每轮 1–1.6 万推理 token;一次超时是接口卡住(600 秒仅 46 token);k014 因噪声相关词每次排第一

否决:保持 2 路并发;Researcher 自己读文件

裁定:人工(用户),Claude 建议 · 文档:agent/configs/search_t1.yaml

2026-10-01终选与外部测试题(H1)外部测试题 X1/X2 在终选时只记录、不淘汰:终选只按审查通过的前 3 名 3 个 seed 替代分均值;X1/X2 分数写进 SELECTION.md 诊断节,供人在锁定前改进 harness(补知识、模型、方向);是否让外部测试题参与决策,等 P2 校准后在 run 之间决定
理由与否决的方案

硬淘汰曾使一个 run 交出 copy_last;X1 考的是晚期成熟,T1 专用方法(如 heart_jcf_peri)在 X1 低于地板不代表在 T1 差;搜索阶段节点本就看不到 X1,改动不影响 Agent 判断

否决:低于地板 2 分即淘汰;低于 10 分才淘汰

裁定:人工(用户),Claude 建议 · 文档:agent/search/controller.py

2026-10-01数据使用口径简化严格按官网两档:不能用=保留阶段/基因型的实测数据(原始数据、表达矩阵含补充表达表、含其的数据集未删窗、在其上训练的模型、分数反推);能用=其余一切(窗外外部数据、预训练模型、已发表代码、文献生物学知识含谱系/类型/比例/标记基因),全部披露、METHOD.md 注明来源。禁窗按任务分别算。取消并集口径与方法类限定;保留训练/测试不重叠与 proxy 外部数据过滤(评估可信性)
理由与否决的方案

用户:规则禁止的是实测数据;生物背景知识对建模必要;不再加额外界限

否决:四档界线(定量比例先问组委会)

裁定:人工(用户) · 文档:notes/competition/11_data_use_scope.md

2026-10-01proxy 外部数据(修正)proxy 视图的外部数据过滤照搬官方禁窗规则并相对 proxy 目标:外推型 proxy 只保留 ≤ 最后输入阶段;插值型 proxy 另外剔除落在两个括号输入之间开区间的样本(心脏插值 (8.25, 9.5)、全胚插值 (6.75, 8.0)),括号端点本身允许。当前结果:T1 无;心脏外推 Qiu E8.75;心脏插值 Qiu E9.5 与 MOSTA E9.5;全胚无
理由与否决的方案

原规则只按外推设计,心脏插值 proxy 会挂进恰为 proxy 答案阶段的 Qiu E8.75(G15 审查发现)

否决:仅 ≤ 最后输入阶段

裁定:人工(用户)规则,Claude 修正 · 文档:notes/competition/11_data_use_scope.md

2026-09-30生物先验知识库 G12新增 data/external/prior/:Reactome、GO、CollecTRI(剔除 Gata4/Ctnnb1 敲除来源)、STRING 高置信 PPI、可选 MSigDB MH;只读挂进所有视图的 prior/;方向库加 3–4 条用法;KEGG 与含禁窗来源的标记库/嵌入不用
理由与否决的方案

沙箱不能联网,生物背景知识必须锁定前准备;是否有效交给搜索检验

否决:不加先验;运行时联网检索

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G12_prior_knowledge.md

2026-09-30LLM 记忆与预训练模型search_spec 禁止把保留阶段/基因型的具体生物学事实写进代码(类型、比例、标记、表达);审查检查此条;任何预训练模型或基因嵌入先查训练数据,含禁窗阶段或保留基因型即不用
理由与否决的方案

规则 §10:任何途径(含在其上预训练的模型)都不能用保留数据;LLM 记忆无法完全阻止,但可禁止写入

否决:不做约束

裁定:人工(用户),Claude 建议 · 文档:agent/prompts/search_spec.md

2026-09-30数据使用范围文档新增 notes/competition/11_data_use_scope.md:规则 §10/§16 与条款 §14 逐句要点、我们的执行口径、当前在用数据清单、最终提交前建议集中问组委会的 5 个问题
理由与否决的方案

规则分散在多处;规则明确鼓励拿不准先问且事先答复不算违规

否决:—

裁定:人工(用户) · 文档:notes/competition/11_data_use_scope.md

2026-09-30搜索并发默认 concurrency.nodes=2 起步;G6 在 Spark 真实测试中加并发 3 对比(每节点/每角色耗时、GPU 与打分排队、vec.slice 内存峰值、CPU、Token Plan 限流),据数据定默认值,资源有余则提到 3–4
理由与否决的方案

一个节点约 50–60 分钟,并发决定 12 小时节点数(2→20–24,3→30–36);瓶颈在单 GPU、T1 打分约 24 GB、18 核、Token Plan 限额

否决:直接定死 2;直接上 4

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G6_layer1_controller.md

2026-09-30proxy 外部数据proxy 视图只挂外部训练数据中 ≤ 该视图最后一个输入阶段的部分(T1 proxy ≤ E8.5,目前为空);final 视图按该设置允许的全部训练数据挂载。视图构造(G6)按此实现
理由与否决的方案

保持 proxy 与 final 的信息条件一致:final 没有目标阶段附近的外部数据(禁窗),proxy 也不能有,否则替代分虚高、搜索偏向依赖外部数据的方法

否决:proxy 完全不挂外部数据;不限制只靠对照

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G6_layer1_controller.md

2026-09-30外部数据 F2 结论MOSTA 数据许可落实:用户 2026-09-30 查阅 CNGB 全站条款(https://db.cngb.org/terms/)后确认可用于本项目;MOSTA 页面声明数据 available for the research community,要求引用 Chen et al. 2022 Cell 185(10):1777–1792(论文 CC BY 4.0)。catalog 中 mosta 相关条目改为已核实,并写入上述依据(待 G11 完成后更新)
理由与否决的方案

F2 要求最终提交前核实

否决:联系 CNGB/作者书面确认

裁定:人工(用户) · 文档:data/external/catalog.yaml

2026-09-30外部数据 F3 Qiu 晚期用途Qiu E14–E17 全部留作 T1 类外部测试题(3 个时间点,相邻天合并增加细胞数),不进训练;训练改用 Qiu 所有窗外早期胚胎(E8.75、E9.0、E9.25–9.5);在 G11 执行,v0 的 E15.0/E16.75 训练文件届时移除
理由与否决的方案

同一阶段不能既训练又测试;晚期心脏细胞少;E14+ 对预测 E10.5 帮助有限(09-24 分析)

否决:晚期做训练、T1 测试题另找数据

裁定:人工(用户),Claude 建议 · 文档:notes/plan/README.md

2026-09-30外部数据 F2 MOSTA 许可MOSTA E9.5 训练数据先用;由用户联系 CNGB/作者确认数据许可;最终提交前仍未核实则最终 run 不挂载它
理由与否决的方案

与 D4 一致;论文 CC BY 4.0 但 CNGB 未写数据许可

否决:现在就停用

裁定:人工(用户),Claude 建议 · 文档:data/external/catalog.yaml

2026-09-30外部数据 F1 分期冲突Qiu embryo_15–17 按体节数(16–18 节 = E9.0,与作者标注一致)分期并保留;CELLxGENE 的 Theiler TS14(通用范围 E8.5–9.75)只记录不用于判定;catalog 与披露写明依据
理由与否决的方案

体节数是对这些胚胎的精细测量,TS 只是粗范围;E9.0 距禁窗边界 0.5 天;删掉会损失全部早期心脏细胞

否决:按 TS14 区间保守删除;问组委会(暂不问)

裁定:人工(用户),Claude 建议 · 文档:data/external/catalog.yaml

2026-09-30搜索 E7 框架以 ERA futs.py 为核心(原样拷贝进 agent/search/,含上游测试),照 DrugEvolve 补 Researcher(出方案)/ Engineer(opencode 会话实现+训练+调试,兼 Debugger)/ Analyst(分析报告);继承代码而非思路;OpenEvolve 与 DrugEvolve 以后再学;用户的 2026_ERA 目录继续做实验场
理由与否决的方案

ERA 只覆盖 DrugEvolve 的 Engineer 部分;锁、证据、沙箱都在本仓库

否决:引入 OpenEvolve 或 DrugEvolve 整套框架;在 2026_ERA 目录里开发

裁定:人工(用户) · 文档:notes/plan/tasks/G6_layer1_controller.md

2026-09-30搜索 E6 思考强度qwen3.8-max 按角色设:Researcher 默认、Engineer thinking_budget≈4096、Analyst≈2048,经 opencode 配置透传;首个真实节点实测后再定
理由与否决的方案

实测简单任务:默认 14s、1024 预算 12s、关闭思考 6s;Engineer 一会话数十次调用

否决:统一关闭思考;统一默认

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30搜索 E5 去重暂不加 Inspector 方案去重;首轮 7×24 后若实验表显示重复严重再加
理由与否决的方案

每加一步多一个失败点

否决:DrugEvolve 式 Inspector

裁定:人工(用户) · 文档:notes/plan/tasks/G6_layer1_controller.md

2026-09-30搜索 E4 测试官网 P2 作独立测试集(每 run 交最佳与次佳);外部小鼠窗外测试题(如 Qiu E14→E15→E16、MOSTA E14.5+E16.5→E15.5)只在终选时用于排除崩溃方法,不参与搜索;测试用阶段不进训练
理由与否决的方案

同一替代评测反复挑选会偏乐观

否决:外部测试作第二个搜索分数;反向替代题;切目标细胞留出集

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30搜索 E3 知识来源方向库 ideas_<board>.md(draft 节点轮换指定)+ DrugEvolve 式文献库 agent/knowledge/(离线 BM25 检索前 3 条);文献库只收方法类条目,保留阶段的生物学描述一律不收,逐条由 Claude 审核
理由与否决的方案

模型大多只调参因缺方向;文献里保留阶段的事实来自其实测数据,可能构成间接使用

否决:不注入;文献什么都收

裁定:人工(用户),Claude 建议 · 文档:agent/knowledge/

2026-09-30搜索 E2 节点间信息每节点执行后加 Analyst(一次 LLM 调用)写 ANALYSIS.json,输入为程序生成的相对父节点变化量表、diff、PLAN、会话说明;后续节点看父节点完整报告、兄弟与前几名摘要,变化量表原样附上
理由与否决的方案

避免重复试错、给出方向;原始数字保留以防 Analyst 偏见累积

否决:只用程序生成的实验表(Q4 旧口径)

裁定:人工(用户) · 文档:notes/plan/tasks/G6_layer1_controller.md

2026-09-30搜索 E1 选父节点futs.py 原样拷贝;包装层加虚拟访问(并发时不选同一父节点)、连续 2 个子节点失败暂停其父节点资格、同分平均排名;会话被告知父节点耗时与预算
理由与否决的方案

ERA 实测节点 9 连选 5 次 4 次超时:原因是生成程序跑太久(非 grok 不稳定),且 argmax 确定性

否决:改成随机抽样;保持原样

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30第二层取消取消自动化第二层(harness 自优化)。harness 改进改为人工:Claude 每日读第一层轨迹写改进建议,用户拍板,改任务书/方法卡/搜索参数后开新 run,每次记 decisions.tsv;外部数据转为只做训练,考题不再扩展
理由与否决的方案

目标是最高分,分数只取决于第一层最佳程序;第二层评估贵(每代数小时×3 seed)且噪声大(打分约 1 分噪声)、考题以斑马鱼为主与小鼠目标不同;锁定前人工改 harness 规则明确允许且更快更准

否决:完整第二层;轻量第二层(自动调搜索参数)暂不做,有富余时间再议

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30Spark 访问与常驻(S3)虚拟机经 Mac 反向隧道访问 Spark(Mac tmux spark-tunnel:ssh -p 2222 -R 127.0.0.1:2201:192.168.5.84:22);ssh 别名 spark;linger 已开启,用户服务退出登录后继续运行
理由与否决的方案

虚拟机(QEMU user-mode + mihomo TUN)访问不到局域网和宿主机,Mac→虚拟机 hostfwd 可用

否决:桥接网络;Mac 远程登录做 ProxyJump(虚拟机连不到 10.0.2.2)

裁定:人工(用户) · 文档:~/.ssh/config

2026-09-30Spark 资源上限(S2)~/.config/systemd/user/vec.slice:MemoryHigh 90G、MemoryMax 96G、Swap 8G、CPUQuota 1800%;所有 run/会话/打分单元放进该切片;统一内存下 GPU 显存是否计入待 G5 实测
理由与否决的方案

共用机器(用户 spark 的桌面会话、root 常驻 decimer/OpenDeepWiki/docker),当前无计算任务,后续基本只有本项目

否决:独占整机

裁定:人工(用户),Claude 建议 · 文档:notes/plan/README.md

2026-09-30Spark 上的 LLM(S1)Spark 上 run 内研究 Agent 用 opencode + alibaba-token-plan-cn/qwen3.8-max(Token Plan,北京节点);key 从 gopass services/aliyun-token-plan 管道写入 Spark 的 opencode auth.json(600),不落对话;已测通工具调用
理由与否决的方案

Spark 访问不到 api.x.ai、huggingface;百炼国内节点可达

否决:经虚拟机中转 grok;Spark 装个人代理

裁定:人工(用户) · 文档:agent/configs/

2026-09-30外部数据合规 D5考题数据也在方法说明里披露(用于 harness 开发评估)
理由与否决的方案

规则未写明处保守处理、全部披露

否决:只披露训练数据

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30外部数据合规 D4数据许可未核实的考题数据(Zebrahub、MOSTA)先用并标记,最终提交前核实,核实不了就换
理由与否决的方案

只做考题,不进预测文件

否决:核实前不用

裁定:人工(用户),Claude 建议 · 文档:data/external/catalog.yaml

2026-09-30外部数据合规 D3Qiu 2024 ≥E14 合规数据放进训练,怎么用由搜索检验;方法卡保留风险提示(窗内新状态两端不可见)
理由与否决的方案

合规数据的用法是方法问题不是合规问题

否决:只作晚期先验、禁止作外推右端(09-24 旧口径)

裁定:人工(用户),Claude 建议 · 文档:agent/prompts/method_cards_t1.md

2026-09-30外部数据合规 D2同一数据集可按阶段拆成训练与考题(如 MOSTA E9.5 训练、E14.5–16.5 考题),同一阶段绝不两用,目录标清
理由与否决的方案

E9.5 小鼠空间数据对心脏外推价值高

否决:一个数据集只能一种用途

裁定:人工(用户),Claude 建议 · 文档:data/external/catalog.yaml

2026-09-30外部数据合规 D1禁窗按设置(setting)算:两个心脏榜共用 (8.25,8.75) 与 (9.5,13.5];T1 (9.5,13.5];全胚 (7.25,8.0);分期不确定按区间,碰窗即排除
理由与否决的方案

保留阶段数据任何途径都不能用;心脏设置的保留阶段含 E10.5

否决:按单个榜算(心脏插值可用 E11)

裁定:人工(用户),Claude 建议 · 文档:notes/plan/tasks/G3_data_curation_v0.md

2026-09-30组委会与提交暂不问组委会,规则未写明处按保守理解并全披露;官网提交先半自动(脚本备文件和证据、人点提交),摸顺后再全自动;5090 用 SSH 密钥
理由与否决的方案

先把框架搭起来;登录态和提交放沙箱外

否决:立即做全自动提交;在对话里传密码

裁定:人工(用户) · 文档:notes/plan/README.md

2026-09-30外部数据训练只用小鼠窗外数据,按榜标注可用榜;考题用外部数据(Zebrahub、MOSTA E14.5+ 起步,扩到 ZSCAPE/Briggs/ZESTA),按所有禁窗并集;一个数据集只标一种用途;禁窗内细胞下载后先删,不训练也不测试;先用抽样数据搭流程
理由与否决的方案

跨物种轨迹差异大,训练易负优化;禁窗数据任何途径都不能用,包括只做评价

否决:非小鼠数据参与训练;禁窗数据只做测试;鸡/人心脏、小鼠类胚体(风险高)

裁定:人工(用户) · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30第二层机制白名单内可改(任务书、方法卡、搜索参数、上下文策略、工具),评分器/打分服务/视图/数据目录/合规/锁与打包禁改;外部考题上缩短版第一层 ×3 seed 配对检验才采纳;两层交替
理由与否决的方案

防止第二层把尺子改松;单 seed 排名不可信

否决:用 T1/T2 替代评测当考题(会背答案,且与第一层优化对象冲突);用官网分数

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30第一层机制节点 = worktree 内 45 min opencode 会话,并发 3,GPU 排队;输入父代码 + 程序生成的全树实验表;打分服务在沙箱外、每节点 ≤20 次、正式分由 harness 重跑;前 10% 节点另开会话审查;bwrap 文件隔离 + LLM 域名白名单
理由与否决的方案

run2 的效率来自会话内快速筛选;评分器与目标须在 Agent 够不着处;强模型会钻评分漏洞

否决:生成器不能查分(ERA 原版);只传父节点;评分器留在沙箱内

裁定:人工(用户),Claude 建议 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30框架选型方案 A:自写薄控制器(拷 ERA futs、参考 headless-cli;借 Shinka/MLEvolve/Vesper 思路;第二层照 Meta-Harness)
理由与否决的方案

无现成框架支持完整 opencode 会话作变异算子;合规部件无论如何自写;第一层须小而透明,第二层才改得动

否决:Kapso;魔改 OpenEvolve/ShinkaEvolve;DGM/HyperAgents 代码(后者 NC 许可)

裁定:人工(用户),Claude 建议 · 文档:notes/research/agent_framework_options.md

2026-09-30Agent 平台目标5090 上 7×24 两层自优化:第一层 ERA 式算法搜索(选、组合、训练模型),第二层读轨迹改 harness;开发属锁定前,最终只提交一个锁定 run(最后一版 harness + 开发期最佳程序作种子,24–48 h,自动终选)
理由与否决的方案

规则 §9 锁定前一切允许;证据只需最终 run,规避 600 MB 上限

否决:把 7×24 整体做成一个锁定 run;第二层做成锁定元 run

裁定:人工(用户) · 文档:notes/competition/10_harness_era_architecture.md

2026-09-30Agent 架构锁定 harness 内加 ERA 式程序搜索(FUTS 选父节点 + 每节点一个 opencode 会话 + bwrap 隔离执行 + 主仓库评分);保留单 Agent 模式作基线和 T3
理由与否决的方案

run2 用 8% 预算就收工、贪心单线、评分器可被 Agent 修改、替代目标可读;challenge 页明确接受 LLM 进化式系统

否决:直接用 ERA 仓库代码(无持久化、标量反馈、同分排名偏置);04 的多角色递归架构;只改任务书要求用满预算

裁定:Claude 提案,用户定方向 · 文档:notes/competition/10_harness_era_architecture.md

2026-09-27run 预算计时仍按挂钟时间(停机也计时);靠 systemd 脱离、内存上限、自动重启避免停机
理由与否决的方案

保持锁定配置语义简单

否决:只计实际运行时间

裁定:人工(用户) · 文档:agent/harness.py

2026-09-27任务顺序T1 做完再做 T2,T2 做完再做 T3;每个锁定 run 只跑当前任务(run2 = T1)
理由与否决的方案

run1 同时摊在 5 个榜、1.5 h 内每个都浅尝辄止,T1 只比地板高 0.4

否决:每个 run 全 5 榜并行

裁定:人工(用户) · 文档:agent/configs/t1.yaml

2026-09-24harness 崩溃续跑崩溃(含退出码 0 但有致命错误)自动用同一会话 + 固定续跑提示词重启,最多 max_restarts 次,写入轨迹
理由与否决的方案

规则 §9:配置不变的重启是同一个 run;grok 曾中途 OAuth 失效

否决:人工手动 resume

裁定:Claude · 文档:agent/harness.py

2026-09-24参赛模型早期锁定 run 与脏活用 opencode + grok-4.7;codex GPT-6、Gemini 3.8 Flash、Qwen3.8-Max、GLM-5.3 可早期试;最终冲刺用 Claude Code + Opus 5.5
理由与否决的方案

订阅制,Claude 额度贵;每次提交各自申报框架与模型,可多配置跑后择优

否决:全程只用 Opus

裁定:人工(用户) · 文档:agent/configs/example.yaml

2026-09-24T1 外部数据Qiu 2024 删窗(E9.5 后至 E13.5,含 27 体节起)后可用;E14+ 作右端规则允许,先作晚期表达先验,与纯外推比替代分再定
理由与否决的方案

规则禁窗内测量而非窗外数据的用法;MOCA 删窗后只剩 E9.5

否决:下载 MOCA 或 Qiu 全时期直接训练;grok 原稿「禁止 E9.5 与 E14 插值」(把建模判断写成规则)

裁定:Claude 审改 · 文档:notes/competition/09_t1_census_lineage.md

2026-09-24T1 不确定边NCC-derived 和 ST 不写唯一亲本
理由与否决的方案

NCC 与轴旁中胚层余弦只差 0.003;ST 的 OT 第 1 是 EXEM(0.309),JCF 第 2(0.239)

否决:把 NCC 到 NCC-derived 写死,或改用 EXEM 作为 ST 来源

裁定:Claude 审过 · 文档:notes/competition/09_t1_census_lineage.md

2026-09-24T1 改名V-CM 和 Endocardium 按改名带进 E10.5,不再当新出生
理由与否决的方案

V-CM 对 LV-CM 余弦 0.992,LV+RV 流入 0.565;Endocardium 对 Endothelium 余弦 0.988,流入 0.739

否决:把这两型当成 E9.5 才分化出的新状态

裁定:Claude 审过 · 文档:notes/competition/09_t1_census_lineage.md

2026-09-24T1 BECBEC 是血液内皮,生成时从 Endothelium 来,不从前肠来
理由与否决的方案

Krt19+Epcam 均值对数 0.025,Kdr+Pecam1 为 3.739;不平衡 OT 的 0.770 来自 Endothelium

否决:把 BEC 当初胆上皮或肝芽分支

裁定:Claude 审过 · 文档:notes/competition/09_t1_census_lineage.md

2026-09-24参赛身份以公司(华大)员工身份参赛
理由与否决的方案

公司已允许;规则 §3 要求员工身份队员来自同一单位、不可混合身份

否决:个人身份

裁定:人工(用户) · 文档:notes/来件/virtualembryo.ai/rules.md

2026-09-24算力策略本机(QEMU 虚拟机 CPU,可选宿主机 MPS)小样本确定架构与算法;RTX 5090 做正式训练;代码设备无关、规模参数化
理由与否决的方案

虚拟机无 GPU 直通(virtio 仅显示);T2/T3 与 OT/PCA 类方法 CPU 足够;先定方法再花 GPU 时间

否决:一开始就上 5090 大模型

裁定:人工(用户) · 文档:notes/plan/README.md

2026-09-24替代评测口径5 榜用训练阶段做替代评测;组内指标等权;T2 结构门控 = 形状分 × min(邻域分/0.5, 1)
理由与否决的方案

官方只给组权重和「形状乘邻域结构」;pseudobulk_shift 心脏外推替代分 48.8 与官方反推 47.7 同侧且接近

否决:门控写成 邻域分/0.5 不封顶(会给形状加分)

裁定:自检(Claude 审 grok) · 文档:modeling/src/common/evaluation/proxy.py

2026-09-23Biomedical world model吸收 Cell Perspective 的条件状态转移、群体级动力学和长程评估框架;作为 T1/T2/T3 的问题定义与 Agent 审计参考,不改变 T1 当前谱系加混合生成路线
理由与否决的方案

VEC 数据是破坏性横截面且干预覆盖稀疏,文章的纵向测量和因果验证条件当前并不具备;观点不能替代官方分数和本地实验

否决:直接将 Perspective 当作可复现算法或因果 KO 证据

裁定:人工(用户) · 文档:notes/competition/07_biomedical_world_models.md

2026-09-21JEPA/OPF 选型不采纳 JEPA-Anything(OPF)作为 T1 架构,降级为 T2 候选;对照与晋级口径写进 03 第 4 节,artifacts 那份备忘标已取代
理由与否决的方案

T1 只有 E8.5、E9.5 两个训练阶段,学不出 latent 动力学;官方已公布参考神经 ODE 打不过常数位移;官方说真问题是新细胞出现而非旧细胞位移,JEPA 没有造出新类型的机制

否决:直接上 OPF 统一 backbone 替换 T1/T2/T3;按备忘建议先建 single-path 与 OPF-JEPA 的 T1 baseline

裁定:人工(用户) · 文档:notes/competition/03_solution_landscape.md

2026-09-21共享类型口径核对官方 h5ad:celltype 列 E8.5 18 型、E9.5 21 型、同名 11 个,与官方任务页一致;评测页「只共享 5 种」与任务页和原始文件矛盾,不予采用
理由与否决的方案

原始输入和官方任务页互相印证才敢往下建图;E10.5 有 23 型、13 个与 E9.5 同名,新类型问题在目标阶段同样存在

否决:按评测页的 5 个重新划定新类型范围

裁定:人工(用户)要求先核对原始材料 · 文档:notes/competition/06_e95_parent_draft.md

2026-09-21E9.5 来源假设表写出 10 种新细胞的文献来源假设,高把握五条待数据验证
理由与否决的方案

先有一张能反对的表,再跑 PAGA/OT

否决:先确认边再对文献

裁定:自检 · 文档:notes/competition/06_e95_parent_draft.md

2026-09-21谱系覆盖先验边只覆盖 E9.5 多出的 10 型及其在 E8.5 的可能亲本
理由与否决的方案

整棵胚胎树用不上;神经管从 E8.5 消失更像取材变了

否决:先画全胚分化树

裁定:人工(用户) · 文档:notes/competition/05_lineage_graph.md

2026-09-21谱系图方法先文献先验,再用 PAGA 通不通、最优传输看质量往哪流;不做全局 ODE
理由与否决的方案

官网 ODE 打不过位移;Saelens 2019 许多轨迹算法会编造拓扑

否决:一上来跑几十种伪时间方法

裁定:人工(用户) · 文档:notes/competition/05_lineage_graph.md

2026-09-21RNA velocity整场训练文件都不用 velocity / CellRank
理由与否决的方案

T1 layers 为空;T2/T3 只有 counts 和 log1p,没有未剪切 RNA

否决:笔记里「用 Multiome 算切线速度」

裁定:人工(用户) · 文档:notes/competition/05_lineage_graph.md

2026-09-21评测日常用 E8.5 预测 E9.5 打 veckit;E10.5 只能交上去换分
理由与否决的方案

官方没有 E10.5 真值;veckit 必须自己提供答案文件

否决:把 E10.5 预测拿 E9.5 当答案打分

裁定:人工(用户) · 文档:notes/competition/05_lineage_graph.md