Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-01 23:37

A/B/C 框架对比 / C 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n43
本运行目标 53.34(种子 0 单次)
节点?搜索树里的每个候选程序。
61
已打分 59
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
264
分析员 59、native 180、审查员 25

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测50.3真值 B 半 / 3 个 seed均值
proxy搜索目标复测54.8真值 B 半 / 3 个 seed均值
proxy2搜索目标复测54.8真值 B 半 / 3 个 seed均值
X1终检诊断50.3全部真值 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n1 种子
seed pseudobulk_shift
搜索目标分 39.34 · proxy 50.04 · proxy2 27.43 · X3 40.53 · 3 次复测均分 39.42
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)
↓
n8 改进
改了什么
搜索目标分 48.83(+9.5) · proxy 50.04(+0.0) · proxy2 50.04(+22.6) · X3 46.39(+5.9) · 3 次复测均分 48.91
分析员结论?分析员(Analyst)看完分数后写下的第一条经验。:在 T1 上用 inputs_by_time 取输入阶段时必须 include_external=False(无官方阶段时回退全部输入):父节点以外部 Qiu E9.0 作预测基底导致 proxy2 只有 27.43,本节点过滤后 proxy2=50.04、cell_state 32.67->49.78、covariation 22.56->46.18。
审查意见 通过 1 越界读取:未发现问题——run.py 仅通过 src.task1_temporal.view_io 的 read_stage/load_manifest 等助手访问 --data 内清单声明的输入,无绝对路径、..、/mnt、/home、打分器路径或联网行为; 2 硬编码目标统计量:未发现问题——常量仅为方法超参(ALPHA_MAX=0.75、ALPHA_MIN=0.1、SIGN_THRESHOLD=0.05、GENE_SHRINK
↓
n32 改进
改了什么
搜索目标分 50.03(+1.2) · proxy 50.04(+0.0) · proxy2 50.04(+0.0) · X3 50.00(+3.6) · 3 次复测均分 50.09
分析员结论:在多视图任务里,先确认改动的代码分支被哪些视图执行:本节点 proxy/proxy2 分数逐位不变(+0.00),而 X3 与 covariation 各 +3.6/+3.9,说明逐细胞缩放只在两阶段路径生效,用 proxy 判好坏会完全看不到信号。
审查意见 通过 1 越界读取:未发现问题。run.py 只通过 view_io 的 load_manifest/panel_genes/read_stage 读取 manifest 给定的输入阶段,无绝对路径、'..'、/mnt、/home、data/raw、打分器路径,无联网代码(grep 无 http/socket/requests/download)。; 2 硬编码目标统计量:未发现问题。全部常量(ALPHA_MAX、GENE_SHRINK_K、
↓
n43 改进 终选程序
改了什么
搜索目标分 52.90(+2.9) · proxy 54.13(+4.1) · proxy2 54.13(+4.1) · X3 50.45(+0.4) · 3 次复测均分 53.34
分析员结论:在单阶段回退(proxy/proxy2)上做温和的家族组成重加权(上调心脏谱系 1.4、下调外胚层/胚外 0.4、几乎丢弃 Neural Tube 0.05)可把 proxy 从 copy_last 的 50 提升到 54,且比 Program 2 的激进权重(1.6/0.25/0.0,covariation 崩到 41.31)安全,covariation 反而 +3.57。
审查意见 通过 检查1(越界读取):未发现问题。run.py 只通过 view_io 的 load_manifest/inputs_by_time/read_stage 读取 --data 视图内输入(约100-118行),无绝对路径、无 ..、不读目标阶段文件或打分器代码,无联网。; 检查2(硬编码目标统计量):未发现问题。run.py 顶部只定义按类型家族的子串规则权重(CARDIAC_SUBSTRINGS×1.4、DOWNWEIGHT×0.4、N

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,39.341n2 改进,已打分,47.58n3 改进,已打分,46.87n4 改进,已打分,47.25n5 改进,已打分,47.23n6 改进,已打分,47.80n7 改进,已打分,47.58n8 改进,已打分,48.83n9 改进,已打分,47.80n10 改进,已打分,48.01n11 改进,已打分,48.83n12 改进,已打分,48.84n13 改进,已打分,48.99n14 改进,已打分,48.81n15 改进,已打分,48.63n16 改进,已打分,48.92n17 改进,已打分,48.94n18 改进,已打分,48.80n19 改进,已打分,49.10n20 改进,已打分,49.00n21 改进,已打分,48.84n22 改进,已打分,49.10n23 改进,已打分,49.14n24 改进,已打分,49.10n25 改进,已打分,49.10n26 改进,已打分,49.01n27 草稿,已打分,49.88n28 改进,已打分,49.20n29 改进,已打分,49.28n30 改进,已打分,49.24n31 改进,格式不合格n32 改进,已打分,50.03n33 改进,已打分,49.15n34 修复,已打分,49.88n35 改进,已打分,50.03n36 改进,已打分,51.89n37 草稿,已打分,49.21n38 改进,已打分,50.03n39 改进,已打分,50.03n40 改进,已打分,53.14n41 改进,生成失败n42 草稿,已打分,46.59n43 改进,已打分,52.9043n44 改进,已打分,53.14n45 修复,已打分,49.88n46 改进,已打分,53.10n47 改进,已打分,51.56n48 改进,已打分,53.14n49 改进,已打分,52.90n50 改进,已打分,52.52n51 改进,已打分,53.14n52 改进,已打分,53.14n53 改进,已打分,52.90n54 草稿,已打分,49.29n55 改进,已打分,53.10n56 改进,已打分,53.10n57 改进,已打分,52.90n58 草稿,已打分,47.14n59 改进,已打分,53.10n60 改进,已打分,53.10n61 改进,已打分,53.41终选
已打分?程序正常跑完并拿到分数。格式不合格?输出文件不符合提交格式(基因、细胞数、坐标等)。生成失败?会话没能产出可用的程序。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
4042.54547.55052.5050100150200从开始算起的分钟数20261001-233757-search-t1-abc-r0-C-native20261001-233757-search-t1-abc-r0-C-native:1 分钟 39.3420261001-233757-search-t1-abc-r0-C-native:7 分钟 46.8720261001-233757-search-t1-abc-r0-C-native:11 分钟 47.5820261001-233757-search-t1-abc-r0-C-native:21 分钟 47.8020261001-233757-search-t1-abc-r0-C-native:28 分钟 48.8320261001-233757-search-t1-abc-r0-C-native:40 分钟 48.8420261001-233757-search-t1-abc-r0-C-native:42 分钟 48.9920261001-233757-search-t1-abc-r0-C-native:60 分钟 49.1020261001-233757-search-t1-abc-r0-C-native:72 分钟 49.1020261001-233757-search-t1-abc-r0-C-native:79 分钟 49.1420261001-233757-search-t1-abc-r0-C-native:93 分钟 49.2020261001-233757-search-t1-abc-r0-C-native:94 分钟 49.8820261001-233757-search-t1-abc-r0-C-native:107 分钟 50.0320261001-233757-search-t1-abc-r0-C-native:124 分钟 51.8920261001-233757-search-t1-abc-r0-C-native:137 分钟 53.1420261001-233757-search-t1-abc-r0-C-native:203 分钟 53.41
全部节点与对话(61)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分39.3—50.027.440.539.4通过不到 1 分seed pseudobulk_shift
n2n1改进已打分47.6+8.250.050.042.747.7通过9 分改了什么
n3n1改进已打分46.9+7.550.050.040.547.0通过5 分改了什么
n4n3改进已打分47.3+0.450.050.041.747.3未审查5 分改了什么
n5n1改进已打分47.2+7.950.050.041.647.3未审查3 分改了什么
n6n2改进已打分47.8+0.250.050.043.347.9通过7 分改了什么
n7n4改进已打分47.6+0.350.050.042.747.7未审查5 分改了什么
n8n1改进已打分48.8+9.550.050.046.448.9通过5 分改了什么
n9n3改进已打分47.8+0.950.050.043.347.9未审查4 分改了什么
n10n6改进已打分48.0+0.250.050.044.048.1未审查6 分改了什么
n11n3改进已打分48.8+2.050.050.046.448.9通过5 分改了什么
n12n6改进已打分48.8+1.050.050.046.448.9未审查5 分改了什么
n13n8改进已打分49.0+0.250.050.046.949.1通过7 分改了什么
n14n10改进已打分48.8+0.850.050.046.348.9未审查6 分改了什么
n15n8改进已打分48.6-0.250.050.045.8—未审查6 分改了什么
n16n13改进已打分48.9-0.150.050.046.749.0未审查6 分改了什么
n17n1改进已打分48.9+9.650.050.046.749.0未审查5 分改了什么
n18n8改进已打分48.8-0.050.050.046.3—未审查6 分改了什么
n19n11改进已打分49.1+0.350.050.047.249.2通过4 分改了什么
n20n17改进已打分49.0+0.150.050.046.949.1未审查6 分改了什么
n21n8改进已打分48.8+0.050.050.046.4—未审查10 分改了什么
n22n17改进已打分49.1+0.250.050.047.249.2通过6 分改了什么
n23n17改进已打分49.1+0.250.050.047.349.2通过6 分改了什么
n24n22改进已打分49.1+0.050.050.047.249.2未审查7 分改了什么
n25n8改进已打分49.1+0.350.050.047.249.2未审查6 分改了什么
n26n24改进已打分49.0-0.150.050.047.0—未审查7 分改了什么
n27—草稿已打分49.9—54.554.540.749.9通过8 分改了什么
n28n22改进已打分49.2+0.150.050.047.549.3通过5 分改了什么
n29n22改进已打分49.3+0.250.050.047.849.4通过5 分改了什么
n30n23改进已打分49.2+0.150.050.047.649.3未审查5 分改了什么
n31n27改进格式不合格——————未审查3 分改了什么
n32n8改进已打分50.0+1.250.050.050.050.1通过5 分改了什么
n33n23改进已打分49.1+0.050.050.047.4—未审查4 分改了什么
n34n31修复已打分49.9—54.554.540.749.9通过8 分改了什么
n35n32改进已打分50.0+0.050.050.050.050.1通过12 分改了什么
n36n34改进已打分51.9+2.054.554.546.751.9通过6 分改了什么
n37—草稿已打分49.2—50.050.047.6—未审查7 分改了什么
n38n30改进已打分50.0+0.850.050.050.050.1通过6 分改了什么
n39n32改进已打分50.0+0.050.050.050.050.1未审查6 分改了什么
n40n34改进已打分53.1+3.354.554.550.453.1通过4 分改了什么
n41n32改进生成失败——————未审查5 分—
n42—草稿已打分46.6—49.749.740.4—未审查7 分改了什么
n43n32改进已打分52.9+2.954.154.150.453.3通过7 分改了什么
n44n29改进已打分53.1+3.954.554.550.453.1通过5 分改了什么
n45n31修复已打分49.9—54.554.540.7—未审查7 分改了什么
n46n43改进已打分53.1+0.254.454.450.453.1通过5 分改了什么
n47n27改进已打分51.6+1.754.054.046.8—未审查6 分改了什么
n48n36改进已打分53.1+1.354.554.550.453.1通过5 分改了什么
n49n32改进已打分52.9+2.954.154.150.4—未审查3 分改了什么
n50n8改进已打分52.5+3.753.753.750.2—未审查4 分改了什么
n51n32改进已打分53.1+3.154.554.550.453.1通过4 分改了什么
n52n44改进已打分53.1+0.054.554.550.453.1通过5 分改了什么
n53n32改进已打分52.9+2.954.154.150.4—未审查4 分改了什么
n54—草稿已打分49.3—50.050.047.8—未审查9 分改了什么
n55n46改进已打分53.1+0.054.454.450.4—未审查4 分改了什么
n56n46改进已打分53.1+0.054.454.450.4—未审查3 分改了什么
n57n22改进已打分52.9+3.854.154.150.4—未审查2 分改了什么
n58—草稿已打分47.1—50.550.540.4—未审查10 分改了什么
n59n46改进已打分53.1+0.054.454.450.4—未审查5 分改了什么
n60n46改进已打分53.1+0.054.454.450.4—未审查3 分改了什么
n61n27改进已打分53.4+3.554.954.950.453.3通过4 分改了什么
资源消耗与失败情况

格式不合格 1 生成失败 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员59047 分480,422100,668
native18003 小时 49 分4,035,375650,291
审查员25031 分381,87067,789
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261001-233757-search-t1-abc-r0-C-native
10-01 23:37 · 自动搜索 · T1:val · A/B/C 框架对比 · C 组 · r0-native
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy+proxy2+X3 等权;终检 X1
状态已结束
开始 / 结束10-01 23:37 / 10-02 03:03
用时3 小时 25 分 / 预算 4 小时 30 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。a3935ba50ec7aa51d88cffe46f526585058d9edd
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native/config_source.yaml
配置指纹 348457eb0e281a83
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。b37139e7e5ca41ef 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。3337117a6cf3c4db
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:22 个文件,指纹 edb68fc794d79881
proxy:18 个文件,指纹 166d21c45cc35ede
proxy2:20 个文件,指纹 3a64c6f141374179
test:38 个文件,指纹 f706ad2858ee7264
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261001-233757-search-t1-abc-r0-C-native 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告