Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-01 17:03

G29 运行正确性测试

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n2
本运行目标 43.94(种子 0 单次)
节点?搜索树里的每个候选程序。
38
已打分 24
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
105
分析员 30、工程师 35、调研员 35、审查员 5

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测47.7真值 B 半 / 3 个 seed均值
proxy搜索目标复测56.6真值 B 半 / 3 个 seed均值
proxy2搜索目标复测27.5真值 B 半 / 3 个 seed均值
X1终检诊断46.8全部真值 / 1 个 seed单次

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子 终选程序
seed heart_jcf_peri
搜索目标分 43.50 · proxy 56.23 · proxy2 27.43 · X3 46.85 · 3 次复测均分 43.94
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,42.491n2 种子,已打分,43.502n3 种子,已打分,39.343n4 改进,没有改动4n5 改进,已打分,43.295n6 改进,格式不合格6n7 修复,已打分,43.537n8 改进,已打分,43.458n9 改进,已打分,43.239n10 改进,程序报错10n11 改进,已打分,43.4111n12 改进,没有改动12n13 改进,已打分,43.2813n14 改进,格式不合格14n15 改进,已打分,43.2915n16 改进,已打分,43.5016n17 改进,已打分,43.2817n18 改进,程序报错18n19 改进,已打分,43.4119n20 改进,没有改动20n21 修复,已打分,43.3421n22 改进,格式不合格22n23 改进,已打分,43.4323n24 改进,已打分,43.4724n25 草稿,已打分,43.2725n26 改进,程序报错26n27 草稿,已打分,43.3927n28 改进,没有改动28n29 改进,已打分,43.3029n30 草稿,格式不合格30n31 改进,已打分,43.2331n32 改进,已打分,43.2932n33 改进,已打分,43.2433n34 改进,程序报错34n35 修复,已打分,43.4035n36 草稿,没有改动36n37 改进,已打分,43.4837n38 草稿,格式不合格38终选
已打分?程序正常跑完并拿到分数。程序报错?候选程序运行时出错。格式不合格?输出文件不符合提交格式(基因、细胞数、坐标等)。没有改动?这次会话没有对代码做任何修改。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
41.54242.54343.54444.500.511.5从开始算起的分钟数20261001-170351-search-t1-g29-fake220261001-170351-search-t1-g29-fake2:1 分钟 42.4920261001-170351-search-t1-g29-fake2:1 分钟 43.5020261001-170351-search-t1-g29-fake2:2 分钟 43.53
全部节点与对话(38)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。proxy2?两输入替代题:官方 E8.5 + 外部 Qiu E9.0 预测 E9.5,给需要两个时间点的方法一个公平分数。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分42.5—50.027.450.042.5通过不到 1 分seed copy_last
n2—种子已打分43.5—56.227.446.843.9通过不到 1 分seed heart_jcf_peri
n3—种子已打分39.3—50.027.440.539.4通过不到 1 分seed pseudobulk_shift
n4n2改进没有改动——————未审查不到 1 分fake-plan-4
n5n1改进已打分43.3+0.855.627.446.843.8未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.3 (fake Engineer, node 5)
n6n2改进格式不合格——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.2 (fake Engineer, node 6)
n7n6修复已打分43.5—56.327.446.843.7通过不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.1 (fake Engineer, node 7)
n8n2改进已打分43.4-0.156.127.446.843.8通过不到 1 分heart_jcf_peri reweighting, heart x1.4, edge x0.35 (fake Engineer, node 8)
n9n7改进已打分43.2-0.355.427.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.2, edge x0.25 (fake Engineer, node 9)
n10n8改进程序报错——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.9, edge x0.15 (fake Engineer, node 10)
n11n2改进已打分43.4-0.156.027.446.843.8通过不到 1 分heart_jcf_peri reweighting, heart x1.7, edge x0.4 (fake Engineer, node 11)
n12n2改进没有改动——————未审查不到 1 分fake-plan-12
n13n7改进已打分43.3-0.355.627.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.3, edge x0.2 (fake Engineer, node 13)
n14n2改进格式不合格——————未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.1 (fake Engineer, node 14)
n15n8改进已打分43.3-0.255.627.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.35 (fake Engineer, node 15)
n16n2改进已打分43.5+0.056.227.446.843.9通过不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.25 (fake Engineer, node 16)
n17n16改进已打分43.3-0.255.627.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.4, edge x0.15 (fake Engineer, node 17)
n18n2改进程序报错——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.2, edge x0.4 (fake Engineer, node 18)
n19n7改进已打分43.4-0.155.927.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.9, edge x0.3 (fake Engineer, node 19)
n20n2改进没有改动——————未审查不到 1 分fake-plan-20
n21n18修复已打分43.3—55.727.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.5, edge x0.1 (fake Engineer, node 21)
n22n2改进格式不合格——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.3, edge x0.35 (fake Engineer, node 22)
n23n7改进已打分43.4-0.156.027.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.25 (fake Engineer, node 23)
n24n5改进已打分43.5+0.256.127.446.843.9通过不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.15 (fake Engineer, node 24)
n25—草稿已打分43.3—55.527.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.4 (fake Engineer, node 25)
n26n2改进程序报错——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.4, edge x0.3 (fake Engineer, node 26)
n27—草稿已打分43.4—55.927.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.2, edge x0.2 (fake Engineer, node 27)
n28n5改进没有改动——————未审查不到 1 分fake-plan-28
n29n5改进已打分43.3+0.055.627.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.7, edge x0.35 (fake Engineer, node 29)
n30—草稿格式不合格——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.5, edge x0.25 (fake Engineer, node 30)
n31n8改进已打分43.2-0.255.427.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.3, edge x0.15 (fake Engineer, node 31)
n32n2改进已打分43.3-0.255.627.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.4 (fake Engineer, node 32)
n33n11改进已打分43.2-0.255.527.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.3 (fake Engineer, node 33)
n34n2改进程序报错——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.2 (fake Engineer, node 34)
n35n34修复已打分43.4—55.927.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.4, edge x0.1 (fake Engineer, node 35)
n36—草稿没有改动——————未审查不到 1 分fake-plan-36
n37n2改进已打分43.5-0.056.227.446.8—未审查不到 1 分heart_jcf_peri reweighting, heart x1.9, edge x0.25 (fake Engineer, node 37)
n38—草稿格式不合格——————未审查不到 1 分heart_jcf_peri reweighting, heart x1.7, edge x0.15 (fake Engineer, node 38)
资源消耗与失败情况

没有改动 5 格式不合格 5 程序报错 4

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员300不到 1 分630150
工程师3503 分1,736419
调研员350不到 1 分595140
审查员50不到 1 分6015
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261001-170351-search-t1-g29-fake2
10-01 17:03 · 自动搜索 · T1:val · G29 运行正确性测试 · fake2
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索 测试
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy+proxy2+X3 等权;终检 X1
状态已结束
开始 / 结束10-01 17:03 / 10-01 17:12
用时8 分 / 预算 18 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。g29_wt

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。ec4b6da1abfe0065532263cbc93f539356d11d10 代码有未提交改动
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/g29_wt/agent/runs/20261001-170351-search-t1-g29-fake2/config_source.yaml
配置指纹 ebbce8b44c14e8f7
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。030414ca20ce626c 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/g29_wt/agent/runs/20261001-170351-search-t1-g29-fake2/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。a1c2375b6085199f
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:22 个文件,指纹 edb68fc794d79881
proxy:18 个文件,指纹 166d21c45cc35ede
proxy2:20 个文件,指纹 3a64c6f141374179
test:38 个文件,指纹 f706ad2858ee7264
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:fake (接口报告 fake)
工程师:fake (接口报告 fake)
调研员:fake (接口报告 fake)
审查员:fake (接口报告 fake)
运行目录/home/spark-longxinyang/vec/g29_wt/agent/runs/20261001-170351-search-t1-g29-fake2 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告