Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T1:val / 10-03 15:15

假模型流程测试

先看终选决定,再沿节点查看方法、代码改动和对话证据。

已选出最终候选

以实际终选程序为结果;搜索中曾达到的最高分与最终交付分开记录。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
n2
本运行目标 48.61(种子 0 单次)
节点?搜索树里的每个候选程序。
16
已打分 11
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
49
分析员 12、data 4、data_jobs 4、工程师 14、调研员 14、审查员 1

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

尺子用途分数评分上下文
X3搜索目标复测48.6真值 B 半 / 3 个 seed均值
proxy诊断记录58.9真值 B 半 / 1 个 seed单次
为什么选中这个结果:逐候选护栏证据

差值来自该运行的 final_guard 事件,按当时锁定规则判断。不同尺子的分差不合并成一个结论。

候选尺子相对基线当时判定
n1X3+0.00未通过
n2X3+0.16通过
n9X3-0.36未通过

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

n2 种子 终选程序
composition_trend — type-level composition reweighting + within-type maturity selection
搜索目标分 48.71 · X3 48.71 · 3 次复测均分 48.61
审查意见?审查员(Reviewer)检查程序是否越界读取、写死目标或钻评分器漏洞后的意见。 通过 seed (human-written, locked)

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,已打分,47.921n2 种子,已打分,48.712n3 改进,已打分,47.143n4 改进,没有改动4n5 改进,已打分,47.665n6 改进,格式不合格6n7 改进,已打分,47.967n8 改进,已打分,46.738n9 草稿,已打分,48.489n10 草稿,程序报错10n11 草稿,已打分,47.6111n12 草稿,生成失败12n13 改进,已打分,47.6613n14 草稿,格式不合格14n15 改进,已打分,47.1615n16 草稿,已打分,47.9616终选
已打分?程序正常跑完并拿到分数。程序报错?候选程序运行时出错。格式不合格?输出文件不符合提交格式(基因、细胞数、坐标等)。生成失败?会话没能产出可用的程序。没有改动?这次会话没有对代码做任何修改。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。
4747.54848.54949.500.20.40.60.81从开始算起的分钟数20261003-151511-search-t1-integration-fake20261003-151511-search-t1-integration-fake:1 分钟 47.9220261003-151511-search-t1-integration-fake:1 分钟 48.71
全部节点与对话(16)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。X3?用外部公开数据造的同类型题。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子已打分47.9—47.948.4通过不到 1 分seed copy_last
n2—种子已打分48.7—48.748.6通过不到 1 分composition_trend — type-level composition reweighting + within-type maturity selection
n3n2改进已打分47.1-1.647.1—未审查不到 1 分heart_jcf_peri reweighting, heart x1.5, edge x0.15 (fake Engineer, node 3)
n4n1改进没有改动————未审查不到 1 分relay-plan-4
n5n1改进已打分47.7-0.347.747.5未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.3 (fake Engineer, node 5)
n6n1改进格式不合格————未审查不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.2 (fake Engineer, node 6)
n7n2改进已打分48.0-0.748.047.8未审查不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.1 (fake Engineer, node 7)
n8n1改进已打分46.7-1.246.7—未审查不到 1 分heart_jcf_peri reweighting, heart x1.4, edge x0.35 (fake Engineer, node 8)
n9—草稿已打分48.5—48.548.1通过不到 1 分heart_jcf_peri reweighting, heart x1.2, edge x0.25 (fake Engineer, node 9)
n10—草稿程序报错————未审查不到 1 分heart_jcf_peri reweighting, heart x1.9, edge x0.15 (fake Engineer, node 10)
n11—草稿已打分47.6—47.6—未审查不到 1 分heart_jcf_peri reweighting, heart x1.7, edge x0.4 (fake Engineer, node 11)
n12—草稿生成失败————未审查不到 1 分relay-plan-12
n13n9改进已打分47.7-0.847.7—未审查不到 1 分heart_jcf_peri reweighting, heart x1.3, edge x0.2 (fake Engineer, node 13)
n14—草稿格式不合格————未审查不到 1 分heart_jcf_peri reweighting, heart x2.0, edge x0.1 (fake Engineer, node 14)
n15n11改进已打分47.2-0.447.2—未审查不到 1 分heart_jcf_peri reweighting, heart x1.8, edge x0.35 (fake Engineer, node 15)
n16—草稿已打分48.0—48.0—未审查不到 1 分heart_jcf_peri reweighting, heart x1.6, edge x0.25 (fake Engineer, node 16)
资源消耗与失败情况

格式不合格 2 没有改动 1 程序报错 1 生成失败 1

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
分析员120不到 1 分30,823576
data40不到 1 分6816
data_jobs40不到 1 分00
工程师140不到 1 分693167
调研员140不到 1 分201,1232,195
审查员10不到 1 分3,34217
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261003-151511-search-t1-integration-fake
10-03 15:15 · 自动搜索 · T1:val · 假模型流程测试 · integration
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索 测试
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。X3;护栏 X3;诊断 proxy
状态已结束
开始 / 结束10-03 15:15 / 10-03 15:19
用时4 分 / 预算 27 分
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。test_wt

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。0348d03fb2efd29e9953c3ba5f7d1846d0f6f189
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/test/20261003-151511-search-t1-integration-fake/config_source.yaml
配置指纹 6c10fc75405e7033
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。b4a98285238b95dd 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/test/20261003-151511-search-t1-integration-fake/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。a5641c13e7adb330
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:24 个文件,指纹 1ea9a3d2b62ff9fd
proxy:19 个文件,指纹 604f04735239a30a
test:24 个文件,指纹 de635f589be3ee24
views:2 个文件,指纹 a67144954f88da68
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
compliance:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
data:fake (接口报告 fake)
工程师:fake (接口报告 fake)
调研员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
审查员:vec-relay-claude-cli/claude-opus-5-5 (接口报告 claude-opus-5-5)
运行目录/home/spark-longxinyang/vec/runs/test/20261003-151511-search-t1-integration-fake 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告