Virtual Embryo Challenge更新于 10-03 18:47(北京时间) / 每 5 分钟更新

运行档案 / T2:heart:val_extrap / 10-03 10:55

G24 T2/T3 首跑 / D 组

先看终选决定,再沿节点查看方法、代码改动和对话证据。

搜索尚未完成终选

下方分数代表当前搜索进度,不能作为最终提交结果。

与其他运行比较
终选程序?按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
—
节点?搜索树里的每个候选程序。
2
已打分 0
官网分?官网 P2 返回的真实分数。
—
还没有提交或还没有分数
大模型调用次数?各角色(调研员、工程师、分析员、审查员)调用大模型的次数。
0

实际结果与评分依据

搜索目标、护栏和诊断分开阅读。不同真值分片或 seed 的同名尺子保留各自记录。

分数均值± 标准差次数
还没有终选程序的分数

来历?终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。

括号里的分差只表示变化方向,不代表统计显著性。

还没有终选程序。

搜索树?每个点是一个节点,连线从父节点指向子节点;颜色表示结果。

蓝色粗线是来历路径;鼠标停在点上看节点,点一下打开节点页。

n1 种子,执行中1n2 种子,执行中2
执行中?候选程序正在运行并打分。
搜索分数的变化?横轴是从运行开始算起的分钟数,纵轴是到那时为止最好的搜索目标分。

还没有打分完成的节点,画不出曲线。

全部节点与对话(2)
节点父节点操作?种子:人写的起点;改进:在父节点上改;草稿:从头写;修复:修父节点的报错。状态搜索目标分?搜索用来比较节点的分数(各把尺子按权重合成,种子 0 单次)。比父节点?这个节点的分数减去它父节点的分数;正数是变好。3 次复测?换 3 个随机种子各跑一次取平均 ± 标准差,比单次分更稳。审查用时?从运行开始到结束(或到现在)的挂钟时间。方法说明?节点程序自带的 METHOD.md:这个程序做了什么、为什么。
n1—种子执行中———通过—seed copy_last: 输出最新输入阶段(proxy:E8.75,24,826 个细胞,在上限 25,179 内,整份原样;final:E9.5,53,742 个,按细胞类型分层抽到 25,179),表达和坐标原样。这就是方法卡提交用的 dam
n2—种子执行中———通过—seed damped_shift: 最新两个输入 (prev, last);last 的每个细胞加 α·(mean(last|类型) − mean(prev|类型)),只对两阶段同名的类型,夹到 ≥0。α=0.1,β=0(坐标就是 last 自己的,不缩放
资源消耗与失败情况

没有失败节点

角色?调研员写计划、工程师改代码、分析员解读分数、审查员检查作弊。大模型调用次数失败总用时输入 token 数?输入 / 输出(含思考)的 token 数,来自接口返回的用量。输出 token
没有大模型调用记录
运行配置与来源
运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20261003-105508-search-t2-heart-extrap-g24-D
10-03 10:55 · 自动搜索 · T2:heart:val_extrap · G24 T2/T3 首跑 · D 组
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T2:heart:val_extrap
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。自动搜索
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。proxy;终检 X2;护栏 proxy
状态已停止
开始 / 结束10-03 10:55 / 10-03 10:55
用时不到 1 分 / 预算 4 小时
所在副本?运行目录所在的代码副本(Spark 上 ~/vec 下的哪个目录)。2026_virtual_embryo

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。ef89d91ecc733e79bd7d863fcb2b3bfafaa2e02c
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件/home/spark-longxinyang/vec/runs/formal/20261003-105508-search-t2-heart-extrap-g24-D/config_source.yaml
配置指纹 d8eb95b2bd72a258
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。93285f0a667f6e3e 锁定格式 v8
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。目录存在 /home/spark-longxinyang/vec/runs/formal/20261003-105508-search-t2-heart-extrap-g24-D/code
打分口径指纹?打分器、数据视图、种子等合起来的指纹;指纹相同,分数才能直接比较。7cca0dd048da84f2
数据视图指纹?程序能看到的输入数据文件的指纹,按视图汇总成一个短指纹。final:23 个文件,指纹 376654f75fd9ced3
proxy:20 个文件,指纹 2ede018e6fae19d3
test:19 个文件,指纹 7982bdcbdbe0a565
大模型?每个角色用的大模型;括号里是接口实际报告的模型名。分析员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
工程师:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
调研员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
审查员:alibaba-token-plan-cn/qwen3.8-max (接口报告 qwen3.8-max)
运行目录/home/spark-longxinyang/vec/runs/formal/20261003-105508-search-t2-heart-extrap-g24-D 主机 spark-ad3f
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。这次运行没有提交过官网
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。还没有迭代报告