Virtual Embryo Challenge更新于 10-03 19:12(北京时间) / 每 5 分钟更新

← 返回总览 · 实验登记

运行 20260927-172643-grok-t1 不在本机?只在实验登记表里有记录,运行目录不在这台机器上,只能显示登记的信息。

这次运行的目录不在 Spark 上(例如在虚拟机上跑的),下面只显示实验登记?每次运行一行或几行的总账(notes/changelogs/runs.tsv),只追加不改写。和提交账本里的记录。

运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。20260927-172643-grok-t1
09-27 17:26 · 单 Agent · T1:val · 其他运行 · grok
题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。T1:val
方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。单 Agent
搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。Agent 自选
状态已结束
开始 / 结束09-27 17:26 / —
用时?从运行开始到结束(或到现在)的挂钟时间。—
目的?这次运行为了回答什么问题,写在配置文件里。[回填] 配置 grok-t1(启动时没有 purpose 字段)

登记的结果

最好排序分?搜索树里排序用的最好分数:有 3 次复测时用均分,否则用单次分。55.97
proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。55.97
X1?用外部公开数据造的同类型题。46.79
X3?用外部公开数据造的同类型题。46.56
X4?用外部公开数据造的同类型题。50.14
X5?用外部公开数据造的同类型题。50.51
分数来源agent claim (SELECTION.md); X1,X3,X4,X5 from agent/dashboard/ruler_scores.tsv
官网分?官网 P2 返回的真实分数。 T1:val47.2

出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。

代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。5210e7d75420422d8bc5e4fc56c1d8a5e6e467cb
版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。—
配置文件agent/configs/t1.yaml
配置指纹 577d762f7e702a44
锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。—
运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本)
提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。第 1 行 · 2026-10-01 · T1:val · 预测文件指纹 46af994fe06eaeb5 · 官网分 47.2
迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。2026-10-01_20260927-172643-grok-t1.md