运行 20260927-172643-grok-t1 不在本机?只在实验登记表里有记录,运行目录不在这台机器上,只能显示登记的信息。
这次运行的目录不在 Spark 上(例如在虚拟机上跑的),下面只显示实验登记?每次运行一行或几行的总账(notes/changelogs/runs.tsv),只追加不改写。和提交账本里的记录。
| 运行?一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。 | 20260927-172643-grok-t1 09-27 17:26 · 单 Agent · T1:val · 其他运行 · grok |
|---|---|
| 题目?比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。 | T1:val |
| 方式?自动搜索:ERA 式搜索树,多个节点不断改进程序;单 Agent:一个 Agent 会话从头做到尾。 | 单 Agent |
| 搜索目标?这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。 | Agent 自选 |
| 状态 | 已结束 |
| 开始 / 结束 | 09-27 17:26 / — |
| 用时?从运行开始到结束(或到现在)的挂钟时间。 | — |
| 目的?这次运行为了回答什么问题,写在配置文件里。 | [回填] 配置 grok-t1(启动时没有 purpose 字段) |
登记的结果
| 最好排序分?搜索树里排序用的最好分数:有 3 次复测时用均分,否则用单次分。 | 55.97 |
|---|---|
| proxy?替代题:用手头已知阶段造的本地考题,T1 是用 E8.5 预测 E9.5。 | 55.97 |
| X1?用外部公开数据造的同类型题。 | 46.79 |
| X3?用外部公开数据造的同类型题。 | 46.56 |
| X4?用外部公开数据造的同类型题。 | 50.14 |
| X5?用外部公开数据造的同类型题。 | 50.51 |
| 分数来源 | agent claim (SELECTION.md); X1,X3,X4,X5 from agent/dashboard/ruler_scores.tsv |
| 官网分?官网 P2 返回的真实分数。 T1:val | 47.2 |
出处?这次运行用的代码、配置、数据和模型的指纹,靠它们可以原样找回并复现。
| 代码版本?运行锁定时代码仓库的 git 提交号;带 +dirty 表示当时有未提交的改动。 | 5210e7d75420422d8bc5e4fc56c1d8a5e6e467cb |
|---|---|
| 版本标签?可提交运行在锁定的提交上打的 git 标签 run/<运行编号>,以后能原样找回代码。 | — |
| 配置文件 | agent/configs/t1.yaml 配置指纹 577d762f7e702a44 |
| 锁定指纹?启动时把配置、代码、提示词等全部锁定后算出的总指纹。 | — |
| 运行专用代码副本?启动时为这次运行单独检出的一份只读代码;运行全程只读它,不受主副本更新影响。 | 没有(这次运行早于运行专用代码副本功能,读的是启动时的代码副本) |
| 提交账本?notes/changelogs/submissions.tsv:每次上传官网的记录和返回的官网分。 | 第 1 行 · 2026-10-01 · T1:val · 预测文件指纹 46af994fe06eaeb5 · 官网分 47.2 |
| 迭代报告?运行结束后自动生成的中文复盘报告(notes/reports/runs)。 | 2026-10-01_20260927-172643-grok-t1.md |