运行总览
共 97 次运行:正式 51 次(按实验分组),测试 46 次(折叠在下面)。点组名看运行详情;表头带 的词,鼠标停上去或点一下可看解释; 表格下方说明怎么读分数和各把尺子,页面底部有全部名词解释。时间为北京时间。页面不会自己刷新,想让它每 5 分钟自动更新请打开自动刷新版。
正在运行
2
正式 2 · 测试 0;共 97 次运行
今天已提交?今天写进提交账本的上传次数。
3
账本共 25 次上传
磁盘剩余?运行目录所在磁盘的剩余空间。
2.6 TB
已用 23%
本项目内存?Spark 上给本项目划出的资源份额,上限 96 GB。
47.7 GB / 96 GB
历史峰值 91.5 GB
近 24 小时:大模型调用失败?调用大模型接口报错或异常退出(不含超时和卡死)。 4 次,截止切断?run 的搜索截止前,harness 按计划终止仍在写代码的会话并交接,不是模型故障。 3 次,被中断 2 次。机器状态 →
今日用量 399.65 M token(输入 28.62 M / 输出 9.47 M / 缓存读 361.27 M),1466 次调用。用量与花费 →
名词解释
- 运行
- 一次完整的自动搜索或 Agent 会话,有自己的锁定配置和证据包。
- 实验
- 同一批、为同一个问题跑的几次运行,从配置名(如 g21q)或配置目录认出。
- 题目
- 比赛的哪道题、哪个阶段,例如 T1:val 是第 1 题的验证阶段。
- 自动搜索
- ERA 式搜索树,多个节点不断改进程序。
- 单 Agent
- 一个 Agent 会话从头做到尾。
- 测试
- 用假模型或冒烟配置跑的流程测试,不调用真实大模型(或只为验证流程),结果不能提交。
- 搜索目标
- 这次运行用哪几把尺子、按什么权重合成分数来比较节点;目标不同的运行,最佳分不能直接比。
- 终检
- 只在最后选定程序时测一次、不参与挑选的尺子,用来检查是否只是迎合了搜索目标。
- 启动中
- 已发出启动请求,正在锁定配置、固定输入数据(可能要几分钟),还没开始搜索。
- 已停止
- 有人主动停止了这次运行(systemctl stop 等),不是程序崩溃。
- 中途崩溃
- 记录显示还在运行,但后台服务和进程都已不在,也没有人为停止的记录。
- 已中止(未计入实验)
- 启动后被放弃、改名为 aborted-… 的运行,结果不算进任何实验。
- 启动中断
- 有启动请求,但还没锁定配置,进程就已不在。
- 已用时间 / 预算
- 预算是挂钟时间,包括终选。
- 代码有未提交改动
- 启动时代码仓库有未提交的修改,这次运行不能完全按 git 版本复现。
- 节点
- 搜索树里的每个候选程序。
- 已打分
- 程序正常跑完并拿到分数。
- 程序报错
- 候选程序运行时出错。
- 内存超限
- 用的内存超过上限被系统停止。
- 超时
- 超过时间上限被停止。
- 挂死
- 连续 30 分钟没有任何活动(CPU、GPU、输出、写文件、进度),被健康监督停止。
- 跨环续做
- 本环截止时 Engineer 还没做完,工作打包带到下一环继续。
- 格式不合格
- 输出文件不符合提交格式(基因、细胞数、坐标等)。
- 格式不合格
- 输出文件不符合提交格式(基因、细胞数、坐标等)。
- 打分失败
- 程序跑完了,但打分服务出错(连不上、超时或打分器异常),不算程序的错。
- 生成失败
- 会话没能产出可用的程序。
- 没有改动
- 这次会话没有对代码做任何修改。
- 被中断
- 因重启或大模型接口故障中断,不计入搜索。
- 机器内存紧张
- 整机内存紧张时被系统停止,不是程序本身的错,不计入搜索。
- 导入未重测
- 从以前的运行导入、尚未在新口径下重新打分,只作历史。
- 排队中
- 节点已创建,等待空闲名额。
- 调研中
- 大模型正在查资料、想改进思路。
- 编写中
- 大模型正在修改程序代码。
- 执行中
- 候选程序正在运行并打分。
- 当前最佳分
- 最佳节点在这次运行自己的搜索目标上的分数(有 3 次复测用均值,否则种子 0 单次)。目标不同的运行之间不能比,请看各尺子分。
- 最佳节点各尺子分
- 同一个最佳节点在每把尺子上的分数;同一把尺子的列可以跨运行比较(注意真值 B 半和全部真值的区别)。
- 真值 B 半
- G23 起,每把尺子的真值分成两半:工程师自测只能用 A 半,搜索打分用 B 半,防止程序迎合打分数据。
- 官网分
- 官网 P2 返回的真实分数。
- 本地尺子
- 在本机就能算的分数(替代题、外部测试题等),用来在提交前估计官网分。
- 3 次复测均分
- 最终选出的程序换 3 个随机种子各跑一次替代题,取平均,比单次分更稳。
- 排序一致性
- 本地尺子和官网分数的排序有多一致:1 表示完全一致,0 表示无关,负数表示相反;至少 3 个有官网分的点才计算。
- 参考线 50
- 评分器的归一化参考线,不等于我们实际抽样照抄程序的官网分。
- 天花板 100
- 真实答案一半对另一半的分数。
- 预测文件指纹
- 提交文件的 sha256 前 12 位,用来确认是哪一份预测。
- 本项目内存
- Spark 上给本项目划出的资源份额,上限 96 GB。
- 后台服务
- 在 Spark 上以 systemd 用户服务运行的程序,例如每次运行和这个看板本身。
- 卡死重启
- 大模型调用长时间没有任何输出,被自动终止并重试。
- 熔断
- 大模型接口连续出错时自动暂停新任务。
- 大模型调用失败
- 调用大模型接口报错或异常退出(不含超时和卡死)。
- 截止切断
- run 的搜索截止前,harness 按计划终止仍在写代码的会话并交接,不是模型故障。
- 限流
- 大模型接口提示请求太频繁,等待后重试。
- 对比
- 把几次运行并排放:配置改了什么、结果差多少、分数随时间怎么涨。
- 接续自
- 这次运行从另一次运行的搜索树接着搜,导入了那次的节点。
- 不在本机
- 只在实验登记表里有记录,运行目录不在这台机器上,只能显示登记的信息。
- 终选程序
- 按该运行锁定的规则最终选出的程序;可能是候选节点,也可能由护栏回退到基线。
- 来历
- 终选程序从种子程序一步步改过来的路径,每一步都写了改了什么、分数变了多少。