Evaluation detail
Meta Exams / Control Plane
元能力测评控制台
版本化题目 × 独立考生 × 匿名盲审 × 可追溯历史。所有 OpenRouter 调用均由 Worker 发起,浏览器不接触 API key。
最近运行
答题与盲审执行状态
| 类型 | 题目版本 | 状态 | 进度 | 时间 |
|---|
当前目录
已注册模型与版本
配置中心
实体一经用于运行即进入历史;停用只影响未来选择。
新增题目版本
新增 OpenRouter 模型
同一个模型可以分别登记为考生或裁判,运行参数独立保存。
OpenRouter API key
可直接在这里填写。Worker 会用管理员口令派生的 AES-GCM 密钥加密后写入 D1,页面不会回显明文。
已登记实体
可直接用于新一轮答题和盲审。
题目版本
考生 / 裁判
发起答题
每个考生获得一条全新的、只包含题目版本的 OpenRouter 对话。
发起盲审
每个裁判 × 每份答卷都是单独请求,裁判只看到匿名 token 和一份答卷。
成绩历史
legacy 记录来自原 Sol / Opus 报告;managed 记录来自当前 Worker 盲审。
| 时间 | 题目版本 | 考生 | 匿名 token | 裁判 | 得分 | 来源 |
|---|
隔离与审计
把“独立、不串通、不污染、不带偏见”落实到数据流,而不是只写在说明里。
请求边界
考生:只读当前题目版本。裁判:只读当前题目版本、评分规约和一份匿名答卷。模型的 OpenRouter 请求彼此没有共享上下文;Worker 不把历史结果拼进 prompt。
身份映射仅存在于 D1 的 submissions → candidates 关系和管理员接口;盲审 prompt 只使用随机 anonymous_token。前端导出的管理数据受登录保护。
可追溯性
- 题目版本不可变,答卷固定关联 exam_id。
- 每次答题和每个裁判都有独立 run。
- 原始模型返回、裁判 JSON、失败信息和时间均入库。
- 旧 Sol / Opus 作为 source=legacy 保留,不伪装成新运行。
- 分数只从裁判 JSON 的四个有上限维度计算。