Meta Exams / Private Console

元能力测评控制台

这里管理题目版本、OpenRouter 考生、盲审裁判和长期成绩历史。登录口令只在 Worker 端校验。

Meta Exams / Control Plane

元能力测评控制台

版本化题目 × 独立考生 × 匿名盲审 × 可追溯历史。所有 OpenRouter 调用均由 Worker 发起,浏览器不接触 API key。

最近运行

答题与盲审执行状态

类型题目版本状态进度时间

当前目录

已注册模型与版本

配置中心

实体一经用于运行即进入历史;停用只影响未来选择。

新增题目版本

新增 OpenRouter 模型

同一个模型可以分别登记为考生或裁判,运行参数独立保存。

OpenRouter API key

可直接在这里填写。Worker 会用管理员口令派生的 AES-GCM 密钥加密后写入 D1,页面不会回显明文。

未配置

已登记实体

可直接用于新一轮答题和盲审。

题目版本

考生 / 裁判

发起答题

每个考生获得一条全新的、只包含题目版本的 OpenRouter 对话。

选择考生
隔离规则:考生请求不会收到其他答卷、裁判、分数或真实身份;返回答卷会在服务端生成新的匿名 token,并只在内部映射。

发起盲审

每个裁判 × 每份答卷都是单独请求,裁判只看到匿名 token 和一份答卷。

选择裁判
选择待评答卷
盲审输入由 Worker 重新组装:题目 + 评分规约 + 单份匿名答卷。不会传入 candidate_id、model_id、厂商、其他答卷、旧分数或排名。

成绩历史

legacy 记录来自原 Sol / Opus 报告;managed 记录来自当前 Worker 盲审。

时间题目版本考生匿名 token裁判得分来源

隔离与审计

把“独立、不串通、不污染、不带偏见”落实到数据流,而不是只写在说明里。

请求边界

考生:只读当前题目版本。裁判:只读当前题目版本、评分规约和一份匿名答卷。模型的 OpenRouter 请求彼此没有共享上下文;Worker 不把历史结果拼进 prompt。
身份映射仅存在于 D1 的 submissions → candidates 关系和管理员接口;盲审 prompt 只使用随机 anonymous_token。前端导出的管理数据受登录保护。

可追溯性

  • 题目版本不可变,答卷固定关联 exam_id。
  • 每次答题和每个裁判都有独立 run。
  • 原始模型返回、裁判 JSON、失败信息和时间均入库。
  • 旧 Sol / Opus 作为 source=legacy 保留,不伪装成新运行。
  • 分数只从裁判 JSON 的四个有上限维度计算。