基准浏览器

模型评测记录

透明的
审计轨迹。

未来公开评测记录会连接模型身份、案例身份、执行语境、Tutor 回复、评估器证据和经过清理的运行指标。

共享证据,
改进教学。

0
公开评测记录
尚无已发布运行
0
公开模型档案
预留
48
公开案例
tutor-eval-v0.2a
不可用
评测记录发布
公开产物状态

审计 ledger

没有公开产物,就没有记录行。

未来每一行都将是一条可寻址的证据记录。当前 ledger 有意保持为空。

未来公开评测记录台账
评测记录 ID模型 ID案例 ID运行索引证据状态
目前暂无公开评测记录。

目前尚无公开模型评测记录。

公开模型运行发布后再来查看。

该台账只公开评测记录摘要身份契约:id、modelId、caseId 和 runIndex。

未来评测记录结构

一条评测记录包含什么。

这些类别来自当前公开评测记录字段契约,而不是某次模型运行。

身份与执行

让一次运行可被准确寻址的版本化身份。

  • model模型身份
  • modelVersion模型版本
  • datasetVersion数据集版本
  • caseVersion案例版本
  • runIndex运行索引

生成可追踪性

复现生成所需的配置引用。

  • generationSpecId生成规格 ID
  • generationSpecVersion生成规格版本
  • promptVersionPrompt 版本
  • promptSha256Prompt SHA-256

Tutor 证据

该案例完整的公开 Tutor 回复。

  • tutorResponseTutor 回复

评测证据

与回复关联的维度结果和失败证据。

  • correctness正确性
  • diagnosis诊断能力
  • guidance引导能力
  • adaptation适应能力
  • actionability可执行性
  • rubricResults评分标准结果
  • criticalFailures严重失败
  • answerLeakage答案泄露

Judge 证据

发布时包含评估器身份与 prompt 版本。

  • judgeJudge
  • judgePromptVersionJudge prompt 版本

运行指标

经过清理的运行信号与教学评分保持分离。

  • tokenstoken 数
  • latency延迟
  • cost成本

可追踪链

从基准走向证据。

评测记录与模型档案、排行榜资格保持分离。未来记录会连接这些阶段,但不会暗示排名或教学有效性主张。

  1. 基准版本未来公开证据
  2. 模型身份未来公开证据
  3. Trial未来公开证据
  4. 案例未来公开证据
  5. Tutor 回复未来公开证据
  6. 评测证据未来公开证据
  7. 清理后的指标未来公开证据

边界清晰的公开证据

可以追踪的证据。

未来公开结果应始终能够追踪到版本化案例、模型身份以及支撑每项主张的证据。