结果

结果,
连同 语境 一起保留。

Teachometry 会在评测语料、校准和验证流程完成后发布基准结果。我们优先保证结果可信、可复现且保留完整语境,而不是过早发布排行榜。

证据
胜过炒作。

让 AI 教学拥有
更透明的未来。

公开基准结果

尚未发布。

当前公开产物尚未提供模型排名。 目前尚无校准后的公开模型运行记录。 校准与验证证据仍不完整。

没有证据,就不做排名。
没有语境,就不报分数。

未来排行榜结构

下表展示未来公开排行榜的结构。
它说明每个模型将公开哪些信息;目前尚未展示任何模型结果。

未来公开模型排行榜结构
#模型总体↑正确性诊断能力引导能力适应能力可执行性成本USD / 1K延迟s基准版本Prompt 版本数据集案例组
目前尚无公开模型记录。

目前尚无校准后的公开模型运行记录。 合成演示和初步模型产物不构成公开排名。

可横向滑动查看未来结构;此预览不发布任何结果值。

准备度与证据状态

我们采用分阶段流程,确保公开结果具有意义且值得信赖。

  1. 评测基础设施

    基准、评估器和评分流程已经可用。

    可用
  2. 校准基础设施

    校准所需工具与工作流已经就位。

    可用
  3. Community Review 基础设施

    公开发布仍被阻塞;reviewer intake 仍关闭,真实 Community Review 活动尚未启动。

    私有 staging 已就绪
  4. 人工校准(P5)

    目前尚无真实人工校准数据。

    尚未开始
  5. Judge 与人工对照验证

    Judge 结果不会被呈现为人工参考验证。

    尚未完成
  6. 统计验证

    当前基准不主张已经完成统计验证。

    尚未完成

示例结果视图(预览)

这个仅展示结构的预览说明未来单个模型结果将如何呈现。

模型结果契约

未来公开模型结果

版本化模型身份与证据字段;目前尚无公开记录。

总体—
正确性—
诊断能力—
引导能力—
适应能力—
可执行性—

学科拆分

  • 历史或社会研究—
  • 语言—
  • 数学—

能力拆分

  • 不泄露答案—
  • 检查理解—
  • 明确下一步—

效率

  • 成本—
  • 延迟—
  • token 数—

元数据与可追踪性

  • 服务提供方快照—
  • 模型版本—
  • 基准版本0.1
  • Prompt 版本—
  • 数据集案例组tutor-eval-v0.2a@0.2a.6
  • GenerationSpecId—
  • 执行身份—

生成身份与执行字段仍是未来公开契约的一部分。

我们的承诺

没有证据,就不做排名。
没有语境,就不报分数。

我们正在构建一个开放、透明、由社区共同推动的 AI 教学基准。感谢你的关注与支持。