关于 Teachometry

模型可以知道
答案
却未必是
好的 Tutor。

Teachometry 是面向 AI 教学的开放测量基础设施。我们在结构化案例中评估可观察的教学行为,而不只是检查答案是否正确。

为什么要做 Teachometry

答案 ≠ 教学。

AI 模型往往能够给出正确答案,但教学要求更多:发现学生卡在哪里、引导推理、调整帮助,并留下可执行的下一步。正确答案只能证明正确性,不能证明这次交互教得好。

要评估 AI 教学,我们需要模型如何与学生互动的证据,而不仅仅是它知道什么。

公开基准将这些问题保持分离,因此每个结果都仍然与具体案例、维度和可观察证据绑定。

  1. 正确性Tutor 是否在事实与概念层面保持正确。01
  2. 诊断能力是否识别出学生真实的错误、知识缺口或推理问题。02
  3. 引导能力解释或提示是否帮助学生取得进展。03
  4. 适应能力是否根据学生当前状态与语境调整帮助方式。04
  5. 可执行性是否让学生得到清晰且可执行的下一步。05

我们的立场

我们测量 Tutor。
我们不构建 Tutor。

Teachometry 的 TutorBench 引擎评估一个 TutorUnderTest ,通过独立于服务提供方的适配器边界接入。服务提供方特定行为只在边缘进入;引擎的案例、契约、评估器和报告保持独立。

查看仓库

不在我们的范围内

  • 聊天应用
  • Prompt 试验场
TutorUnderTest服务提供方适配器边界
Teachometry
评测
案例 · 评分标准 · 报告

不在我们的范围内

  • 模型微调
  • 管理后台
  • Review Workspace 模块
相同案例,清晰标准,可复现评测。

我们的信念

01

可观察
胜过假设

评估 Tutor 在交互中实际说了什么、做了什么,而不是推断其意图或相信其自称能力。

02

证据
胜过炒作

优先选择透明方法、可复现产物和可检查证据,而不是营销叙事。

03

语境
胜过单一分数

结果属于具体案例、版本、维度和评测语境,而不是一个放之四海而皆准的数字。

04

开放方法
胜过黑箱

公开案例、方法论、契约和公开产物,让主张可以被检查和质疑。

我们现在处于什么阶段

开发者预览

Teachometry 正处于积极开发阶段。公开网站打包展示经批准的开发元数据和公开案例;不会发布私有运行,也不会声称校准已经完成。

查看当前版本说明
网站
开发者预览
软件包
已发布 tutor-benchmark@0.1.0
数据集
tutor-eval-v0.2a@0.2a.6
公开案例
48 个合成案例
公开模型运行记录
目前尚无校准后的公开模型运行记录。
校准
尚未完成;适用情况下,结果仍属于初步且未校准状态。

从设计上开放

面向 AI 教学社区的
共享资源。

Teachometry 以开放方式开发,并为软件、人工编写的基准内容以及 TutorBench 名称和品牌资产分别划定边界。