可观察
胜过假设
评估 Tutor 在交互中实际说了什么、做了什么,而不是推断其意图或相信其自称能力。
关于 Teachometry
Teachometry 是面向 AI 教学的开放测量基础设施。我们在结构化案例中评估可观察的教学行为,而不只是检查答案是否正确。
为什么要做 Teachometry
AI 模型往往能够给出正确答案,但教学要求更多:发现学生卡在哪里、引导推理、调整帮助,并留下可执行的下一步。正确答案只能证明正确性,不能证明这次交互教得好。
要评估 AI 教学,我们需要模型如何与学生互动的证据,而不仅仅是它知道什么。
公开基准将这些问题保持分离,因此每个结果都仍然与具体案例、维度和可观察证据绑定。
我们的立场
Teachometry 的 TutorBench 引擎评估一个 TutorUnderTest ,通过独立于服务提供方的适配器边界接入。服务提供方特定行为只在边缘进入;引擎的案例、契约、评估器和报告保持独立。
不在我们的范围内
不在我们的范围内
我们的信念
评估 Tutor 在交互中实际说了什么、做了什么,而不是推断其意图或相信其自称能力。
优先选择透明方法、可复现产物和可检查证据,而不是营销叙事。
结果属于具体案例、版本、维度和评测语境,而不是一个放之四海而皆准的数字。
公开案例、方法论、契约和公开产物,让主张可以被检查和质疑。
从设计上开放
Teachometry 以开放方式开发,并为软件、人工编写的基准内容以及 TutorBench 名称和品牌资产分别划定边界。