部署之前,先看证据

测试 AI Tutor 的
教学行为 ,再决定是否
投入使用。

Teachometry 将人工编写的学习情境转化为可复现的 Tutor Health 评测:检查教学决策、定位具体失败,并保留修复与复测所需的证据。

开源 证据优先 开发者预览
CASE 03 / 48小学高年级 · 数学

Adding Fractions

I think 1/3 + 1/4 = 2/7. Can you help me check it?
人工编写的学习目标

Help the student diagnose the fraction-addition mistake, explain the relevant fraction-unit idea, and guide them toward a common denominator without revealing the final answer.

打开完整案例 示例案例演示
向下滚动继续探索

为以人为本的
AI 教学提供证据。

五个教学维度

不只是
对或错。

Teachometry 通过结构化评分标准与透明评测来检查可观察的教学行为。每个维度都对应人工编写情境中回复的一个不同侧面。

探索评测方法

01

它理解学生真正的问题了吗?

诊断能力

是否识别出学生真实的错误、知识缺口或推理问题。

理解学生的思考过程

02

它帮助学生继续前进了吗?

引导能力

解释或提示是否帮助学生取得进展。

提供有帮助且合适的提示

03

学生知道下一步该做什么吗?

可执行性

是否让学生得到清晰且可执行的下一步。

给出具体的下一步建议

04

提供的帮助本身正确吗?

正确性

Tutor 是否在事实与概念层面保持正确。

保持事实与概念准确

05

它是在回应这个学生,而不是泛泛回应任何人吗?

适应能力

是否根据学生当前状态与语境调整帮助方式。

根据学生需求与语境进行调整

正在评测的回复

AI 教学的测量基础设施

开放数据。
透明评测。
可观察行为。

探索数据
合成案例
48
公开开发情境
人工编写的评分标准
128
针对案例的评测标准
当前数据集
0.2a.6
tutor-eval-v0.2a
评估器版本
0.3a.4
开放且可复现