我们的方法论
如何
测量 教学?
Teachometry 使用透明且可复现的评测流程,在结构化、人工编写的基准案例中评估可观察的教学行为。
透明 以研究为基础 公开记录
01
结构化案例
包含学生画像、目标与语境的人工编写情境。
02
Tutor 回复
针对结构化学生案例生成的回复。
03
评估器证据
来自确定性评估器和 Semantic Judge 的证据。
04
原子化评分标准
带有明确评分等级的细粒度标准。
05
基准结果
以有记录、可比较的输出进行类别聚合。
维度 01评分视角
正确性
Tutor 是否在事实与概念层面保持正确。
我们关注什么事实与概念准确性
维度 02评分视角
诊断能力
是否识别出学生真实的错误、知识缺口或推理问题。
我们关注什么识别学生需求与错误概念
维度 03评分视角
引导能力
解释或提示是否帮助学生取得进展。
我们关注什么提供清晰、正确且能推动学习的引导
维度 04评分视角
适应能力
是否根据学生当前状态与语境调整帮助方式。
我们关注什么根据学生状态、水平与语境进行适应
维度 05评分视角
可执行性
是否让学生得到清晰且可执行的下一步。
我们关注什么为学生提供可执行的下一步
不同侧面。
形成更完整的
图景。
从回复到结果
透明的
评测架构。
我们的评测框架结合原子化评分标准、明确的证据边界和多个评估器,以支持可复现、可审计的结果。
Tutor 可见输入止于回复边界。 仅供评估器使用的注释始终保留在评估器一侧。
结构化案例人工编写情境
包含学生语境
包含学生语境
Tutor 回复Tutor 可见
交互
交互
评估器证据
确定性评估器可观察代理检查Semantic Judge评估器边界
原子化评分标准标准与
评分等级
评分等级
类别聚合五个评分
维度
维度
基准结果结构化、
可比较输出
可比较输出
我们测量什么
可观察的教学行为。
我们关注 AI Tutor 在交互中实际做了什么、说了什么,并通过结构化评分标准和可观察证据进行评估。
- 正确性事实与概念准确性
- 诊断能力识别学生需求与错误概念
- 引导能力提供清晰、正确且能推动学习的引导
- 适应能力根据学生状态、水平与语境进行适应
- 可执行性为学生提供可执行的下一步
这是基于具体案例条件的证据,不是对一般教学有效性的主张。
我们不测量什么
学习结果 (暂时不测)。
我们目前不测量长期学习增益或真实世界教育结果。这些问题需要超出本基准范围的纵向研究。
- 真实长期学习
- 随时间保持的知识留存
- 迁移到新情境
- 学生满意度
- 真实课堂结果
| 组件 | 状态 | 说明 |
|---|---|---|
| 校准基础设施 | 可用 | 不依赖服务提供方的契约和合成流程 fixture 已可用。 |
| Community Review 基础设施 | 私有 staging 已就绪 | 公开发布仍被阻塞;reviewer intake 仍关闭,真实 Community Review 活动尚未启动。 |
| 人工校准(P5) | 尚未开始 | 当前不主张存在真实人工校准数据。 |
| Judge 与人工对照验证 | 尚未完成 | Judge 结果不会被呈现为人工参考验证。 |
| 统计验证 | 尚未完成 | 当前基准不主张已经完成统计验证。 |