我们的方法论

如何
测量 教学?

Teachometry 使用透明且可复现的评测流程,在结构化、人工编写的基准案例中评估可观察的教学行为。

透明 以研究为基础 公开记录

评测流程

从结构化案例走向基准结果。

  1. 01

    结构化案例

    包含学生画像、目标与语境的人工编写情境。

  2. 02

    Tutor 回复

    针对结构化学生案例生成的回复。

  3. 03

    评估器证据

    来自确定性评估器和 Semantic Judge 的证据。

  4. 04

    原子化评分标准

    带有明确评分等级的细粒度标准。

  5. 05

    基准结果

    以有记录、可比较的输出进行类别聚合。

五个评测维度

五个互补的
教学观察
视角。

我们通过公开基准产物中的五个评分维度评估 AI Tutor,覆盖结构化案例中可观察教学行为的不同互补侧面。

进一步了解这些维度
  1. 维度 01评分视角

    正确性

    Tutor 是否在事实与概念层面保持正确。

    我们关注什么事实与概念准确性

  2. 维度 02评分视角

    诊断能力

    是否识别出学生真实的错误、知识缺口或推理问题。

    我们关注什么识别学生需求与错误概念

  3. 维度 03评分视角

    引导能力

    解释或提示是否帮助学生取得进展。

    我们关注什么提供清晰、正确且能推动学习的引导

  4. 维度 04评分视角

    适应能力

    是否根据学生当前状态与语境调整帮助方式。

    我们关注什么根据学生状态、水平与语境进行适应

  5. 维度 05评分视角

    可执行性

    是否让学生得到清晰且可执行的下一步。

    我们关注什么为学生提供可执行的下一步

可观察教学行为

不同侧面。
形成更完整的
图景。

从回复到结果

透明的
评测架构。

我们的评测框架结合原子化评分标准、明确的证据边界和多个评估器,以支持可复现、可审计的结果。

Tutor 可见输入止于回复边界。 仅供评估器使用的注释始终保留在评估器一侧。

结构化案例人工编写情境
包含学生语境
Tutor 回复Tutor 可见
交互
评估器证据
确定性评估器可观察代理检查Semantic Judge评估器边界
原子化评分标准标准与
评分等级
类别聚合五个评分
维度
基准结果结构化、
可比较输出
透明、可复现、可审计。Judge 是评估器边界,不是参考真值;需要 Judge 而尚未解决的证据必须保持未解决,不能静默变成有效分数。

我们测量什么

可观察的教学行为。

我们关注 AI Tutor 在交互中实际做了什么、说了什么,并通过结构化评分标准和可观察证据进行评估。

  • 正确性事实与概念准确性
  • 诊断能力识别学生需求与错误概念
  • 引导能力提供清晰、正确且能推动学习的引导
  • 适应能力根据学生状态、水平与语境进行适应
  • 可执行性为学生提供可执行的下一步

这是基于具体案例条件的证据,不是对一般教学有效性的主张。

我们不测量什么

学习结果 (暂时不测)。

我们目前不测量长期学习增益或真实世界教育结果。这些问题需要超出本基准范围的纵向研究。

  • 真实长期学习
  • 随时间保持的知识留存
  • 迁移到新情境
  • 学生满意度
  • 真实课堂结果

方法论状态

一项仍在进行的
研究工作。

我们正在构建严格且开放的评测基础设施。其中一些组件已经可用,另一些仍将在后续工作中完善。

阅读路线图
当前方法论状态
组件状态说明
校准基础设施可用不依赖服务提供方的契约和合成流程 fixture 已可用。
Community Review 基础设施私有 staging 已就绪公开发布仍被阻塞;reviewer intake 仍关闭,真实 Community Review 活动尚未启动。
人工校准(P5)尚未开始当前不主张存在真实人工校准数据。
Judge 与人工对照验证尚未完成Judge 结果不会被呈现为人工参考验证。
统计验证尚未完成当前基准不主张已经完成统计验证。

我们的承诺

透明到足以被质疑。
结构清晰,便于复现。

我们公开方法论、评分标准和基准数据,供检查、反馈与复用。欢迎社区评估、质疑并在此基础上继续建设。