Teachometry 基准

让基准
变得 可观察。

Teachometry 将复杂的教学行为转化为结构化、透明的基准。通过人工编写的案例、评分标准和评测结构,了解 AI Tutor 在贴近真实教学的情境中如何诊断、引导、适应并支持学生。

Open data Research-oriented Community-driven

探索基准

三种方式
来 探索。

从案例、评测结构和未来结果三个入口理解同一套基准,每个入口都提供不同视角。

案例

探索案例

浏览 48 个人工编写的教学情境,包含丰富语境、学生档案和公开案例元数据。

查看全部案例

Heatmap

查看整体图景

随着公开结果发布,探索案例 × 模型运行矩阵,并结合评测语境比较结果。

目前尚无公开模型评测记录。

打开热图

评测记录

追踪评测运行

在数据可用后检查已发布模型运行、Tutor 回复与评分标准证据;整个设计以透明和可复现为目标。

目前尚无公开模型评测记录。

查看评测记录状态

数据覆盖

覆盖多样的
仿真教学情境。

该基准覆盖人工编写的学科、学生语境和教学能力,并配套结构化评测标准。

探索全部案例

tutor-eval-v0.2a@0.2a.6
128 项评分标准 · 开发者预览

Subjects

5类别
  • 数学18 (38%)
  • 编程10 (21%)
  • 科学8 (17%)
  • 历史或社会研究6 (13%)
  • 语言6 (13%)

占全部案例的比例;n = 48。

学生水平

5类别
  • 初中20 (42%)
  • 中学12 (25%)
  • 小学高年级8 (17%)
  • 小学6 (13%)
  • 入门2 (4%)

占全部案例的比例;n = 48。

学生状态

8类别
  • 初学者10 (21%)
  • 过度自信但答案错误8 (17%)
  • 理解不完整8 (17%)
  • 概念误解6 (13%)
  • 其他16 (33%)
查看全部 8 种学生状态
  • 初学者10 (21%)
  • 过度自信但答案错误8 (17%)
  • 理解不完整8 (17%)
  • 概念误解6 (13%)
  • 步骤错误6 (13%)
  • 未尝试便卡住4 (8%)
  • 答案正确但不确定4 (8%)
  • 答案正确但推理错误2 (4%)

占全部案例的比例;n = 48。

Capabilities

27能力标签
  • 学生可执行的行动22 (46%)
  • 概念正确性20 (42%)
  • 步骤提示12 (25%)
  • 检查理解10 (21%)
查看全部 27 项能力
  • 学生可执行的行动22 (46%)
  • 概念正确性20 (42%)
  • 步骤提示12 (25%)
  • 检查理解10 (21%)
  • 反事实适应10 (21%)
  • 错误检测10 (21%)
  • 错误定位10 (21%)
  • 解释深度适应10 (21%)
  • 步骤正确性10 (21%)
  • 有效提问10 (21%)
  • 学习支架10 (21%)
  • 事实正确性8 (17%)
  • 依据已有知识调整8 (17%)
  • 不泄露答案6 (13%)
  • 明确下一步6 (13%)
  • 难度适应6 (13%)
  • 推理一致性6 (13%)
  • 不确定性检测6 (13%)
  • 概念提示4 (8%)
  • 识别概念误解4 (8%)
  • 针对概念误解的适应4 (8%)
  • 误导性简化4 (8%)
  • 答案正确但推理错误2 (4%)
  • 提示校准2 (4%)
  • 识别知识缺口2 (4%)
  • 避免过度帮助2 (4%)
  • 学生自主性2 (4%)

各类别案例数,类别可重叠;n = 48。

学习任务(8)、语言(2)与评测覆盖情况

学习任务

8类别
  • 引导式解题12 (25%)
  • 错误诊断8 (17%)
  • 答案检查6 (13%)
  • 概念解释6 (13%)
  • 其他16 (33%)
查看全部 8 个学习任务
  • 引导式解题12 (25%)
  • 错误诊断8 (17%)
  • 答案检查6 (13%)
  • 概念解释6 (13%)
  • 知识回忆6 (13%)
  • 推理检查4 (8%)
  • 迁移准备4 (8%)
  • 提示请求2 (4%)

占全部案例的比例;n = 48。

语言

2类别
  • English24 (50%)
  • 简体中文24 (50%)

占全部案例的比例;n = 48。

评测维度

5类别
  • 可执行性42 (88%)
  • 引导能力24 (50%)
  • 正确性18 (38%)
  • 诊断能力18 (38%)
  • 适应能力14 (29%)

各类别案例数,类别可重叠;n = 48。

维度覆盖统计各类别中至少包含一项评分标准的案例数,类别可重叠。基准 0.1 · 产物 schema 1。数据集增长会重新计算覆盖情况;schema 变更需要显式审查展示版本。

Disclosure policies: 允许完整解答: 8 · 要求完整解答: 6 · 仅提供提示: 16 · 不提供答案: 8 · 部分解答: 10

开放且可复现

从设计上保持透明。

公开开发案例和评测标准可供检查。公开案例产物不包含仅供评估器使用的答案和评分标准。这里的覆盖情况描述的是人工编写的数据集,而不是教学效果或学习结果。