社区

更强的评测系统需要共同完成。

Teachometry 正在构建一个面向可观察 AI 教学行为的开放基准。有些判断无法仅靠确定性检查或 LLM Judge 可靠验证,因此未来的结构化人工评审会成为研究计划中的一种证据来源。

参与申请暂未开放未来参与初期将采用受邀制。
结构化人工评审证据关系
  1. 01阅读
  2. 02判断
  3. 03提交
  4. 04资格验证
不同视角,更有力的证据。

为什么需要人工评审

教学质量不只是答案是否正确。

TutorBench 评估 Tutor 是否识别学生的困难、提供合适的下一步、根据学生状态和语境调整帮助,并以合适的方式完成 Tutor 的工作。其中一些行为依赖语境和判断。

  • 识别学生的困难
  • 提供合适的下一步
  • 根据学生状态和语境调整
  • 以合适的方式完成 Tutor 的工作

确定性评估器和单独的 LLM Judge 无法可靠建立全部这些判断。人工评审会是未来的一种证据来源,而不是自动产生的参考真值。

未来评审任务

每次评审都遵循清晰的流程。

如果项目开放,参与者会根据同一份可见任务、评审标准和提交契约工作。这些是未来任务,不是当前招聘或开放岗位。

01

阅读

阅读 AI Tutor 的回答和评审任务

未来任务 · 不是开放岗位
02

判断

按提供的标准进行判断

未来任务 · 不是开放岗位
03

提交

提交结构化评审

未来任务 · 不是开放岗位
04

资格验证

在评审真实任务前完成简短的资格验证

未来任务 · 不是开放岗位

未来申请契约

开放申请后预计会询问什么

首版申请数据契约会刻意保持精简:一个用于未来邀请的联系邮箱、偏好的评审语言、简短动机、可选的相关经验,以及大致可参与的时间范围。

当前尚未开放申请。本节说明未来的申请数据约定,不是申请表。

未来契约

community-review-application
  • 用于未来邀请的一个联系邮箱
  • 偏好的评审语言
  • 参与原因的简短说明
  • 可选的相关经验概述
  • 可参与时间档位

当前尚未开放申请。本节说明未来的申请数据约定,不是申请表。

未来参与方式

从申请到盲评任务。

初期参与将采用受邀制。未来提交申请不会自动创建 reviewer 账号。

  1. 01

    提交申请

    填写未来申请字段。

  2. 02

    人工审核

    进行人工资格与匹配审核。

  3. 03

    收到邀请

    进入受邀制的下一步。

  4. 04

    阅读并确认参与说明

    确认评审边界与参与说明。

  5. 05

    资格验证

    完成参与资格门槛。

  6. 06

    盲评任务

    对真实任务进行盲评。

当前状态

现在可了解,参与尚未开放。

公开信息已经开放;参与申请、reviewer intake、真实 Community Review 和 P5 人工校准目前尚未开放或尚未开始。

现在可做

先了解公开工作。

benchmark、案例、方法论、代码仓库和项目更新目前都可以公开查看。
浏览 benchmark 案例查看公开案例及其作者提供的语境。已开放阅读方法论了解当前 benchmark 测量什么、不测量什么。已开放探索 benchmark查看公开产物和覆盖边界。已开放查看 GitHub 仓库检查源代码、契约和 roadmap。已开放

尚未开放

研究参与仍处于关闭状态。

当前没有公开 intake,也没有正在运行的 reviewer 项目;不承诺具体日期。
公开参与说明已开放已开放
参与申请与 reviewer intake公开 intake 尚未开放。尚未开放
真实 Community Review尚未启动。尚未启动
P5 人工校准尚未开始。尚未开始

证据边界

人工评审增加证据,但不会创造参考真值。

早期 Community Review 会用于改进和验证评测方法。明确这些边界,才能让未来的人类证据与它实际能够说明的内容保持一致。

01

证据先于结论

人工判断会成为与可见任务和标准绑定的结构化证据。

02

一致性 ≠ 正确性

评审者之间的一致性可以说明稳定程度,但一致性本身不能证明判断正确。

03

资格验证 ≠ 校准

通过资格验证只说明具备参与评审的条件,不等于建立了校准的人类参考表现。

04

人工评审 ≠ 金标准

早期 Community Review 是验证方法的输入,不会自动成为 Human Reference 或参考真值。

共同原则

为 AI 教学建立更健康的研究文化。

可观察证据、透明方法、语境和多元视角,让研究结论保持与证据相称。

01

证据先于主张

先有可观察证据,再形成结论。

02

方法保持透明

任务、评分标准和评测流程应当保持可检查。

03

语境很重要

教学判断依赖学生状态和教学语境。

04

保留多种视角

人工评审可以暴露自动化评测的盲点,但不应被视为绝对正确。

关注项目

成为下一步的一部分。

当前尚未开放申请。请关注项目未来的 Community Review 公告,同时先查看公开 benchmark。本页面没有申请表、候补名单或 reviewer 登录入口。