阅读
阅读 AI Tutor 的回答和评审任务
未来任务 · 不是开放岗位社区
Teachometry 正在构建一个面向可观察 AI 教学行为的开放基准。有些判断无法仅靠确定性检查或 LLM Judge 可靠验证,因此未来的结构化人工评审会成为研究计划中的一种证据来源。
为什么需要人工评审
TutorBench 评估 Tutor 是否识别学生的困难、提供合适的下一步、根据学生状态和语境调整帮助,并以合适的方式完成 Tutor 的工作。其中一些行为依赖语境和判断。
确定性评估器和单独的 LLM Judge 无法可靠建立全部这些判断。人工评审会是未来的一种证据来源,而不是自动产生的参考真值。
未来评审任务
如果项目开放,参与者会根据同一份可见任务、评审标准和提交契约工作。这些是未来任务,不是当前招聘或开放岗位。
阅读 AI Tutor 的回答和评审任务
未来任务 · 不是开放岗位按提供的标准进行判断
未来任务 · 不是开放岗位提交结构化评审
未来任务 · 不是开放岗位在评审真实任务前完成简短的资格验证
未来任务 · 不是开放岗位未来申请契约
首版申请数据契约会刻意保持精简:一个用于未来邀请的联系邮箱、偏好的评审语言、简短动机、可选的相关经验,以及大致可参与的时间范围。
当前尚未开放申请。本节说明未来的申请数据约定,不是申请表。
未来契约
community-review-application当前尚未开放申请。本节说明未来的申请数据约定,不是申请表。
未来参与方式
初期参与将采用受邀制。未来提交申请不会自动创建 reviewer 账号。
填写未来申请字段。
进行人工资格与匹配审核。
进入受邀制的下一步。
确认评审边界与参与说明。
完成参与资格门槛。
对真实任务进行盲评。
当前状态
公开信息已经开放;参与申请、reviewer intake、真实 Community Review 和 P5 人工校准目前尚未开放或尚未开始。
现在可做
尚未开放
证据边界
早期 Community Review 会用于改进和验证评测方法。明确这些边界,才能让未来的人类证据与它实际能够说明的内容保持一致。
人工判断会成为与可见任务和标准绑定的结构化证据。
评审者之间的一致性可以说明稳定程度,但一致性本身不能证明判断正确。
通过资格验证只说明具备参与评审的条件,不等于建立了校准的人类参考表现。
早期 Community Review 是验证方法的输入,不会自动成为 Human Reference 或参考真值。
共同原则
可观察证据、透明方法、语境和多元视角,让研究结论保持与证据相称。
先有可观察证据,再形成结论。
任务、评分标准和评测流程应当保持可检查。
教学判断依赖学生状态和教学语境。
人工评审可以暴露自动化评测的盲点,但不应被视为绝对正确。
关注项目
当前尚未开放申请。请关注项目未来的 Community Review 公告,同时先查看公开 benchmark。本页面没有申请表、候补名单或 reviewer 登录入口。