开始使用 / 概览
概览
TutorBench 是用于测量可观察 AI 教学行为、独立于服务提供方的基础设施。本页把 Teachometry 的公开页面映射到定义安装、执行、产物与解释方式的仓库契约和指南。
网站只是仓库既有契约与指南的入口地图,并不替代源文档。
开始使用 / Quickstart
Quickstart
使用 Node 24 安装仓库,然后在无需服务提供方凭据或网络访问的情况下运行确定性的本地演示。
>=24 <25git clone https://github.com/shuangyan123/tutorbench.git
cd tutorbench
npm ci
npm run quickstartnpm install tutor-benchmark
tutorbench quickstart无需服务提供方、无需网络、无需 Judge。 Quickstart 使用来自以下数据集的四个固定开发/冒烟案例: tutor-eval-v0.1@0.1。它不是标准评分案例组,不会产生正式基准分数,也不具备排行榜资格。
参考地图
文档索引
这是通往当前仓库的一组精选入口。GitHub 链接打开源文件,站内链接打开对应公开页面。
显示 19 条参考资料
没有符合当前搜索与分类条件的文档。
解释边界
请谨慎阅读证据。
这些区分可以避免一个有用的开发页面做出仓库并不支持的主张。
Quickstart ≠ 正式基准分数
它是确定性的开发/冒烟演示,不是经过校准的基准证据。
采集 ≠ 发布
在满足发布要求之前,产品 Tutor 和标准模型语料都仍属于初步材料。
Judge ≠ 参考真值
Judge 是一个评估器边界。当所需证据不可用时,未解决的标准必须继续保持未解决。
人工评审 ≠ 自动金标准
人工证据可以增强方法,但不会自动成为不可质疑的参考真值。
治理与贡献
为开放仓库定义清晰边界。
软件、人工编写的基准内容和 TutorBench 名称被刻意划分为不同范围。贡献可以涉及软件、案例、评分标准、方法论、文档、适配器、网站改动,以及校准/审计基础设施。
社区状态: 公开参与说明已经可用;公开申请、reviewer intake 和真实 Community Review 活动尚未开始。