文档

文档

参考资料、安装、CLI、产物和评测工作流。

浏览 TutorBench 版本化仓库指南和公开参考页面。

证据
可以
追踪。

浏览文档导航
文档参考中心

开始使用 / 概览

概览

TutorBench 是用于测量可观察 AI 教学行为、独立于服务提供方的基础设施。本页把 Teachometry 的公开页面映射到定义安装、执行、产物与解释方式的仓库契约和指南。

网站只是仓库既有契约与指南的入口地图,并不替代源文档。

标准快照tutor-eval-v0.2a@0.2a.6
公开案例48
评分维度Correctness · Diagnosis · Guidance · Adaptation · Actionability
安装配置从真正的五分钟路径开始。打开 Quickstart 运行评测选择与你的证据需求匹配的工作流。打开运行页面 使用产物理解 packet、corpus 与 replay。阅读 0.4A 指南 理解结果解释输出前先阅读方法。阅读方法论

开始使用 / Quickstart

Quickstart

使用 Node 24 安装仓库,然后在无需服务提供方凭据或网络访问的情况下运行确定性的本地演示。

运行时要求Node 24>=24 <25
克隆仓库bash
git clone https://github.com/shuangyan123/tutorbench.git
cd tutorbench
npm ci
npm run quickstart
已发布 npm 包bash
npm install tutor-benchmark
tutorbench quickstart
✓

无需服务提供方、无需网络、无需 Judge。 Quickstart 使用来自以下数据集的四个固定开发/冒烟案例: tutor-eval-v0.1@0.1。它不是标准评分案例组,不会产生正式基准分数,也不具备排行榜资格。

参考地图

文档索引

这是通往当前仓库的一组精选入口。GitHub 链接打开源文件,站内链接打开对应公开页面。

显示 19 条参考资料

解释边界

请谨慎阅读证据。

这些区分可以避免一个有用的开发页面做出仓库并不支持的主张。

Quickstart ≠ 正式基准分数

它是确定性的开发/冒烟演示,不是经过校准的基准证据。

采集 ≠ 发布

在满足发布要求之前,产品 Tutor 和标准模型语料都仍属于初步材料。

Judge ≠ 参考真值

Judge 是一个评估器边界。当所需证据不可用时,未解决的标准必须继续保持未解决。

人工评审 ≠ 自动金标准

人工证据可以增强方法,但不会自动成为不可质疑的参考真值。

治理与贡献

为开放仓库定义清晰边界。

软件、人工编写的基准内容和 TutorBench 名称被刻意划分为不同范围。贡献可以涉及软件、案例、评分标准、方法论、文档、适配器、网站改动,以及校准/审计基础设施。

社区状态: 公开参与说明已经可用;公开申请、reviewer intake 和真实 Community Review 活动尚未开始。

软件Apache-2.0阅读 LICENSE
基准内容(人工编写)CC BY 4.0阅读内容许可
名称与视觉资产TutorBench Brand Policy阅读品牌政策

继续沿参考路径深入

下一步

从概览进入与你的问题最匹配的仓库页面。

还在寻找?

可继续在指南、方法论或仓库中查找。