运行 · 开始使用

从研究
问题走向
可复现运行。

先在本地运行 TutorBench,再把外部 Tutor 接入 Tutor Health 工作流,诊断人工编写真实场景中的具体教学失败。标准基准与冻结证据路径继续作为底层可复现层保留。

开源 透明评测 证据优先

同样的问题。
更清晰的证据。

运行工作流

开始使用(无需服务提供方)

克隆仓库并运行确定性 Quickstart。

# 1. Clone the repository
git clone https://github.com/shuangyan123/tutorbench.git
cd tutorbench

# 2. Install dependencies
npm ci

# 3. Run the Quickstart (no API key)
npm run quickstart
  • 无需 API key 即可本地运行
  • 使用 tutor-eval-v0.1@0.1 中的 4 个固定案例
  • 无需 Judge,无需网络连接
  • 确定性检查(不产生正式分数)
  • 不具备排行榜资格

这是不产生总分的开发/冒烟演示;Quickstart 不会削弱标准基准的边界。

更想使用已发布的软件包?安装已发布的 CLI,然后运行同一个确定性演示。
npm install tutor-benchmarktutorbench quickstart

如何运行

  1. 1

    安装

    克隆仓库或安装已发布的软件包。

  2. 2

    运行

    先从 Quickstart 开始,然后使用 Tutor Health 对外部 Tutor 运行诊断。

  3. 3

    检查

    在下一次修改 Tutor 之前,检查发现、证据、覆盖情况与版本化产物。

可追踪的运行。
服务于更好的研究。

执行边界

现在可以运行什么?

不同工作流服务于不同目的。这里说明当前可用的内容、需要额外组件的内容,以及仍不属于当前公开范围的内容。

无需服务提供方

  • Quickstart 演示
  • 公开案例/数据检查
  • 冻结语料验证与重放
  • 网站与产物工作流
  • Dry-run 与请求校验
立即在本地运行

外部 Tutor / 模型

  • HTTP Tutor 适配器(POST /respond)
  • 产品 Tutor 采集
  • 标准模型采集
  • 显式 Judge 服务提供方(OpenAI Responses、DeepSeek)
  • 高级离线分析工作流
查看配置指南

尚未公开

  • 校准后的公开模型结果
  • 人工校准与验证
  • 统计验证
  • 正式排行榜
了解路线图

让每次运行都清晰可读

可复现性检查表

请将以下信息与结果一起记录,方便验证、重放和比较。

  • 数据集版本例如,tutor-eval-v0.2a@0.2a.6
  • 案例或语料身份案例 ID 或冻结语料
  • Prompt / 生成规格Prompt 模板与参数
  • 服务提供方与模型快照模型名称、版本和设置(如适用)
  • 运行元数据日期、环境、配置
  • 证据输出日志、追踪信息与评测结果

tutor-eval-v0.2a@0.2a.6

结构化案例
用于透明评测。

  • correct-answer-wrong-reasoning-001
  • correct-answer-wrong-reasoning-001-zh-CN
  • fraction-misconception-001
  • fraction-misconception-001-zh-CN
…
相同案例。
不同 Tutor。
可比较的证据。