无需服务提供方
- Quickstart 演示
- 公开案例/数据检查
- 冻结语料验证与重放
- 网站与产物工作流
- Dry-run 与请求校验
运行 · 开始使用
先在本地运行 TutorBench,再把外部 Tutor 接入 Tutor Health 工作流,诊断人工编写真实场景中的具体教学失败。标准基准与冻结证据路径继续作为底层可复现层保留。
同样的问题。
更清晰的证据。
克隆仓库并运行确定性 Quickstart。
# 1. Clone the repository
git clone https://github.com/shuangyan123/tutorbench.git
cd tutorbench
# 2. Install dependencies
npm ci
# 3. Run the Quickstart (no API key)
npm run quickstart
这是不产生总分的开发/冒烟演示;Quickstart 不会削弱标准基准的边界。
npm install tutor-benchmarktutorbench quickstart针对 HTTP Tutor 运行以发现项为先的 Productive Struggle & Intervention 套件。
tutorbench health \
--http https://partner.example.com/respond \
--suite productive-struggle-intervention-v0.1 \
--tutor-provider partner \
--tutor-model production \
--prompt-version v17 \
--output artifacts/partner-pilot
当前 13 情境套件是人工编写的合成设计产物,只覆盖部分健康维度;它不是经过验证的一般 Tutor 质量或学习结果测量。
使用当前公开数据集,并保留其 fail-closed 评估器边界。
npm run benchmark
标准运行不同于四案例 Quickstart;没有 Judge 配置时可能报告错误或不产生分数。
运行仓库示例,然后把 TutorTurnInput 发送到 POST /respond。
python examples/http-python-tutor/server.py
tutorbench run --http http://127.0.0.1:8000/respond --limit 3
适配器在边缘评估 Tutor 回复;仅供评估器使用的证据保留在 TutorBench 内部。
采集产品 Tutor 或标准模型回复,然后离线评估冻结语料。
tutorbench collect --http http://127.0.0.1:8000/respond --provider <provider> --model <actual-model-id> --prompt-version product-config-v3 --provenance external --limit 3 --output artifacts/product/product.json
tutorbench collect-model --http http://127.0.0.1:9000/generate --provider <provider> --model <actual-model-id> --limit 3 --output artifacts/real-model/model.json
tutorbench evaluate --corpus artifacts/real-model/model.json
# Export the semantic and canonical packets
npm run tutor:export-execution -- -- --case fraction-misconception-001
npm run tutor:export-cases
# Validate and replay a frozen corpus
npm run tutor:corpus:validate -- -- --corpus path/to/corpus.json
npm run benchmark:corpus -- -- --corpus path/to/corpus.json
# OpenAI Judge dry-run (no network)
npm run judge:openai -- -- --dry-run
# Frozen-corpus DeepSeek Judge subset
node dist/src/cli/tutorbench.js evaluate \
--corpus artifacts/real-model/baseline.json \
--limit 1 \
--judge-deepseek
采集不等于发布、校准或取得排行榜资格;冻结证据可以离线检查和重放。baseline-native-default 配置不约束可选的 temperature、reasoning 和 seed 控制项,避免将不同服务提供方的原生行为误称为一致。tutor:export-cases 是 Tutor 可见的语义适配器数据包;tutor:export-execution 是用于使模型运行可比较的标准基准数据包。两者均不包含仅供评估器使用的注释。使用同一基准并不意味着每个服务提供方都提供相同的推理控制项。
如何运行
克隆仓库或安装已发布的软件包。
先从 Quickstart 开始,然后使用 Tutor Health 对外部 Tutor 运行诊断。
在下一次修改 Tutor 之前,检查发现、证据、覆盖情况与版本化产物。
可追踪的运行。
服务于更好的研究。
让每次运行都清晰可读
请将以下信息与结果一起记录,方便验证、重放和比较。
tutor-eval-v0.2a@0.2a.6
correct-answer-wrong-reasoning-001correct-answer-wrong-reasoning-001-zh-CNfraction-misconception-001fraction-misconception-001-zh-CN