模型

面向 AI 教学的
透明模型
证据目录
。

公开模型档案将由版本化基准结果产物生成。每份档案都会保留模型身份、执行语境、基准案例组与可追踪证据。

目前尚无校准后的公开模型运行记录。 档案是证据记录,不是排名。

筛选模型
视图

0 个公开模型 · 有公开模型档案后开放筛选

模型登记目录

模型身份与证据

0 份公开档案

暂无公开档案

目前尚无公开模型档案。

目前尚无校准后的公开模型运行记录。

只有当公开产物中具备模型身份、快照/版本、基准案例组、生成身份以及可追踪评测记录时,才会出现模型档案。

查看 Results 状态

未来档案契约

公开模型档案必须包含什么

这些字段标签展示证据边界。破折号只是占位符,不代表模型结果。

基准版本
0.1
这里只表示登记目录语境,不暗示存在模型运行。
数据集案例组
tutor-eval-v0.2a@0.2a.6
未来公开产物必须明确标识其案例组。

身份

只有当身份能够解析到版本化产物时,才可公开。

模型
—
服务提供方
—
快照 / 版本
—

评测证据

只有有效结果记录及其评测语境公开后,才会显示分数。

总体
—
正确性
—
诊断能力
—
引导能力
—
适应能力
—
可执行性
—
严重失败率
—
答案泄露率
—
延迟
—
token 数
—
成本
—

可追踪性

生成身份与评测记录身份让档案保持可审计、可比较。

数据集案例组
—
生成规格 ID
—
生成规格版本
—
Prompt 版本
—
Prompt 身份
—
Prompt SHA-256
—
最大输出 token 数
—
评测运行次数
—

未来的优势与弱点可以来自已存储的类别指标、失败率和经过验证的结果证据,而不能来自事后自由生成的 AI 总结。

我们的做法

可比较的证据,
而不是空泛主张。

未来模型档案只能在基准版本、数据集案例组、生成条件和评测程序相匹配的条件下解读。Teachometry 测量结构化、人工编写案例中的可观察教学行为,不衡量长期学习增益、知识留存、迁移、学生满意度或一般课堂教学有效性。

阅读方法论

当前模型发布状态

先有证据,再下结论。

目前尚无校准后的公开模型运行记录或公开档案。在满足发布边界之前,登记目录将保持为空。

公开模型产物 / 结构
可用公开契约已经定义,目前条目仍为空。
校准后的公开模型运行记录
无目前尚无校准后的公开模型运行记录。
公开模型档案
无档案必须同时具备身份与可追踪证据。
正式公开排名
无Results / Leaderboard 仍是排名展示页面。
人工校准
尚未完成目前没有可用的人类参考集。
Judge 与人工对照验证
尚未完成当前不主张已完成验证。
统计验证
尚未完成当前不主张已经完成统计验证。

展望下一步

先积累更好的证据,再形成更多结论。

登记目录只会从满足项目发布与可追踪边界的公开、版本化产物中增长。