MModelTrust

基准注册表

版本化测试,公开其边界。

每份 ModelTrust 报告都会保留生成它的基准与探针集版本。行为结果始终属于实验性证据,不是模型身份概率。

实验性 · 已实现,等待首次官方参考运行

mt-bench-0.3.0

发布日期

2026-08-15

探针数量

12

采样方式

每个探针 3 个参考样本 / 1 个候选样本

参考架构

OpenAI 与 DeepSeek 已配置;Anthropic 适配器已注册 (2/3 active)

方法版本

mt-probes-0.4.0

包含证据

  • 运行完整性
  • 指令遵循
  • 推理
  • 结构化输出
  • 工具调用
  • 行为特征

披露策略

6 个探针公开方法摘要,另 6 个标记为保留。本版本不实现复杂的秘密探针基础设施;这一划分用于记录未来的抗刷榜边界。

科学边界

较高的行为一致性只表示候选端点在这些评估器上与缓存的官方参考样本表现相近,不能确认权重、路由、量化、微调、系统提示词或服务商意图。

生产运行基准

在首个真实的官方参考/候选比较通过生产验证前,mt-bench-0.2.0 仍是正式上线的 Level 1 协议。

阅读方法论