MModelTrust

方法论 / mt-bench-0.1.0

保留不确定性的证据。

ModelTrust 评估外部可观察行为。黑盒识别可以估计端点与参考模型的一致程度,但无法用密码学方式证明实际提供响应的是哪一组模型权重。

解释规则

报告统计置信度与能力完整性,绝不输出二元的“真模型 / 假模型”判定。

服务商可能对端点进行路由、量化、封装、微调或限流。观察到的能力差异并不能单独证明欺骗行为或隐藏模型身份。

初始测试类别

1 个已实现 · 3 个实验中 · 4 个占位

01

行为指纹

将响应分布与版本化参考样本进行比较。实验中;v0.2.0 尚无经过验证的模型指纹。

02

推理能力

通过有限、关注污染风险的推理任务测量能力保留度。实验中。

03

指令遵循

测试对冲突、嵌套和结构化指令的遵循程度。占位。

04

工具 / 函数调用

检查 schema 遵循、参数有效性与调用一致性。占位。

05

上下文窗口行为

测量长上下文中的召回、位置敏感性与能力退化。占位。

06

Token 统计

比较服务商报告用量、独立估算值和响应结构。实验中。

07

延迟

在验证服务器侧测量有限请求的完成时间。已实现一次控制请求。

08

可靠性

通过重复采样汇总成功、错误和超时比例。占位。

可复现方向

基准将进行版本管理。未来报告应公开采样规则、参考窗口、评分转换和置信区间,同时避免暴露仍在使用的反作弊测试项。

独立性规则

服务商可以为测试付费,但不能为排名付费。未来的 ModelTrust 路由必须与验证评分保持分离,也不能获得方法论上的优待。