可达性
可用检查公开 HTTPS 解析与安全网络可达性。
方法论 / mt-bench-0.4.0 实验性
ModelTrust 评估外部可观察行为。运行完整性已经上线;v0.4 比较引擎已经实现,但在真实官方参考/候选运行通过验证前仍属于实验性功能。
解释规则
描述实际观测,绝不把运行指标转换成模型身份结论。
服务商可能对端点进行路由、量化、封装、微调或限流。模型标识和响应行为属于证据,并不能用密码学方式证明实际提供响应的是哪一组权重。
实现成熟度本身也是结果的一部分。
检查公开 HTTPS 解析与安全网络可达性。
通过三次有限请求测量可用率、延迟、结构有效性、返回标识、结束原因与 Usage 遥测。
使用 12 个版本化探针对官方参考样本与候选样本进行比较;目前没有发布通过验证的生产运行。
仅限概率性研究,无法证明确切的底层模型权重。
重复证据窗口与漂移检测;尚未实现。
当前基准连续发送三次控制请求;数据结构已支持未来五次采样,无需改变报告字段。
每次外部请求最多 10 秒;完整验证最长 35 秒。
端点被要求返回简短的精确控制文本。响应文本只在运行中判断,绝不保存。
每个样本记录时间、状态、HTTP 状态、延迟、模型标识、结束原因、Usage 提供情况与计数、结构有效性及安全错误类别。
报告展示可用率、延迟最小/中位/最大值、范围与中位数之比、标识一致性、结构一致性、Usage 状态与结束原因。
Level 1 指标不会被转换成总信任分、置信百分比或模型身份结论。
通过版本化注册表选择官方端点。配置的模型 ID 与仅服务端服务商密钥构成参考来源;这一信任锚会被记录,但不会被视为绝对真值。
12 个不可变低成本探针覆盖指令遵循、短推理、JSON 结构、工具调用与低权重的可观察风格特征。
每个参考探针采样 3 次以呈现方差;候选端点收到完全相同的探针一次,并受并发、超时、请求数和输出 token 上限约束。
系统会保留评估器范围。缺失样本或参考行为不稳定会降低低/中/高证据置信等级,而不会虚构数字置信度。
百分比表示 mt-bench-0.4.0 下的评估器相似度,不是共享权重的概率,也不是对某个模型名称的确定判决。
按探针类型分别使用精确匹配、约束、JSON Schema、数值容差、工具选择/参数与特征向量;不存在一个通用 embedding 分数。
路由、封装、系统提示、安全策略、量化、微调、服务商更新和随机变化都可能改变可观察行为。
公开方法支持审查;未来可用轮换保留探针降低针对固定指纹的优化。v0.4 只记录这条边界,不构建复杂秘密基础设施。
Base URL 必须是公开 HTTPS 端点。DNS 结果会检查私有、回环、链路本地、文档与保留地址范围,并阻止重定向。API key 只存在于本次运行,不会被保存、记录、返回或发送给分析服务。报告只保留端点主机名和无密钥的标准化证据,30 分钟后过期。
公开表单采用基于哈希 IP 与会话的尽力而为时间窗口、较小的单实例并发上限与运行时长上限。这些 MVP 限制可减少意外滥用,但不宣称为全局原子的分布式配额。
注册表支持 OpenAI、Anthropic 与 DeepSeek 官方端点配置。参考凭证始终仅服务端可见;参考产物只保留标准化评估证据,不包含密钥或原始提示/响应。未真实完成官方运行前不会宣称已有参考结果。
每份报告都引用一个不可变的基准定义。采样、超时、测试版本、评分状态或实验状态发生变化时,必须创建新的基准 ID。
报告包含基准、协议、样本数、超时、时间戳与 ModelTrust 版本。有限样本只是一次观测,并不代表端点未来始终保持相同行为。
为测试付费,绝不为排名付费。服务商关系不能改变方法论待遇;仅凭行为差异也不能指控服务商存在欺骗。
路由、系统提示、封装、微调、量化、限流和其他实现差异都可能改变行为。三次样本只是诊断窗口,不属于长期证据。
这些资料用于协议设计与术语参考,不属于 ModelTrust 的研究结论或验证证据。