MModelTrust
全部进展

版本文章 / 项目日志

v0.4.0进行中

参考基准与行为一致性

比较引擎、基准注册表、双语证据界面与无密钥参考缓存架构已经实现。由于尚未配置官方参考凭证,也没有完成真实端到端比较,本版本仍标记为开发中。

本次变化

  • 定义 12 个不可变探针,覆盖指令、推理、结构化输出、工具调用与行为特征。
  • 注册可配置的 OpenAI、Anthropic 与 DeepSeek 官方参考模型,并提供相应服务商适配器。
  • 实现精确、约束、JSON Schema、数值、工具调用与特征向量评估器,以及有限候选比较。
  • 新增兼容性键控的 30 天参考缓存、无密钥 Level 2 报告结构与双语基准页面。

验证证据

  • 确定性评估器与模拟比较测试
  • 重复性、部分失败、超时与类型契约检查
  • Level 2 缺少参考样本时的安全门

下一项目标

配置一个官方服务商密钥与确切模型 ID,完成首次私有运行,并在不同时间窗口重复验证后,才能把本版本标记为已上线。

版本边界

本文章记录已上线工作与明确限制。Patch 版本不会把实验结果描述成正式能力。