版本文章 / 项目日志
v0.4.0进行中
参考基准与行为一致性
比较引擎、基准注册表、双语证据界面与无密钥参考缓存架构已经实现。由于尚未配置官方参考凭证,也没有完成真实端到端比较,本版本仍标记为开发中。
本次变化
- ✓定义 12 个不可变探针,覆盖指令、推理、结构化输出、工具调用与行为特征。
- ✓注册可配置的 OpenAI、Anthropic 与 DeepSeek 官方参考模型,并提供相应服务商适配器。
- ✓实现精确、约束、JSON Schema、数值、工具调用与特征向量评估器,以及有限候选比较。
- ✓新增兼容性键控的 30 天参考缓存、无密钥 Level 2 报告结构与双语基准页面。
验证证据
- ●确定性评估器与模拟比较测试
- ●重复性、部分失败、超时与类型契约检查
- ●Level 2 缺少参考样本时的安全门
下一项目标
配置一个官方服务商密钥与确切模型 ID,完成首次私有运行,并在不同时间窗口重复验证后,才能把本版本标记为已上线。
版本边界
本文章记录已上线工作与明确限制。Patch 版本不会把实验结果描述成正式能力。