可用性管理
后台可用性页面汇总真实调用和主动探测结果,帮助定位模型故障。状态、成功率和启用开关分别表示不同含义。
查看样本
先选择模型,查看近期失败原因、样本来源和连续失败次数。用户样本来自用量记录;系统样本来自主动探测。
最近样本成功显示正常,失败显示故障,没有样本显示未知。成功率另行计算,应结合样本总量判断。用户取消和调用前拒绝不作为模型故障样本。
策略设置
| 设置键 | 默认值 | 含义 |
|---|---|---|
health.probe | true | 当前窗口没有有效样本时允许主动探测 |
health.window_minutes | 30 | 统计和空闲判断窗口 |
health.disable_after | 0 | 连续失败自动停用阈值,0 为关闭 |
health.disable_below | 0 | 保存的成功率停用阈值,见下方实现限制 |
health.warn_below | 90 | 用户页面的成功率警戒值 |
health.show_users | false | 向登录用户开放状态页面 |
health.retain_days | 14 | 主动探测记录保留天数 |
后台任务启动时运行一次,之后约每十分钟执行一轮。窗口长度不是探测间隔;已有有效样本时不会为了刷新状态反复调用上游。
自动停用与恢复
连续失败达到已配置阈值时,检查器可自动停用模型,并记录它是被系统停用的。
系统停用的模型仍可参与后续检查。窗口内样本消退后,开启的主动探测可以补充新结果;最近结果恢复正常时,检查器重新启用该模型。管理员手动关闭的模型不会被检查器擅自打开。
当前实现限制
成功率阈值虽可在后台保存,但当前服务端周期任务没有把 health.disable_below 传入检查器,因此不能依赖它执行自动停用。周期任务同样没有传入统计重置时间;重置后的展示范围与自动停用判断可能暂时不同。
重置统计
修复上游后,可以使用重置操作更新统计起算时间。页面排除起算时间之前的样本,但不会因此删除用量账本或请求日志。
重置后出现未知状态是正常情况,需要新的有效样本。重置不能替代修复凭据、网络或模型配置。
排查顺序
- 查看错误来源与最近失败时间。
- 核对服务商密钥、模型 ID 和网络。
- 测试一次实际调用。
- 确认模型是手动停用还是自动停用。
- 再决定是否恢复启用或调整阈值。
普通用户页面只展示已允许公开的信息,使用方式见服务状态。