跳到正文

可用性管理

后台可用性页面汇总真实调用和主动探测结果,帮助定位模型故障。状态、成功率和启用开关分别表示不同含义。

查看样本

先选择模型,查看近期失败原因、样本来源和连续失败次数。用户样本来自用量记录;系统样本来自主动探测。

最近样本成功显示正常,失败显示故障,没有样本显示未知。成功率另行计算,应结合样本总量判断。用户取消和调用前拒绝不作为模型故障样本。

策略设置

设置键默认值含义
health.probetrue当前窗口没有有效样本时允许主动探测
health.window_minutes30统计和空闲判断窗口
health.disable_after0连续失败自动停用阈值,0 为关闭
health.disable_below0保存的成功率停用阈值,见下方实现限制
health.warn_below90用户页面的成功率警戒值
health.show_usersfalse向登录用户开放状态页面
health.retain_days14主动探测记录保留天数

后台任务启动时运行一次,之后约每十分钟执行一轮。窗口长度不是探测间隔;已有有效样本时不会为了刷新状态反复调用上游。

自动停用与恢复

连续失败达到已配置阈值时,检查器可自动停用模型,并记录它是被系统停用的。

系统停用的模型仍可参与后续检查。窗口内样本消退后,开启的主动探测可以补充新结果;最近结果恢复正常时,检查器重新启用该模型。管理员手动关闭的模型不会被检查器擅自打开。

当前实现限制

成功率阈值虽可在后台保存,但当前服务端周期任务没有把 health.disable_below 传入检查器,因此不能依赖它执行自动停用。周期任务同样没有传入统计重置时间;重置后的展示范围与自动停用判断可能暂时不同。

重置统计

修复上游后,可以使用重置操作更新统计起算时间。页面排除起算时间之前的样本,但不会因此删除用量账本或请求日志。

重置后出现未知状态是正常情况,需要新的有效样本。重置不能替代修复凭据、网络或模型配置。

排查顺序

  1. 查看错误来源与最近失败时间。
  2. 核对服务商密钥、模型 ID 和网络。
  3. 测试一次实际调用。
  4. 确认模型是手动停用还是自动停用。
  5. 再决定是否恢复启用或调整阈值。

普通用户页面只展示已允许公开的信息,使用方式见服务状态

Obsidian Arc · 自托管 AI 工作空间