AI 配置
接哪些大模型、故障转移顺序、推理强度;知识库的向量模型;每个 provider 的健康和 24 小时调用量。

模型运行概览

| 卡 | 含义 |
|---|---|
| 模型可用率 | 启用中的 provider 里有几个正常;故障转移链有几级 |
| 调用量(24 小时) | 按审计索引统计的调用次数、失败数、p95 耗时(审计没开就没有这项) |
| 累计失败 | 网关启动以来的累计失败、是否有 provider 正在连续失败、最近一次失败 |
故障转移链与调用活动

按模型路由里的顺序排列:当前在用的、上次成功时间、连续失败次数。一个 provider 连续失败就自动落到下一个;每个答案记录由哪个模型作答。右侧是过去 24 小时的调用曲线。
模型路由

每个 provider 一张卡,展开设置:
| 字段 | 说明 |
|---|---|
| 类型 | openai(含所有 OpenAI 兼容网关:火山方舟、DeepSeek、通义、Ollama、vLLM…)或 azure(要填 API 版本和部署名,不是模型名) |
| 模型 | 火山方舟 coding 计划填 ark-code-latest,自建 endpoint 填 endpoint id |
| Base URL | 端点地址 |
| API key | 粘贴新 key;留空保留现有(显示尾 4 位) |
| 标签 | primary,cloud 这类,只用于标记 |
| 超时(秒) | 单次调用上限,默认 180 |
| 推理强度 | 见下 |
顺序就是故障转移顺序,拖动调整。替换 provider:先「新增 provider」填好并启用,再删旧的,最后「保存并重载」。保存空列表会让所有 LLM 调用失败。
推理强度
思考模型(豆包 / GPT-5 / Claude / Qwen3 / Gemini 2.5 等)默认先推理再作答,每次多花 30–90 秒。网关按任务分级:
| 档位 | 行为 |
|---|---|
| 自动(推荐) | 起标题、想角度、挑索引这类不推理;NL→DSL 低推理;告警调查、分诊、检测规则高推理 |
| 关 | 所有任务都不推理 |
| 低 / 高 | 覆盖所有任务 |
网关按 Base URL 和模型名识别供应商,把档位翻译成各家的参数(Ark thinking、OpenAI reasoning_effort、Qwen enable_thinking、Claude thinking、Gemini、OpenRouter);认不出的模型不发参数,带参数被 400 就去掉参数重试。OpenAI o 系列 / GPT-5 的「高」发 reasoning_effort=high,比默认贵。
知识库向量模型

处置手册需要一个 Embedding 模型。填模型 ID(如 doubao-embedding、text-embedding-3-small、本地 Ollama 的 bge-m3)、端点(留空复用聊天模型端点)、key(留空复用)。「测试连接」通过后向量维度自动回填,保存即启用知识库。
现有 KB 索引的维度和新模型不一致时保存被拒绝,先重建索引。
气隙环境用本地 Ollama + bge-m3(1024 维,CPU 上一次查询约 50 ms),端点 http://<ollama 主机>:11434/v1。
配置存在哪
/app/state/llm_providers.yml(状态卷里),API key 加密存储。.env 里的 LLM_* 只是第一次启动时的种子。