Skip to main content

AI 配置

接哪些大模型、故障转移顺序、推理强度;知识库的向量模型;每个 provider 的健康和 24 小时调用量。

AI 配置

模型运行概览

概览

含义
模型可用率启用中的 provider 里有几个正常;故障转移链有几级
调用量(24 小时)按审计索引统计的调用次数、失败数、p95 耗时(审计没开就没有这项)
累计失败网关启动以来的累计失败、是否有 provider 正在连续失败、最近一次失败

故障转移链与调用活动

故障转移链

按模型路由里的顺序排列:当前在用的、上次成功时间、连续失败次数。一个 provider 连续失败就自动落到下一个;每个答案记录由哪个模型作答。右侧是过去 24 小时的调用曲线。

模型路由

模型路由

每个 provider 一张卡,展开设置:

字段说明
类型openai(含所有 OpenAI 兼容网关:火山方舟、DeepSeek、通义、Ollama、vLLM…)或 azure(要填 API 版本和部署名,不是模型名)
模型火山方舟 coding 计划填 ark-code-latest,自建 endpoint 填 endpoint id
Base URL端点地址
API key粘贴新 key;留空保留现有(显示尾 4 位)
标签primary,cloud 这类,只用于标记
超时(秒)单次调用上限,默认 180
推理强度见下

顺序就是故障转移顺序,拖动调整。替换 provider:先「新增 provider」填好并启用,再删旧的,最后「保存并重载」。保存空列表会让所有 LLM 调用失败。

推理强度

思考模型(豆包 / GPT-5 / Claude / Qwen3 / Gemini 2.5 等)默认先推理再作答,每次多花 30–90 秒。网关按任务分级:

档位行为
自动(推荐)起标题、想角度、挑索引这类不推理;NL→DSL 低推理;告警调查、分诊、检测规则高推理
所有任务都不推理
低 / 高覆盖所有任务

网关按 Base URL 和模型名识别供应商,把档位翻译成各家的参数(Ark thinking、OpenAI reasoning_effort、Qwen enable_thinking、Claude thinking、Gemini、OpenRouter);认不出的模型不发参数,带参数被 400 就去掉参数重试。OpenAI o 系列 / GPT-5 的「高」发 reasoning_effort=high,比默认贵。

知识库向量模型

Embedding

处置手册需要一个 Embedding 模型。填模型 ID(如 doubao-embeddingtext-embedding-3-small、本地 Ollama 的 bge-m3)、端点(留空复用聊天模型端点)、key(留空复用)。「测试连接」通过后向量维度自动回填,保存即启用知识库。

现有 KB 索引的维度和新模型不一致时保存被拒绝,先重建索引。

气隙环境用本地 Ollama + bge-m3(1024 维,CPU 上一次查询约 50 ms),端点 http://<ollama 主机>:11434/v1

配置存在哪

/app/state/llm_providers.yml(状态卷里),API key 加密存储。.env 里的 LLM_* 只是第一次启动时的种子。

本页内容