Skip to main content

AI 配置

接哪些大模型、故障转移顺序、推理强度;每个 provider 的健康和 24 小时调用量。

模型运行概览

含义
模型可用率启用中的 provider 里有几个正常;故障转移链有几级
调用量(24 小时)按审计统计的调用次数、失败数、p95 耗时(审计没开就没有这项)
累计失败网关启动以来的累计失败、是否有 provider 正在连续失败、最近一次失败

故障转移链与调用活动

按模型路由里的顺序排列:当前在用的、上次成功时间、连续失败次数。一个 provider 连续失败就自动落到下一个;每个答案记录由哪个模型作答。右侧是过去 24 小时的调用曲线。

模型路由

每个 provider 一张卡,展开设置:

字段说明
类型openai(含所有 OpenAI 兼容网关:火山方舟、DeepSeek、通义、Ollama、vLLM…)或 azure(要填 API 版本和部署名,不是模型名)
模型火山方舟 coding 计划填 ark-code-latest,自建 endpoint 填 endpoint id
Base URL端点地址
API key粘贴新 key;留空保留现有(显示尾 4 位)
标签primary,cloud 这类,只用于标记
超时(秒)单次调用上限,默认 180。研判 / 调查 / 规则生成在思考模型上单次可到几分钟,撞超时会降级(研判标「AI 评分未完成」),慢模型调到 300+
推理强度见下

顺序就是故障转移顺序,拖动调整。替换 provider:先「新增 provider」填好并启用,再删旧的,最后「保存并重载」。保存空列表会让所有 LLM 调用失败。

推理强度

思考模型(豆包 / GPT-5 / Claude / Qwen3 / Gemini 2.5 等)默认先推理再作答,每次多花 30–90 秒。网关按任务分级:

档位行为
自动(推荐)起标题、想角度、Offense 摘要这类不推理;NL→AQL 低推理(RST_NL2AQL_REASONING);Offense 调查、研判、规则设计高推理
所有任务都不推理
低 / 高覆盖所有任务

网关按 Base URL 和模型名识别供应商,把档位翻译成各家的参数(Ark thinking、OpenAI reasoning_effort、Qwen enable_thinking、Claude thinking、Gemini、OpenRouter);认不出的模型不发参数,带参数被 400 就去掉参数重试。OpenAI o 系列 / GPT-5 的「高」发 reasoning_effort=high,比默认贵。

研判经常撞超时时,先把这个 provider 的推理强度调「低」看质量差多少,再决定是调高超时还是换模型。

配置存在哪

/app/state/llm_providers.yml(状态卷里),API key 加密存储。.env 里的 LLM_* 只是第一次启动时的种子。

本页内容