AI 配置
接哪些大模型、故障转移顺序、推理强度;每个 provider 的健康和 24 小时调用量。
模型运行概览
| 卡 | 含义 |
|---|---|
| 模型可用率 | 启用中的 provider 里有几个正常;故障转移链有几级 |
| 调用量(24 小时) | 按审计统计的调用次数、失败数、p95 耗时(审计没开就没有这项) |
| 累计失败 | 网关启动以来的累计失败、是否有 provider 正在连续失败、最近一次失败 |
故障转移链与调用活动
按模型路由里的顺序排列:当前在用的、上次成功时间、连续失败次数。一个 provider 连续失败就自动落到下一个;每个答案记录由哪个模型作答。右侧是过去 24 小时的调用曲线。
模型路由
每个 provider 一张卡,展开设置:
| 字段 | 说明 |
|---|---|
| 类型 | openai(含所有 OpenAI 兼容网关:火山方舟、DeepSeek、通义、Ollama、vLLM…)或 azure(要填 API 版本和部署名,不是模型名) |
| 模型 | 火山方舟 coding 计划填 ark-code-latest,自建 endpoint 填 endpoint id |
| Base URL | 端点地址 |
| API key | 粘贴新 key;留空保留现有(显示尾 4 位) |
| 标签 | primary,cloud 这类,只用于标记 |
| 超时(秒) | 单次调用上限,默认 180。研判 / 调查 / 规则生成在思考模型上单次可到几分钟,撞超时会降级(研判标「AI 评分未完成」),慢模型调到 300+ |
| 推理强度 | 见下 |
顺序就是故障转移顺序,拖动调整。替换 provider:先「新增 provider」填好并启用,再删旧的,最后「保存并重载」。保存空列表会让所有 LLM 调用失败。
推理强度
思考模型(豆包 / GPT-5 / Claude / Qwen3 / Gemini 2.5 等)默认先推理再作答,每次多花 30–90 秒。网关按任务分级:
| 档位 | 行为 |
|---|---|
| 自动(推荐) | 起标题、想角度、Offense 摘要这类不推理;NL→AQL 低推理(RST_NL2AQL_REASONING);Offense 调查、研判、规则设计高推理 |
| 关 | 所有任务都不推理 |
| 低 / 高 | 覆盖所有任务 |
网关按 Base URL 和模型名识别供应商,把档位翻译成各家的参数(Ark thinking、OpenAI reasoning_effort、Qwen enable_thinking、Claude thinking、Gemini、OpenRouter);认不出的模型不发参数,带参数被 400 就去掉参数重试。OpenAI o 系列 / GPT-5 的「高」发 reasoning_effort=high,比默认贵。
研判经常撞超时时,先把这个 provider 的推理强度调「低」看质量差多少,再决定是调高超时还是换模型。
配置存在哪
/app/state/llm_providers.yml(状态卷里),API key 加密存储。.env 里的 LLM_* 只是第一次启动时的种子。