Agent 对话总览
真实路由
知识库入库总览
虚拟别名
最近错误日志
| 时间 | 分类 | 模型 / 类型 | 供应商 | Key 别名 | 状态 | 错误详情 |
|---|
供应商与 Key 凭证库
统一配置各上游平台的基础 URL 与 API 密钥,可在 Agent 模型或知识库路由中灵活复用
Agent 模型中转
对外暴露标准 OpenAI 兼容模型,按 Key 序列自动负载与 429/5xx 故障自动切换
知识库入库虚拟模型
4 个入库专用虚拟别名(chat / embedding / reranker / ocr),每个支持挂载多个供应商模型轮询
接入网关信息
Base URL 接口地址—
已配置 Agent 模型—
Python (OpenAI SDK) 调用示例
知识库工具接口调用示例
知识库入库使用固定别名 chat / embedding / reranker / ocr,无需且不会出现在 /v1/models 列表中。
系统运行与可靠性参数
客户端连接鉴权与运行模式 (Client Authentication & Run Mode)
全局通用Authorization: Bearer <KEY> 传入的密钥。保存在加密配置中,修改立即生效。
控制管理后台页面自适应展示(隐藏无关参数/Tab)以及 /v1/models 的默认暴露范围。
全局高可用与限流熔断 (Global Reliability)
全局通用
每个 API Key 在途最大并发保护,防止打崩配额
单次请求在多候选 Key 之间轮换的最长等待窗口
针对 429001/TPM 超限的轻量避让,不累加熔断计数器
上游 500/502/503/504 等服务异常时的临时避让时间
Key 无效或 5小时配额用尽时的长期屏蔽(10分钟)
连续 5xx / 宕机达到该次数时触发深度熔断(429 限流不计入)
触发深度熔断后该候选节点的休眠锁定时间(5分钟)
启用延迟感知智能路由 (Latency-Based Routing)
根据历史真实响应延迟动态排序候选节点,优先选用响应速度最快的优质节点
Agent 模式设置 (Agent Mode)
Agent 真实模型
Agent 工具调用、深度思考推理等长耗时请求的响应超时
Agent 模式机制说明:
• 纯透传:原生透传
• 多 Key 轮询:单个 Key 遇到 429 TPM 超限时快速避让 10 秒并自动轮换至下一个 Key,不再死锁熔断。
• 纯透传:原生透传
tools / tool_choice 函数调用、reasoning_content 深度推理过程与流式 SSE 字节流。• 多 Key 轮询:单个 Key 遇到 429 TPM 超限时快速避让 10 秒并自动轮换至下一个 Key,不再死锁熔断。
知识库入库设置 (KB Ingestion)
KB 虚拟别名
知识库入库摘要提取的短超时(写死禁用思考 + 强制非流式)
大图识图或多页文档视觉模型识别超时
批量文本向量计算超时
检索召回文档重排计算超时
Key 轮换与分流策略 (Key Routing Policy)
分流调度
智能体编程场景(Cursor / Cline)推荐「粘性故障转移」,可保持会话连接与 KV Cache 稳定性,避免频繁切回限流 Key。
知识库无状态批量入库(Embedding / OCR / Rerank)推荐「轮询负载均衡」,可均匀打散流量并大幅提升入库吞吐量。
服务运维与系统重启
每日定时平滑重启 (Daily Auto-Restart)
每日凌晨 04:00 自动重启服务释放内存堆(Agent 模式推荐关闭以保持会话连续;KB 模式建议开启)
日志空间保护机制:系统底层配置了
journald 50MB 磁盘配额自动轮转(SystemMaxUse=50M, 7天保留),内存错误日志严格限定在 100 条以内,无需重启即可确保长期运行磁盘与内存零积压。
即时平滑重启服务 / 重载熔断状态
一键向后台发送平滑重启信号(约 2-3 秒完成),或一键清空所有 Key 的 429 冷却与熔断计数
配置备份与迁移
导出 / 导入完整系统配置
支持下载带有时间戳的加密 JSON 备份文件,或在不同环境间无缝迁移恢复