功能介绍
API设置台是沙包国企党政通的 AI 模型配置中心。支持多供应商模型接入,一键测试连接,V2.0 模型路由自动选择最优模型,故障自动切换。支持完全本地部署,数据不出内网,满足国企信息安全要求。
总体使用演示
API设置台 — AI 模型配置中心全流程
已上传
支持 DeepSeek、智谱 GLM、通义千问、月之暗面 Kimi、Ollama(本地)五大供应商,灵活配置,按需切换。
- 每个供应商独立配置 API Key、Base URL、模型名称
- 配置后一键测试连接,即时反馈连接状态
- 支持同时配置多个供应商,随时切换
智能路由引擎自动选择最优模型,支持故障自动切换。当当前模型不可用时,无缝切换到备用模型,保障业务连续性。
- 自动选择最优模型:根据任务类型、模型负载、响应速度智能选择
- 故障自动切换:当前模型调用失败 → 自动尝试下一个可用模型
- 优先级配置:云端优先 / 本地优先 / 成本优先,三种策略可选
- 切换日志记录:每次切换记录原因、时间、目标模型,便于排查
实时检测各模型可用状态,显示当前模型调用费用,帮助用户合理控制成本。
- 健康检查:实时检测各供应商 API 可用性,绿色=正常 / 红色=异常
- 费用显示:显示当前模型累计调用费用,按天/周/月统计
- 费用预警:设置费用上限,超出时自动提醒并切换至低成本模型
- 调用统计:各模型调用次数、成功率、平均响应时间
保存多套配置方案,快速切换。适合不同场景(内网/外网、开发/生产)的快速切换。
- 保存多套配置档案,命名自定义(如"内网环境""外网环境")
- 一键切换配置档案,无需重复输入 API Key
- 导入导出配置档案,便于团队共享或备份
- 配置档案加密存储,API Key 本地加密,不外传
本地模型配置指南
完全本地部署,数据不出内网。推荐使用 Ollama 部署本地模型,以下为适合本软件(国企党建公文写作)的模型推荐与配置方法。
Ollama 是本地大模型运行框架,免费开源,支持 Windows / macOS / Linux。
- 官网下载:https://ollama.com/download(Windows 版下载后双击安装即可)
- 安装后打开命令行(CMD 或 PowerShell),输入
ollama --version 验证安装成功
- Ollama 默认服务地址:
http://localhost:11434
- 安装后常驻后台,本软件通过该地址调用本地模型
本软件以党建公文写作为主,推荐中文能力强、能本地运行的模型。按显卡显存选择:
- 入门级(8GB 显存):qwen2.5:7b — 通义千问 7B,中文流畅,日常公文写作够用
- 推荐级(16GB 显存):qwen2.5:14b — 中文综合最强,党建材料撰写首选
- 推荐级(12GB 显存):glm4:9b — 智谱 GLM4,合规性好,政策敏感内容稳妥
- 高配级(24GB+ 显存):qwen2.5:32b — 最强中文,长材料生成质量最高
- 推理增强(16GB 显存):deepseek-r1:14b — 推理能力强,适合复杂材料分析与逻辑梳理
首选推荐:qwen2.5:14b(中文写作与党建材料综合表现最佳)
拉取命令(命令行执行,首次下载约 5~20GB,取决于模型大小):
ollama pull qwen2.5:14b
模型拉取完成后,回到本软件 API设置台,按以下步骤接入:
- 供应商选择:Ollama(本地)
- Base URL:
http://localhost:11434
- 模型名称:
qwen2.5:14b(与上面拉取的模型名一致)
- API Key:本地模型无需填写,留空即可
- 点击「测试连接」,显示绿色「在线」即配置成功,可开始使用
qwen2.5:7b / glm4:9b(量化版)
qwen2.5:14b / glm4:9b / deepseek-r1:14b
qwen2.5:32b / deepseek-r1:32b
- 显存查看:命令行输入
nvidia-smi 查看 GPU 显存
- 模型切换:可拉取多个模型,在 API设置台 随时切换模型名称
- 磁盘占用:每个模型约 5~20GB,建议预留 50GB 以上空间
企业集中部署方案
国企在单位服务器集中部署大模型,职工通过内网统一访问。一次部署,全员共用,数据不出企业,统一管控、统一计费、统一升级。
适合 30 人以上国企党委/党群部统一部署,职工无需各自配置模型
单位服务器部署大模型 → 内网开放 API → 职工电脑填服务器地址接入。
- 服务器端:IT 部门在单位服务器安装 Ollama / vLLM,拉取模型,开放内网 API 端口
- 职工端:打开 API设置台 → 供应商选 Ollama → Base URL 填服务器内网地址(如 http://10.0.0.100:11434)→ 填模型名 → 测试连接
- 统一管控:IT 统一升级模型、统一监控用量、统一控制访问权限
- 数据安全:所有请求在内网闭环,不连外网,满足涉密场景
1 台服务器 + 1 张 RTX 4090(24GB)
跑 qwen2.5:14b / 32b
并发 3~5 人
1 台服务器 + 2 张 RTX 4090 或 1 张 A100
跑 qwen2.5:32b / 72b
并发 10~20 人
多 GPU 服务器(4×A100 80GB)
跑 qwen2.5:72b 多实例
并发 50+ 人
自建一次投入硬件,长期省 API 费用;云端按量计费,重度使用成本高。以下为参考估算:
- 小型自建:硬件 ¥2.5~3.5 万(含 1 张 RTX 4090)+ 年电费运维 ¥0.3~0.5 万
- 中型自建:硬件 ¥6~10 万(含 2 张 4090 或 1 张 A100)+ 年电费运维 ¥0.5~1 万
- 大型自建:硬件 ¥20 万+(多 A100 服务器)+ 年电费运维 ¥1~2 万
📊 云端 API 年费对比(以 50 人重度使用估算)
- DeepSeek API:约 ¥2.5~10 万/年(按 token 用量,重度写作偏高)
- 智谱 GLM / 通义千问:约 ¥3~12 万/年
- 自建中型:硬件 ¥6~10 万(一次投入)+ 年运维 ¥0.5~1 万 → 2~3 年回本,之后每年省数万 API 费
结论:50 人以上、重度使用的国企,自建 2~3 年回本,长期更省;偶尔轻度使用可先用云端 API
- ① 服务器装 Ollama:Linux / Windows Server 安装 Ollama,拉取模型(
ollama pull qwen2.5:32b)
- ② 配置内网监听:设置环境变量
OLLAMA_HOST=0.0.0.0:11434,让内网可访问
- ③ 开放防火墙端口:内网开放 11434 端口(仅内网,禁止外网)
- ④ 职工配置:通知职工在 API设置台填服务器地址 + 模型名,测试连接即可使用
- ⑤ 可选 vLLM:大并发场景用 vLLM 替代 Ollama,吞吐量更高(需 Docker + GPU 驱动)
典型场景
- 首次配置:打开 API设置台 → 选择 DeepSeek → 输入 API Key → 测试连接 → 保存配置 → 开始使用
- 内网环境切换:选择"内网环境"配置档案 → 自动切换至 Ollama 本地模型 → 数据不出内网
- 故障自动恢复:DeepSeek 服务异常 → 模型路由自动切换至智谱 GLM → 业务不中断 → 日志记录切换原因
- 费用控制:设置月度费用上限 → 接近上限时自动提醒 → 超出后自动切换至低成本模型