架构概述
云上大模型API + 本地知识库混合架构,是指在利用云端大模型强大生成能力的同时,将企业核心敏感数据和专业知识库部署在本地环境(或VPC内),通过RAG(检索增强生成)技术将两者有机结合的解决方案。该架构实现了"数据不出域 + 智能上云"的平衡,是金融、政务、医疗等强监管行业落地大模型时的主流架构选择。
核心设计理念
敏感数据与知识库部署于本地 — 保障数据主权与合规;
大模型推理调用云上API — 获取最强智能能力,无需自建GPU集群;
RAG检索增强充当桥梁 — 将本地知识注入用户Prompt,实现精准、可信、可溯源生成。
架构组件详解
混合架构由四大核心层组成,各层分工明确、松耦合协作,可根据企业实际需求灵活选型。
🔗 用户接入层
企业APP、Web端、内部研发工具等客户端,通过统一API网关将请求路由至业务服务层。支持身份认证、权限控制、访问限流,确保每一条请求可追踪、可管控。
⚙️ 业务服务层
承载具体业务场景:内容审核、代码生成、智能问答、投研分析等。每个业务模块将用户请求组装为标准Prompt,调用核心协同层,实现业务逻辑与大模型能力的解耦。
☁️ 云上大模型API
调用主流云服务商的大模型推理服务(如天翼云星辰TokensHub、阿里通义、百度文心等),支持文本生成、代码生成、语义理解、多轮对话等能力。按Tokens计费,弹性伸缩,无需自建GPU集群。
🔒 本地知识库 — 数据不出域
包含RAG检索引擎、向量数据库(如Milvus/Qdrant)、企业文档库(规章制度、业务手册、历史案例)和业务规则引擎。所有数据本地存储,仅Prompt文本传输至云端。
关键组件技术选型
| 组件 | 功能 | 部署位置 | 技术选型参考 |
|---|---|---|---|
| API网关 | 统一入口、路由、限流、认证 | 本地 / VPC | Kong / APISIX / Nginx |
| Prompt编排引擎 | 组装系统提示、拼接RAG检索结果、管理对话历史 | 本地 | LangChain / LlamaIndex / 自研 |
| RAG检索引擎 | 语义检索、关键词检索、混合检索、重排序 | 本地 | LangChain / Haystack / 自研 |
| 向量数据库 | 存储文档Embedding,支持ANN近似最近邻检索 | 本地 | Milvus / Qdrant / Chroma / Elasticsearch |
| Embedding模型 | 将文档和查询转为向量表示 | 本地或云上 | BGE / M3E / 云上Embedding API |
| 文档处理管线 | PDF/Word/网页解析、文本切分、元数据提取 | 本地 | Unstructured / LangChain Loaders |
| 大模型API | 大语言模型推理服务 | 云上 | 天翼云星辰TokensHub / 阿里通义 / 百度文心 等 |
| 审计与监控 | 请求日志、Token用量统计、合规审计追踪 | 本地 + 云上 | ELK / Prometheus / 云管平台 |
核心数据流 — 六步闭环
用户发起请求
用户在业务终端发起请求,如APP内容审核(社区发帖)、IDE代码补全、智能问答提问等。
业务服务组装Prompt
业务层将原始请求转换为结构化Prompt,附加系统指令、角色定义、输出格式约束,确保大模型理解任务上下文。
本地知识库检索增强
RAG引擎对用户Query做向量化,在本地向量库中检索相关文档片段(如审核规则、历史案例、合规要求),将检索结果注入Prompt上下文。所有文档数据不离开本地环境。
调用云上大模型API
增强后的Prompt发送至云上大模型API,大模型结合本地知识进行推理生成。仅Prompt文本上传,原始文档/数据不出域。
结果后处理与返回
对生成结果进行合规校验、敏感词过滤、格式标准化。同时记录审计日志(请求内容、Token消耗、响应时间),满足合规审计要求。
知识库持续更新
新的业务规则、典型案例通过文档处理管线入库,定期更新向量索引,确保知识库时效性与准确性。
关键设计要点
🛡️ 数据安全隔离
企业核心文档和业务数据仅存储在本地知识库,不直接上传至云端。云端大模型仅接收经过处理的Prompt文本,实现"数据不出域"的安全要求,满足金融、政务等行业监管合规。
📝 Prompt工程与增强
通过精心设计的系统Prompt + RAG检索上下文 + Few-shot示例的组合策略,将大模型"幻觉"降至最低,使生成内容可溯源到具体文档来源,提升结果可信度。
⚡ 弹性伸缩与成本优化
云上API支持弹性伸缩,按Tokens用量计费。非高峰期减少并发,峰值自动扩容,兼顾性能和成本。支持缓存策略减少重复调用,进一步降低API费用。
🔍 检索质量保障
采用混合检索策略(语义+关键词),配合重排序模型提升Top-K结果精度。通过A/B测试持续验证RAG召回率和答案准确率,确保检索增强效果持续优化。
方案对比:为什么选择混合架构
| 对比维度 | 纯本地部署 | 纯云端方案 | 混合架构(推荐) |
|---|---|---|---|
| 模型能力 | 受限于本地硬件 | 最强 | 最强 |
| 数据安全 | 最高 | 需上传数据 | 高(数据不出域) |
| 运维成本 | 高(GPU集群) | 低 | 低(仅维护知识库) |
| 响应延迟 | 低 | 网络延迟 | 可接受 |
| 合规性 | 高 | 需额外合规方案 | 高 |
| 弹性伸缩 | 受限 | 按需扩容 | 按需扩容(云API) |
| 领域定制 | 高(本地微调) | 依赖Prompt | 高(RAG + 知识库) |
典型应用场景
🛡️ 内容安全审核
结合本地审核规则库和云上大模型能力,对UGC内容进行多维度审核(政治敏感、暴恐、色情、广告等),审核结果可溯源至具体规则条款。适用于社区、论坛、评论区等场景。
💻 研发效能提升
本地代码库索引 + 云上代码大模型,实现智能代码补全、Bug修复建议、代码Review辅助。企业代码资产保留在本地,仅将代码片段以Prompt形式提交,保障代码安全。
📊 智能投研分析
本地研究报告库 + 云上大模型,辅助分析师快速检索历史研报、生成摘要、发现关联事件。确保研报原文不出域,仅通过RAG检索相关段落增强分析。
📋 合规文档问答
法律法规、监管文件、公司制度等本地化部署,员工通过自然语言提问获取合规指引,所有引用内容精确标注来源段落,满足合规审计要求。
行业案例参考
项目背景
某大型互联网综合金融服务商,旗下运营综合财经平台及移动端APP,日均服务用户数千万级。随着大模型技术快速发展,该企业需要在保障金融数据安全合规的前提下,利用AI大模型提升内容审核效率与研发效能。
场景一:APP内容审核
用户发帖内容量大、时效性要求高。云上大模型API提供推理服务,结合本地审核规则库,通过RAG技术将审核标准注入Prompt,实现高精度、可溯源的自动化内容审核。日均处理百万级内容,审核准确率显著提升。
场景二:代码生成辅助
研发团队日常编码工作量大,云上大模型提供代码生成Token能力。本地代码规范库通过RAG增强Prompt,确保生成代码符合企业编码规范和项目上下文,研发效率明显提升。
项目价值
数据安全合规 — 金融数据和审核规则库本地化部署,云上仅传输Prompt文本,满足金融监管要求
高性价比 — 云上API按量计费,避免自建GPU集群的高昂初始投入与持续运维成本
弹性支撑业务增长 — 云上API弹性伸缩,从容应对业务高峰期和指数型增长
可复制性强 — 已验证混合架构在金融、政务、医疗等强监管行业的实际落地能力
飞凡云科提供的大模型混合架构服务
架构咨询与规划
根据企业业务场景和数据安全要求,定制混合架构方案
部署与集成
本地知识库搭建、RAG引擎部署、云上API对接
知识库构建
企业文档梳理、向量化处理、知识库持续更新
运维与优化
Prompt优化、检索质量调优、持续运维保障
需要大模型混合架构方案咨询?
飞凡云科为您提供从架构规划、部署实施到运维优化的全流程AI解决方案服务
📞 咨询热线:请访问官网获取最新联系方式 | 🌐 www.flyfen.cn
飞凡云科云上大模型API+本地知识库混合架构方案,通过RAG技术实现数据不出域+智能上云,兼顾数据安全与大模型能力,适用于金融、政务、医疗等强监管行业的AI大模型落地场景。