🤔 Introducing APISIX AI Gateway – Built for LLMs and AI workloads. Learn More

Apache APISIX AI Gateway

面向 LLM 与 AI Agent 的开源 AI 网关

使用 Apache APISIX 构建开源 AI 与 LLM 网关,提供多提供商代理、负载均衡、重试、token 限制、提示词控制、RAG 和网关层可观测能力。

Apache 2.0
开源许可证
100+
网关插件
API + AI
统一承载两类流量

一个网关,两类流量

统一管理 API 与 AI 流量

在接入 LLM 流量的同时,继续使用团队熟悉的路由、安全、可观测和运维体系。

Apache APISIX

开源部署控制

在自主管理的基础设施中运行 Apache 2.0 许可的网关,并通过开放插件模型进行扩展。

100+

网关能力

覆盖认证、流量控制、可观测、Serverless 和 AI 的插件。

开放的 AI 插件生态

按需组合已有文档的 AI 插件,实现提供商接入、路由、token 控制、检索增强、提示词处理、内容审核和网关日志。

AI 插件图标

AI 网关解析

什么是 AI 网关?

AI 网关是位于应用与模型提供商之间的流量控制层,让团队可以集中为模型请求配置提供商接入、路由、用量限制、提示词处理和遥测能力。

Apache APISIX 对经过网关的 AI 与 LLM 流量应用已配置的策略。应用授权、工具选择、工作流状态、Agent 编排和模型质量评估仍由外围应用技术栈负责。

需求 APISIX 插件 配置内容
连接模型提供商 ai-proxy 代理请求到文档列出的提供商及 OpenAI 兼容端点。
在模型实例间路由 ai-proxy-multi 配置负载均衡或语义路由;重试和健康检查行为取决于所选算法。
控制 token 消耗 ai-rate-limiting 记录提供商返回的 token 用量,并在配置额度耗尽后拒绝后续请求。
增加检索上下文 ai-rag 使用文档支持的 Azure OpenAI 与 Azure AI Search RAG 流程。
检查提示词规则 ai-prompt-guard 使用已配置的正则表达式规则允许或拒绝请求。
缓存完整响应 ai-cache 与 ai-proxy 或 ai-proxy-multi 配合,实现 Redis 支持的精确缓存和可选语义缓存。
检查受支持的 AI 流量 ai-lakera-guard 与 ai-proxy 或 ai-proxy-multi 配合,通过 Lakera Guard v2 API 检查受支持的流量。

架构

连接应用与模型的统一控制点

Apache APISIX AI 网关架构

为生产级 AI 流量而生

在网关层获得可靠性、控制力与可见性

多 LLM 负载均衡

使用加权轮询或一致性哈希,或根据提示词与各实例示例的相似度配置语义路由。

查看插件文档

Token 限流

使用本地或 Redis 计数器记录提供商返回的 token 用量,并在配置额度耗尽后拒绝后续请求。

查看插件文档

AI RAG

通过插件当前支持的 Azure OpenAI 与 Azure AI Search 集成,为请求补充检索到的上下文。

查看插件文档

Token 可观测性

启用 AI 代理日志后,记录模型、延迟、token 用量和首 token 响应时间等摘要。

查看插件文档

重试与回退

针对指定的上游故障配置有限次数的重试和回退策略,无需更改应用访问端点。

查看插件文档

提示词与内容控制

使用 Prompt Guard 配置允许与拒绝规则,并按需组合模板、装饰或内容审核插件。

查看插件文档

AI 响应缓存

与 ai-proxy 或 ai-proxy-multi 配合,使用 Redis 支持的精确匹配和可选语义匹配缓存完整的 LLM 响应。

查看插件文档

Lakera Guard 集成

与 ai-proxy 或 ai-proxy-multi 配合,使用 Lakera Guard v2 API 检查受支持的 LLM 请求、响应或两者。

查看插件文档

模型选择

连接已支持及 OpenAI 兼容的提供商

连接 AI Proxy 插件文档列出的提供商,或通过 OpenAI 兼容端点接入其他托管或自主管理的服务。提供商选择由你配置的路由策略决定。

了解 AI 网关能力
支持的 LLM 提供商