智能 LoRA 路由 (Intelligent LoRA Routing)
本指南向您展示如何结合智能路由(领域/嵌入/关键词/MCP)与 LoRA 适配器,将请求路由到特定领域的模型。LoRA 路由使用前述指南中的分类方法来检测意图,然后自动在 vLLM 后端选择适当的 LoRA 适配器。
关键优势
- 意图感知的适配器选择:结合任何分类方法(领域/嵌入/关键词/MCP)与 LoRA 适配器
- 内存高效:跨多个领域适配器共享基础模型权重(每个适配器增加的参数量 <1%)
- 对用户透明:用户向一个端点发送请求,路由负责处理适配器选择
- 灵活的分类:为您的用例选择最佳路由方法(为了准确性选择领域路由,为了合规性选择关键词路由等)
它解决了什么问题?
vLLM 支持多个 LoRA 适配器,但用户必须手动指定使用哪个适配器。LoRA 路由将此过程自动化:
- 手动适配器选择:用户不知道该使用哪个适配器 → 路由分类意图并自动选择适配器
- 内存效率:多个完整模型无法装入 GPU → LoRA 适配器共享基础权重(每个适配器约 1% 开销)
- 部署简化:管理多个模型端点很复杂 → 单个 vLLM 实例即可服务所有适配器
- 意图检测:通用基础模型缺乏领域专业知识 → 路由根据查询内容路由到专业的适配器
何时使用
- 具有针对不同领域(技术、医疗、法律等)的 LoRA 适配器的多领域 vLLM 部署
- 希望用户发送请求而无需知道适配器名称的自动适配器选择场景
- 结合分类 + LoRA:使用领域路由获得准确性,使用关键词路由满足合规性,或使用 MCP 实现自定义逻辑
- 多个完整模型无法装入但 LoRA 适配器可以装入的内存受限场景
- 通过调整类别评分来A/B 测试不同版本的适配器
配置
前提条件
- 一个运行中且启用了 LoRA 支持的 vLLM 服务器
- LoRA 适配器文件(针对特定领域进行了微调)
- Envoy + 路由(见 安装 指南)