Dify
开源 LLM 应用开发平台,支持接入本地模型和云端 API,提供可视化编排。
从硬件选型到推理引擎对比,一站式掌握开源大模型本地部署的全部知识。
本地部署大模型(Open Source LLM Deployment)有三大优势:数据隐私(敏感数据不出内网)、成本可控(一次投入长期使用)、低延迟(无需网络往返)。2026 年开源模型质量已接近闭源模型,本地部署成为越来越多企业和开发者的首选。
| 引擎 | 定位 | 硬件支持 | 核心优势 | 适用场景 |
|---|---|---|---|---|
| Ollama | 个人/小团队 | CPU/GPU/Metal | 一键安装、OpenAI 兼容 API | 本地开发、桌面 AI |
| vLLM | 生产级服务 | NVIDIA/AMD GPU | PagedAttention、高吞吐 | API 服务、企业部署 |
| Llama.cpp | 极致轻量 | CPU/GPU/各种设备 | GGUF 量化、跨平台 | 边缘设备、嵌入式 |
| TGI | HuggingFace 生态 | NVIDIA GPU | HF 集成、流式输出 | HF 模型快速部署 |
| SGLang | 高性能推理 | NVIDIA GPU | RadixAttention、结构化生成 | 复杂 Agent 推理 |
| 模型规模 | 最低显存 | 推荐配置 | CPU 方案 |
|---|---|---|---|
| 1-3B | 4GB | RTX 3060 12GB | 16GB 内存即可 |
| 7-8B | 8GB | RTX 4060 Ti 16GB | 32GB 内存 |
| 13-14B | 16GB | RTX 4090 24GB | 64GB 内存(较慢) |
| 32-34B | 24GB | RTX 4090 × 2 | 128GB 内存(很慢) |
| 70B+ | 48GB | A100 80GB | 不推荐 |
Ollama 是最简单的本地大模型部署方式,一条命令即可启动:
curl -fsSL https://ollama.com/install.sh | sh && ollama run qwen2.5:7b
Ollama 内置模型库,自动下载和管理模型。API 与 OpenAI 格式兼容,可直接替换 OpenAI endpoint。支持 macOS、Linux、Windows。
vLLM 使用 PagedAttention 技术,吞吐量比传统推理高 2-4 倍。支持连续批处理(Continuous Batching)、张量并行和流式输出。适合搭建企业级 API 服务。
pip install vllm && vllm serve Qwen/Qwen2.5-7B-Instruct
Llama.cpp 专注于 GGUF 量化格式,在 CPU 上也能流畅运行。支持从 Q2_K 到 Q8_0 的多种量化精度。适合边缘设备、树莓派、Mac 等场景。
开源 LLM 应用开发平台,支持接入本地模型和云端 API,提供可视化编排。
桌面端 AI 客户端,支持接入 Ollama 等本地模型,多模型切换和对比。
阿里开源的 LLM 应用开发框架,支持一键部署和多模型编排。
基于私有文档的问答系统,支持接入本地部署的开源模型。