为什么要在本地运行人工智能?
在您自己的硬件上运行大型语言模型具有多种优势:完全隐私、无使用成本、离线功能和无限制的 API 调用。到 2026 年,当地的法学硕士已经变得非常有能力。
硬件要求
最低设置
- 8GB 内存(推荐 16GB)
- 任何支持 AVX2 的现代 CPU
- 50GB 可用磁盘空间
推荐设置
- 32GB+ 内存
- 具有 8GB+ VRAM 的 NVIDIA GPU(或具有 16GB+ 统一内存的 Apple Silicon)
- 100GB+ 固态硬盘
开始使用 Ollama
Ollama 是运行本地法学硕士的最简单方法。方法如下:
- 安装奥拉马: 从 ollama.ai 下载(macOS、Windows、Linux)
- 下载模型:
ollama pull llama3.2(8B参数,在大多数硬件上运行) - 运行模型:
ollama run llama3.2 - 提出问题: 与人工智能完全离线聊天
2026 年最佳本地法学硕士
| 模型 | 尺寸 | 需要内存 | 质量 | 最适合 |
|---|---|---|---|---|
| 羊驼 3.2 (8B) | 4.7GB | 8GB | 好的 | 一般用途 |
| 米斯特拉尔7B | 4.1GB | 8GB | 好的 | 一般用途 |
| 混合 8x7B | 26GB | 24GB | 非常好 | 高级推理 |
| DeepSeek 编码器 | 15GB | 16 GB | 出色的 | 编码 |
| 奎文2.5 (32B) | 18GB | 24GB | 出色的 | 通用+编码 |
| 骆驼3.2 (70B) | 40GB | 48GB | 优越的 | 所有任务 |
使用 LM Studio 进行高级设置
LM Studio 提供了用于下载和运行本地模型的 GUI。它支持与 OpenAI 兼容的 API 端点,允许您将本地模型与支持 OpenAI API 的任何应用程序一起使用。
设置本地 API 服务器
将本地模型转变为应用程序可以连接的 API 服务器:
- 奥拉马:
ollama serve在 localhost:11434 提供 REST API - LM工作室: 在“设置”中启用本地推理服务器
- 骆驼.cpp: 与服务器示例一起编译,运行
./server -m model.gguf