Ollama 模型列表与本地 LLM 指南(2026)
Ollama 让你在本地运行大型语言模型。以下是热门 Ollama 模型列表、安装方法,以及如何使用本地 API 端点。
什么是 Ollama?
Ollama 是一个开源工具,让你在本地机器上运行大型语言模型。它处理模型下载、量化和服务,使本地 LLM 部署就像运行一条命令一样简单。
与云端 API 不同,Ollama 完全在你的硬件上运行——无需 API Key、无按 token 计费、数据不离开你的机器。这使它非常适合隐私敏感的应用、离线使用和免费实验。如需更广泛地了解 AI 工具和概念,AI 新手指南 提供了本地模型在生态中定位的背景知识。
热门 Ollama 模型列表
Ollama 支持多种开源模型。以下是 2026 年最热门的模型,及其参数大小和近似内存需求。这些模型从能在笔记本上运行的轻量选项到需要专用 GPU 的强大模型都有覆盖。
- llama3.1:8b — Meta Llama 3.1,80 亿参数,约 5GB 内存
- llama3.1:70b — Llama 3.1,700 亿参数,约 40GB 内存(需要强力 GPU)
- qwen2.5:7b — 阿里 Qwen 2.5,70 亿参数,约 5GB 内存,中文支持好
- deepseek-r1:7b — DeepSeek-R1 蒸馏推理模型,70 亿参数,约 5GB 内存
- deepseek-r1:14b — DeepSeek-R1,140 亿参数,约 9GB 内存,推理更强
- gemma2:9b — Google Gemma 2,90 亿参数,约 6GB 内存
- mistral:7b — Mistral 7B,轻量快速,约 5GB 内存
- phi3:3.8b — 微软 Phi-3 mini,38 亿参数,约 3GB 内存,适合低端硬件
根据硬件选择合适的模型
选择合适的模型取决于你的硬件能力和使用场景。对于 8-16GB 内存的笔记本和基本台式机,70-80 亿参数模型(Llama 3.1 8B、Qwen 2.5 7B、Mistral 7B)是理想选择——它们在可接受的内存占用下提供不错的质量,并以合理的速度生成文本。
对于 16-32GB 内存或中端 GPU(8-16GB 显存)的机器,90-140 亿参数模型(Gemma 2 9B、DeepSeek-R1 14B)提供更好的推理和知识深度。这些模型适合更复杂的任务,如代码生成和详细分析。
对于配备高端 GPU(40GB+ 显存)的服务器,Llama 3.1 70B 等 700 亿参数模型在许多任务上接近 GPT-4 的质量。但推理速度明显更慢,你需要仔细评估质量提升是否值得硬件成本。
如果硬件有限(4GB 内存),微软 Phi-3 mini(38 亿)是极佳的选择。它几乎可以在任何机器上运行,仍能合理处理基本对话、问答和简单编程任务。
如何安装和拉取模型
从 ollama.com 安装 Ollama——有 macOS、Linux 和 Windows 的安装包。安装后,拉取模型只需一条命令:
# Pull the Llama 3.1 8B model
ollama pull llama3.1:8b
# Run the model interactively
ollama run llama3.1:8b
# List installed models
ollama list拉取、运行和列出模型的基本 Ollama 命令
使用 Ollama 本地 API
Ollama 在本地 11434 端口运行 HTTP 服务器。API 兼容 OpenAI 格式,所以你可以用相同的 SDK,将 base URL 设为 localhost 即可。本地调用不需要 API Key,这比需要 认证凭证 的云端 API 有明显优势——你只需将代码指向 localhost 即可开始生成。
from openai import OpenAI
# Ollama runs locally — no API key needed
client = OpenAI(
api_key="ollama", # any string works
base_url="http://localhost:11434/v1"
)
response = client.chat.completions.create(
model="llama3.1:8b",
messages=[
{"role": "user", "content": "Explain what an API key is."}
]
)
print(response.choices[0].message.content)通过兼容 OpenAI 的 API 调用本地 Ollama 模型
Ollama vs 云端 API:何时使用哪个
Ollama 在隐私敏感工作、离线环境和免费无限使用方面表现出色。云端 API 提供更强大的模型(GPT-4o、Claude 3.5 Sonnet),这些模型无法在消费级硬件上运行,还提供本地模型可能不完全支持的函数调用和视觉等功能。如果你在寻找免费的云端方案,我们的免费 AI API 指南 介绍了 Google Gemini 和 OpenRouter 等提供免费额度的供应商。
常见模式:用 Ollama 本地原型开发,然后部署到云端 API 用于生产。这样既免费开发,生产又能用上最好的模型。在云端部署阶段,设置 OpenRouter API Key 是一个便捷选择,因为一个 Key 即可访问来自不同供应商的数百个模型。
常见问题
Ollama 完全免费吗?
是的。Ollama 是开源免费的。你在自己的硬件上下载和运行模型,无需付费。唯一的成本是你自己的计算资源(CPU、内存、GPU)。
Ollama 需要 API Key 吗?
不需要。Ollama 在本地机器上运行。本地 API 端点不需要认证。使用 OpenAI SDK 时,传入任意字符串作为 API Key 即可——它会被忽略。
运行 Ollama 模型需要什么硬件?
70-80 亿参数模型需要约 5GB 内存(推荐 8GB 以上)。140 亿参数模型约 9GB。700 亿参数模型需要 40GB 以上显存的强力 GPU。Phi-3(38 亿)等小模型可以在仅 4GB 内存的机器上运行。
Ollama 模型可以用于生产吗?
可以,但需注意。本地部署在隐私和成本控制方面很棒,但性能和模型质量可能落后于顶级云端模型。生产使用时,确保硬件充足并监控响应延迟。
相关供应商
参考来源
- Ollama Official WebsiteOllama · 核验日期 2026-07-29
- Ollama Model LibraryOllama · 核验日期 2026-07-29