跳到主内容
AI 基础6 分钟阅读发布于:2026-07-29更新于:2026-07-29

Ollama 模型列表与本地 LLM 指南(2026)

Ollama 让你在本地运行大型语言模型。以下是热门 Ollama 模型列表、安装方法,以及如何使用本地 API 端点。

什么是 Ollama?

Ollama 是一个开源工具,让你在本地机器上运行大型语言模型。它处理模型下载、量化和服务,使本地 LLM 部署就像运行一条命令一样简单。

与云端 API 不同,Ollama 完全在你的硬件上运行——无需 API Key、无按 token 计费、数据不离开你的机器。这使它非常适合隐私敏感的应用、离线使用和免费实验。

热门 Ollama 模型列表

Ollama 支持多种开源模型。以下是 2026 年最热门的模型,及其参数大小和近似内存需求:

  • llama3.1:8b — Meta Llama 3.1,80 亿参数,约 5GB 内存
  • llama3.1:70b — Llama 3.1,700 亿参数,约 40GB 内存(需要强力 GPU)
  • qwen2.5:7b — 阿里 Qwen 2.5,70 亿参数,约 5GB 内存,中文支持好
  • deepseek-r1:7b — DeepSeek-R1 蒸馏推理模型,70 亿参数,约 5GB 内存
  • deepseek-r1:14b — DeepSeek-R1,140 亿参数,约 9GB 内存,推理更强
  • gemma2:9b — Google Gemma 2,90 亿参数,约 6GB 内存
  • mistral:7b — Mistral 7B,轻量快速,约 5GB 内存
  • phi3:3.8b — 微软 Phi-3 mini,38 亿参数,约 3GB 内存,适合低端硬件

如何安装和拉取模型

从 ollama.com 安装 Ollama——有 macOS、Linux 和 Windows 的安装包。安装后,拉取模型只需一条命令:

bash
# Pull the Llama 3.1 8B model
ollama pull llama3.1:8b

# Run the model interactively
ollama run llama3.1:8b

# List installed models
ollama list

拉取、运行和列出模型的基本 Ollama 命令

使用 Ollama 本地 API

Ollama 在本地 11434 端口运行 HTTP 服务器。API 兼容 OpenAI 格式,所以你可以用相同的 SDK,将 base URL 设为 localhost 即可。本地调用不需要 API Key。

python
from openai import OpenAI

# Ollama runs locally — no API key needed
client = OpenAI(
    api_key="ollama",  # any string works
    base_url="http://localhost:11434/v1"
)

response = client.chat.completions.create(
    model="llama3.1:8b",
    messages=[
        {"role": "user", "content": "Explain what an API key is."}
    ]
)

print(response.choices[0].message.content)

通过兼容 OpenAI 的 API 调用本地 Ollama 模型

Ollama vs 云端 API:何时使用哪个

Ollama 在隐私敏感工作、离线环境和免费无限使用方面表现出色。云端 API 提供更强大的模型(GPT-4o、Claude 3.5 Sonnet),这些模型无法在消费级硬件上运行,还提供本地模型可能不完全支持的函数调用和视觉等功能。

常见模式:用 Ollama 本地原型开发,然后部署到云端 API 用于生产。这样既免费开发,生产又能用上最好的模型。

常见问题

Ollama 完全免费吗?

是的。Ollama 是开源免费的。你在自己的硬件上下载和运行模型,无需付费。唯一的成本是你自己的计算资源(CPU、内存、GPU)。

Ollama 需要 API Key 吗?

不需要。Ollama 在本地机器上运行。本地 API 端点不需要认证。使用 OpenAI SDK 时,传入任意字符串作为 API Key 即可——它会被忽略。

运行 Ollama 模型需要什么硬件?

70-80 亿参数模型需要约 5GB 内存(推荐 8GB 以上)。140 亿参数模型约 9GB。700 亿参数模型需要 40GB 以上显存的强力 GPU。Phi-3(38 亿)等小模型可以在仅 4GB 内存的机器上运行。

Ollama 模型可以用于生产吗?

可以,但需注意。本地部署在隐私和成本控制方面很棒,但性能和模型质量可能落后于顶级云端模型。生产使用时,确保硬件充足并监控响应延迟。

相关供应商

暂未关联供应商。

参考来源