Ollama 入门:8G 显存能跑什么模型
本文目录
TL;DR
Ollama = 本地大模型的一键运行器。安装一条命令,拉模型一条命令。本文附 8G/12G/16G 显存的选型表,30 分钟内你在本地拥有第一个不联网、不上传数据的 AI。
准备
| 硬件 | 能跑什么(量化版) |
|---|---|
| 8G 显存(4060Ti 等) | 7B 级(qwen3:8b、deepseek-r1:7b 蒸馏版),4bit 量化 |
| 12G 显存(3060/4070) | 14B 级(qwen3:14b),体验明显提升 |
| 16G+ 显存(4080/4090) | 32B 级(qwen3:32b、deepseek-r1:32b 蒸馏) |
| Mac 16G+ 统一内存 | 7B–14B 可跑,速度取决于内存带宽 |
| 纯 CPU | 7B 量化可用但慢(1–5 token/s),应急可以 |
步骤
常用命令速查
ollama pull <模型> # 下载
ollama run <模型> # 运行并进入对话
ollama list # 本地已有模型
ollama ps # 谁在显存里
ollama rm <模型> # 删除腾空间
API 一行测试(后续接工作流全靠它):
curl http://localhost:11434/api/chat -d '{
"model": "qwen3:8b",
"messages": [{"role": "user", "content": "用一句话解释什么是 RAG"}]
}'
选型建议(2026-09 实测口径)
| 用途 | 8G 档 | 12G 档 | 16G+ 档 |
|---|---|---|---|
| 日常问答/写作 | qwen3:8b | qwen3:14b | qwen3:32b |
| 推理/数学 | deepseek-r1:7b | deepseek-r1:14b | deepseek-r1:32b |
| 代码补全 | qwen2.5-coder:7b | qwen2.5-coder:14b | 同系列 32b |
| 中文长文 | qwen 系优先 | 同左 | 同左 |
模型版本迭代很快;“能跑”与”好用”之间优先保证显存放得下(参数量 × 量化位宽 + 上下文缓存),溢出到内存会掉速一个数量级。
成品对照
实测速度表(token/s)与截图将由实测补充(R-004)。自检标准:8G 档 7B 模型对话首字 ≤3s、持续输出 ≥15 token/s。
常见坑
| 现象 | 原因 | 解法 |
|---|---|---|
| 下载 99% 失败重来 | 网络不稳 | 换镜像源或 ollama pull 断点续传(重跑同一命令即可续) |
| 生成速度忽快忽慢 | 模型溢出到内存 | 选低一档参数量;ollama ps 看 100% GPU 才是纯显存 |
| 端口 11434 被占 | 其他服务占用 | 环境变量 OLLAMA_HOST=:11435 改端口 |
| 显存明明够却说 OOM | 上下文长度吃显存 | 启动参数调小 num_ctx(如 4096) |
| 中文输出夹杂乱码 | 旧版终端编码 | Windows 用 Windows Terminal,chcp 65001 |
下一步
- 给模型套个界面:工具雷达之 open-webui
- 让它读你的文档:零代码搭一个本地知识库 agent