跳到主要内容
AIGCTechs
栏目导航

Ollama 入门:8G 显存能跑什么模型

入门 约 30 分钟 · 2026/9/1 · ollama deepseek
本文目录

TL;DR

Ollama = 本地大模型的一键运行器。安装一条命令,拉模型一条命令。本文附 8G/12G/16G 显存的选型表,30 分钟内你在本地拥有第一个不联网、不上传数据的 AI。

准备

硬件能跑什么(量化版)
8G 显存(4060Ti 等)7B 级(qwen3:8b、deepseek-r1:7b 蒸馏版),4bit 量化
12G 显存(3060/4070)14B 级(qwen3:14b),体验明显提升
16G+ 显存(4080/4090)32B 级(qwen3:32b、deepseek-r1:32b 蒸馏)
Mac 16G+ 统一内存7B–14B 可跑,速度取决于内存带宽
纯 CPU7B 量化可用但慢(1–5 token/s),应急可以

步骤

常用命令速查

ollama pull <>     # 下载
ollama run <>      # 运行并进入对话
ollama list            # 本地已有模型
ollama ps              # 谁在显存里
ollama rm <>       # 删除腾空间

API 一行测试(后续接工作流全靠它):

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3:8b",
  "messages": [{"role": "user", "content": "用一句话解释什么是 RAG"}]
}'

选型建议(2026-09 实测口径)

用途8G 档12G 档16G+ 档
日常问答/写作qwen3:8bqwen3:14bqwen3:32b
推理/数学deepseek-r1:7bdeepseek-r1:14bdeepseek-r1:32b
代码补全qwen2.5-coder:7bqwen2.5-coder:14b同系列 32b
中文长文qwen 系优先同左同左

模型版本迭代很快;“能跑”与”好用”之间优先保证显存放得下(参数量 × 量化位宽 + 上下文缓存),溢出到内存会掉速一个数量级。

成品对照

实测速度表(token/s)与截图将由实测补充(R-004)。自检标准:8G 档 7B 模型对话首字 ≤3s、持续输出 ≥15 token/s。

常见坑

现象原因解法
下载 99% 失败重来网络不稳换镜像源或 ollama pull 断点续传(重跑同一命令即可续)
生成速度忽快忽慢模型溢出到内存选低一档参数量;ollama ps100% GPU 才是纯显存
端口 11434 被占其他服务占用环境变量 OLLAMA_HOST=:11435 改端口
显存明明够却说 OOM上下文长度吃显存启动参数调小 num_ctx(如 4096)
中文输出夹杂乱码旧版终端编码Windows 用 Windows Terminal,chcp 65001

下一步