先选模型,再选服务器
Ollama 简化了本地模型运行,但不会消除模型本身的资源要求。应根据准备运行的具体模型和量化版本估算内存、硬盘和加速卡需求。小型 CPU 测试与生产推理服务是完全不同的负载。
安全的网络设计
Ollama 默认仅在本机监听。除非已经通过带认证的应用或受保护的反向代理接入,否则应保持这一边界。不要把 11434 端口直接暴露到公网。
运维检查
- 固定并记录应用使用的模型名称和版本。
- 为模型文件和后续更新预留足够硬盘空间。
- 监控内存压力、响应延迟和服务重启情况。
- 防火墙仅允许真正需要调用 API 的应用主机访问。
- 测试备份和重建流程;模型文件通常可以重新下载,但配置和应用数据必须备份。
资料来源与下一步
请以 Ollama 官方 Linux 文档 和 快速入门 为准。需要浏览器界面时,可继续阅读 Open WebUI 部署教程。
环境与配置要求
- 操作系统:支持 systemd 的 64 位 Linux
- CPU:取决于模型,可从 4 核开始测试
- 内存:必须高于所选模型的实际内存占用
- 存储:模型文件容量外至少预留 20 GiB
- 网络:保持 11434 端口私有,通过认证网关访问
第 1 步:确认主机架构与资源
确认 Linux 架构、可用硬盘和内存,并选择适合当前机器的模型,不要假设所有模型都能流畅运行。
uname -m
free -h
df -h预期结果: 命令无错误完成,并且本步骤描述的服务或文件已经可用。
第 2 步:安装 Ollama
使用官方 Linux 文档中的当前安装命令,并在完成后检查安装版本。
curl -fsSL https://ollama.com/install.sh | sh
ollama --version预期结果: 命令无错误完成,并且本步骤描述的服务或文件已经可用。
注意:执行远程安装脚本前请先检查内容,并且只使用当前官方来源。
第 3 步:检查系统服务
在使用 systemd 的发行版中确认服务已启动;如果启动失败,请查看近期日志。
systemctl status ollama --no-pager
journalctl -u ollama --no-pager -n 100预期结果: 命令无错误完成,并且本步骤描述的服务或文件已经可用。
第 4 步:运行首个模型
运行官方模型库中的模型。首次启动会下载模型文件,因此耗时和硬盘占用会因模型而异。
ollama run gemma3预期结果: 命令无错误完成,并且本步骤描述的服务或文件已经可用。
第 5 步:验证本地 API
从同一主机验证 API。保持端口仅内部可用,远程应用应通过带认证的服务层连接。
curl http://127.0.0.1:11434/api/generate -d '{"model":"gemma3","prompt":"Hello","stream":false}'预期结果: 命令无错误完成,并且本步骤描述的服务或文件已经可用。
需要运行环境时再考虑
以下方案与本文场景相关。价格和配置会变化,请在购买前重新核对;通过链接购买时 AIOOS 可能获得佣金,但不会增加你的价格。
雨云洛杉矶一区 8 核 16GB
这是与文章场景相关的服务器方案;购买前请核对实时价格、地区、IP、带宽和工作负载。
8 vCPU · 16 GB · 30 GB system disk