1. 安装 Ollama
Armbian 通常基于 Debian 或 Ubuntu,支持直接通过官方脚本安装。在终端执行以下命令:
下载并安装:
curl -fsSL https://ollama.com/install.sh | sh该脚本会自动检测架构(arm64/aarch64)并下载对应版本。
验证安装:
ollama --version若显示版本号(如 v0.32.1),说明安装成功 。
2. 拉取与运行模型
安装完成后,可直接拉取轻量级模型进行测试:
拉取模型(例如轻量嵌入模型或对话模型):
ollama pull mxbai/embedding-small # 语义搜索专用,仅 18MB ollama pull llama3:8b # 通用对话模型(需较大内存)运行模型:
ollama run llama3:8b对于内存有限的设备(如 4GB RAM),建议使用量化版本(如
qwen2:0.5b或phi3:3.8b的 Q4_K_M 精度)以避免内存溢出 。
3. 关键配置与优化
在 ARM 设备上运行 Ollama 需注意以下性能调优:
内存管理:若设备内存较小(≤4GB),启动服务时限制并行线程数:
OLLAMA_NUM_PARALLEL=1 ollama serve &存储路径迁移:默认模型存储在 TF 卡上,建议将模型目录软链接至高速 NVMe 或 eMMC 分区,延长存储寿命并提升加载速度 。
网络加速:国内用户拉取模型较慢时,可设置清华镜像源:
export OLLAMA_MODELS=https://mirrors.tuna.tsinghua.edu.cn/ollama/ ```:ml-citation{ref="5" appearance="aggregated" data="citationList"}
4. 常见问题排查
端口占用:若启动报错
Address already in use,检查并释放 11434 端口:sudo lsof -i :11434 sudo kill -9 <PID>架构兼容性:Ollama 不支持 ARM 32 位系统(如旧款树莓派),需确认设备为 arm64 架构 。
GPU 加速陷阱:部分 ARM 设备(如 Orange Pi O1)的 GPU 驱动对 Ollama 支持不完善,强制启用 GPU 可能导致崩溃,建议纯 CPU 运行 。
通过上述步骤,您可以在 Armbian 设备上快速构建离线 AI 服务,适用于语义搜索、本地知识库问答等场景 。