Ollama 命令
Ollama 创建自定义模型 --- Ollama 远程测试状态 API:https://github.com/ollama/ollama/blob/main/docs/api.md --- Olla…
Ollama 创建自定义模型
1touch Modelfile
2vim Modelfile
1FROM /Users/zailiang/Downloads/qwen1_5-0_5b-chat-q5_k_m.gguf
2
3# set the temperature to 1 [higher is more creative, lower is more coherent]
4PARAMETER temperature 1
5
6SYSTEM """
7If you're asked who you are or who developed it, you have to say I'm an alien from the universe
8"""
1ollama create example -f Modelfile
2ollama list
3ollama run example
Ollama 远程测试状态
API:https://github.com/ollama/ollama/blob/main/docs/api.md
1curl http://192.168.2.42:11434/api/tags
Ollama 服务以 0.0.0.0 启动
1sudo vim /etc/systemd/system/ollama.service
在 [Service] 部分,添加以下行以设置 OLLAMA_HOST 环境变量,使其监听所有网络接口的指定端口(默认端口为 11434):
1[Service]
2Environment="OLLAMA_HOST=0.0.0.0:11434"
1sudo systemctl daemon-reload
2sudo systemctl restart ollama
3sudo systemctl status ollama
4sudo netstat -tulnp | grep 11434
Ollama 开启代理
1 Environment="http_proxy=http://192.168.2.41:20172"
2 Environment="https_proxy=http://192.168.2.41:20172"
Ollama 运行 Huggingface ModelScope 模型
1ollama run hf.co/unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF:Q4_K_M
2ollama run modelscope.cn/Qwen/Qwen2.5-3B-Instruct-GGUF:Q3_K_M
此 hf.co = huggingface.co
https://www.modelscope.cn/docs/models/advanced-usage/ollama-integration
Ollama 模型跑分
1ollama run gemma4:31b --verbose "用中文写一篇关于人工智能的500字文章"
1total duration: 27.48292873s
2load duration: 644.267865ms
3prompt eval count: 28 token(s)
4prompt eval duration: 76.864355ms
5prompt eval rate: 364.28 tokens/s
6eval count: 981 token(s)
7eval duration: 25.683681903s
8eval rate: 38.20 tokens/s
| 指标 | 数值 | 说明 |
|---|---|---|
| 生成速度 | 38.20 tokens/s | 核心指标,模型输出文字的速度 |
| 读取输入速度 | 364.28 tokens/s | 处理你输入问题的速度 |
| 总耗时 | 27.48s | 含加载+推理全程 |
| 加载耗时 | 0.64s | 模型已在内存中,加载很快 |
| 输出 token 数 | 981 tokens | 本次生成了约 700 字 |
怎么评价这个成绩?
38.20 tokens/s 对于 31B 模型来说属于中等偏好的水平。
参考对比:
- 🐢 低于 15 tokens/s → 慢,体验较差
- ✅ 15~40 tokens/s → 正常,流畅可用
- 🚀 40+ tokens/s → 快,体验很好
你的 38.20 接近“流畅”上限,说明你的硬件跑 31B 模型还是比较给力的。