第 2 章 · 文本模型:选模型、调参数、启动
本章目标:在 文本模型 页完成首次启动,状态 运行中;开启 Jinja 模板(SRX 工具调用必需);记下 http://Host:端口/v1 供工作台对接。
学时建议:2~3 小时(含下载 GGUF、首次启动排错)
前置:local-deploy ch01;已准备 .gguf 与 llama-server。
2.1 场景说明:模型列表空、SRX 不调工具、启动就退出
多数来自:未刷新列表、mmproj 误填主模型、Jinja 未开、端口占用。本章按步骤练到 运行中 + 输出窗口有日志。
2.2 学完你能
| 能力 | 验收 |
|---|---|
| GGUF | 模型目录 + 刷新 + 点选 |
| 必开 | Jinja + 自动适配显存 |
| 启动 | 状态「运行中」 |
| 地址 | 顶栏 /v1 可复制 |
| 停止 | 换模型前先停止服务 |
2.3 准备 GGUF
.gguf放同一英文文件夹- 模型目录 → 浏览 选中
- 刷新列表 → 点选 模型
新手推荐:7B 级指令模型(Qwen2.5、Llama3 等 Q4/Q5 量化)。
2.4 路径区三项
| 项 | 说明 |
|---|---|
| 模型目录 | 存 GGUF 的文件夹 |
| llama-server | 推理程序;可留空试内置 CPU/CUDA |
| mmproj | 仅多模态;勿填主模型 |
纯文本 SRX:mmproj 留空。
2.5 网络与推理参数
| 参数 | 默认/建议 |
|---|---|
| Host | 127.0.0.1(局域网共享改 0.0.0.0,ch04) |
| 端口 | 8080 |
| API Key | 本机可留空 |
| 上下文 -c | 4096~8192(越大越占内存) |
| GPU -ngl | 有独显尽量大;纯 CPU 填 0 |
| 并行槽 -np | 默认 1;SRX 慢可试 3 |
2.6 加速开关(SRX 推荐)
| 开关 | SRX 改代码 |
|---|---|
| Jinja 模板 | 必须开 |
| 自动适配显存 --fit | 建议开 |
| Flash Attention | 有独显可开 |
| Prompt 缓存 | 多轮 SRX 可开 |
| KV q8_0 | 显存紧张开 |
不确定:Jinja + fit 开,其余默认。
2.7 跟练:启动与验证(必做)
- 列表点选目标 GGUF
- 启动选中模型
- 输出 窗口有 llama-server 日志
- 状态 → 运行中
- 复制顶栏地址,如
http://127.0.0.1:8080/v1
停止:停止服务 后再换模型。
2.8 场景速查
| 场景 | 调整 |
|---|---|
| 8GB 显存 7B | fit 开、-c 4096、Q4 模型 |
| 纯 CPU | -ngl 0、-np 1 |
| SRX 慢 | -np 3;工作台超科幻默认 |
| 对话乱/工具异常 | 查 Jinja;模板市场(ch04) |
跟练任务
- 完成 2.7 到「运行中」。
- 浏览器或 curl 访问
http://127.0.0.1:8080/v1/models(若可)。 - 写
local-deploy-notes/ch02.md记录模型名与 -c/-ngl 参数。
自检清单
- [ ] GGUF 已选中
- [ ] Jinja 已开
- [ ] 状态运行中
- [ ] 顶栏地址已记
- [ ] 知 mmproj 勿填主模型
常见错误
| 现象 | 处理 |
|---|---|
| mmproj 填主模型 | 清空或选配套 mmproj |
| 端口占用 | 改端口,工作台同步 |
| 启动即退出 | 查 server 路径与 dll |
| 列表空 | 刷新列表 |
本章小结
- Jinja 开 + 运行中 + 记 /v1 地址 三件套。
- 下一章 ch03:工作台 模型管理 对接。