下载工作台
自研底座配置

文本模型:选模型、调参数、启动

免费栏目

第 2 章 · 文本模型:选模型、调参数、启动

本章目标:在 文本模型 页完成首次启动,状态 运行中;开启 Jinja 模板(SRX 工具调用必需);记下 http://Host:端口/v1 供工作台对接。

学时建议:2~3 小时(含下载 GGUF、首次启动排错)

前置local-deploy ch01;已准备 .ggufllama-server


2.1 场景说明:模型列表空、SRX 不调工具、启动就退出

多数来自:未刷新列表mmproj 误填主模型Jinja 未开端口占用。本章按步骤练到 运行中 + 输出窗口有日志


2.2 学完你能

能力验收
GGUF模型目录 + 刷新 + 点选
必开Jinja + 自动适配显存
启动状态「运行中」
地址顶栏 /v1 可复制
停止换模型前先停止服务

2.3 准备 GGUF

  1. .gguf同一英文文件夹
  2. 模型目录 → 浏览 选中
  3. 刷新列表点选 模型

新手推荐:7B 级指令模型(Qwen2.5、Llama3 等 Q4/Q5 量化)。


2.4 路径区三项

说明
模型目录存 GGUF 的文件夹
llama-server推理程序;可留空试内置 CPU/CUDA
mmproj多模态;勿填主模型

纯文本 SRX:mmproj 留空


2.5 网络与推理参数

参数默认/建议
Host127.0.0.1(局域网共享改 0.0.0.0ch04
端口8080
API Key本机可留空
上下文 -c40968192(越大越占内存)
GPU -ngl有独显尽量大;纯 CPU 填 0
并行槽 -np默认 1;SRX 慢可试 3

2.6 加速开关(SRX 推荐)

开关SRX 改代码
Jinja 模板必须开
自动适配显存 --fit建议开
Flash Attention有独显可开
Prompt 缓存多轮 SRX 可开
KV q8_0显存紧张开

不确定:Jinja + fit 开,其余默认。


2.7 跟练:启动与验证(必做)

  1. 列表点选目标 GGUF
  2. 启动选中模型
  3. 输出 窗口有 llama-server 日志
  4. 状态 → 运行中
  5. 复制顶栏地址,如 http://127.0.0.1:8080/v1

停止停止服务 后再换模型。


2.8 场景速查

场景调整
8GB 显存 7Bfit 开、-c 4096、Q4 模型
纯 CPU-ngl 0、-np 1
SRX 慢-np 3;工作台超科幻默认
对话乱/工具异常查 Jinja;模板市场(ch04)

跟练任务

  1. 完成 2.7 到「运行中」。
  2. 浏览器或 curl 访问 http://127.0.0.1:8080/v1/models(若可)。
  3. local-deploy-notes/ch02.md 记录模型名与 -c/-ngl 参数。

自检清单

  • [ ] GGUF 已选中
  • [ ] Jinja 已开
  • [ ] 状态运行中
  • [ ] 顶栏地址已记
  • [ ] 知 mmproj 勿填主模型

常见错误

现象处理
mmproj 填主模型清空或选配套 mmproj
端口占用改端口,工作台同步
启动即退出查 server 路径与 dll
列表空刷新列表

本章小结

  • Jinja 开 + 运行中 + 记 /v1 地址 三件套。
  • 下一章 ch03:工作台 模型管理 对接。