第 1 章 · 自研底座是什么、如何安装
本章目标:弄清 自研底座 与 小紫 AI 工作台 的分工;完成底座 v1.1.0 安装;准备 llama-server;记住顶栏 OpenAI 兼容地址,供 ch02 启动 与 ch03 工作台对接。
学时建议:2~3 小时(含下载 llama-server 与安装)
前置:quick-start ch02(登录);本机有足够磁盘与内存(见 1.4)。
1.1 场景说明:想数据不出内网,却一直在用云端模型
工作台 = 写代码、SRX、审阅条;自研底座 = 在本机/内网跑大模型。两者用 OpenAI 兼容 HTTP 对接(如 http://127.0.0.1:8080/v1)。
| 对比 | 云端量子模型 | 自研底座 |
|---|---|---|
| 推理位置 | 贤紫云端 | 本机/内网 |
| 数据 | 经平台 | 可不出网 |
| 费用 | Token/会员 | 登录免费(自备硬件) |
| 适合 | 免运维、要强云端 | 隐私、合规、大量 SRX |
1.2 学完你能
| 能力 | 验收 |
|---|---|
| 分工 | 说清工作台 vs 底座 |
| 安装 | 启动底座四页签界面 |
| llama-server | 放到推荐目录或浏览指定 |
| 地址 | 记下顶栏 /v1 地址 |
| 排错 | 对照 1.8 常见问题 |
1.3 软件名称与下载
界面标题:小紫 AI 代码编辑器 · 模型引擎底座
安装包示例:小紫AI代码编辑器自研模型底座-1.1.0.exe
下载:贤紫优选官网 → 小紫代码编辑器页 → 自研底座安装包(Win/Linux/macOS)。
底座不含 GGUF 权重,需自备 .gguf 文件(ch02)。
1.4 系统要求
| 项 | 建议 |
|---|---|
| 内存 | 16GB 起;7B 模型建议 32GB |
| 显卡 | 可选;NVIDIA 可 CUDA 加速 |
| 磁盘 | 单 GGUF 常见 4~8GB+ |
| 路径 | 安装、模型目录 英文 |
1.5 跟练 A:安装底座(Windows)
安装包:运行向导 → 自选目录 → 快捷方式 小紫AI代码编辑器自研模型底座
绿色版:解压 win-unpacked → 双击 exe
你应该看到:四页签界面(文本/视频/图片/向量)。
1.6 跟练 B:准备 llama-server(必做)
底座是 llama-server 管理壳,引擎需自备:
- llama.cpp Releases
- 无独显 → CPU/OpenBLAS 包;有 NVIDIA → 匹配 CUDA 版
- 解压得
llama-server.exe+ 全部 dll 同目录 - 放入推荐目录或底座 llama-server → 浏览 指定:
| 目录 | 用途 |
|---|---|
resources\tools\cpu\ | 通用 CPU |
resources\tools\cuda12\ 等 | 有独显 |
1.7 首次界面与地址
| 页签 | 用途 |
|---|---|
| 文本模型 | 对话、SRX 改代码(必学) |
| 视频/图片/向量 | 可选扩展(ch05) |
顶栏示例:http://127.0.0.1:8080/v1 — 以界面为准,ch03 工作台要填一致。
1.8 实用技巧
| 技巧 | 说明 |
|---|---|
| 先文本后扩展 | 文本跑通再配图片/向量 |
| 右上角 ? | 参数说明 |
| 与工作台分开 | 两程序可同时运行 |
| 英文路径 | 减少兼容问题 |
跟练任务
- 安装底座并打开四页签。
- 下载 llama-server 到指定目录。
- 写
local-deploy-notes/ch01.md记录顶栏地址(启动前可先记默认 8080)。
自检清单
- [ ] 底座能启动
- [ ] llama-server 路径已指定
- [ ] 知不含 GGUF
- [ ] 知与工作台分工
- [ ] 英文路径
常见错误
| 现象 | 处理 |
|---|---|
| 只复制一个 exe | dll 需同目录 |
| 找不到 server | 浏览指定路径 |
| 与工作台混淆 | 两个程序 |
本章小结
- 底座 = 本机推理;工作台 = 开发界面。
- 下一章 ch02:选 GGUF、Jinja 开、启动文本模型。