gpt-oss-20b 本地 GGUF · UD-Q4_K_XL
代码 / Agent · gpt-oss 20b · UD-Q4_K_XL
模型文件由第三方社区提供,贤紫精选模型市场仅提供索引与下载便利;使用请遵守该模型开源协议。
gpt-oss-20b 社区 UD-Q4_K_XL GGUF(Unsloth):OpenAI 开源 MoE 权重(21B / 约 3.6B 激活),面向 推理、工具调用与 Agent,须 Harmony 对话格式,适配自研底座、小紫 AI 工作台与贤紫 AI 代码编辑器。
本 SKU 规格
| 项目 | 说明 |
|---|---|
| 文件名 | gpt-oss-20b-UD-Q4_K_XL.gguf |
| 量化 | UD-Q4_K_XL(Unsloth Dynamic 2.0) |
| 体积 | 约 11.9 GB |
| 基座 | openai/gpt-oss-20b |
| 上下文 | 原生约 128K(实际上限取决于内存与底座) |
| 显存建议 | 16 GB 起(官方面向约 16GB 级本地部署) |
| 模态 | 纯文本(内置 browser/python 等为模板/工具能力,非 VLM mmproj) |
| 后端 | 较新版本 llama.cpp / llama-server(gpt-oss 架构,必须 --jinja) |
适合做什么
- 可配置推理强度(low / medium / high,系统提示如
Reasoning: high) - 工具调用、Agent、结构化输出(依赖 Harmony 格式与底座解析)
- 本地/内网 低延迟场景(相对 gpt-oss-120b 更轻)
不太适合:未按文档配置 Harmony 模板 的旧后端;显存明显不足仍拉满 128K 上下文。
本地提示(Unsloth / OpenAI 参考)
- llama.cpp 示例常用:
--temp 1.0 --top-p 1.0 --top-k 0,并加--jinja - 上下文
--ctx-size建议从 16K 起按显存逐步上调 - 勿把模型内部思维链原样展示给终端用户(官方说明 CoT 供调试,非面向用户内容)
- 与 GLM / KAT / Ornith 等同屏:gpt-oss 强调 Apache 2.0 + Harmony + 推理档位
同仓库其它量化
| SKU 思路 | 文件 | 体积约 |
|---|---|---|
| 更省显存 | gpt-oss-20b-Q4_K_M.gguf | 11.6 GB |
| 更高质量 | UD-Q6_K_XL / UD-Q8_K_XL | 约 12.0 / 13.2 GB |
下载与合规
见右侧 「下载」(免登录,将跳转至魔搭第三方源)。
- 上游:ModelScope ·
unsloth/gpt-oss-20b-GGUF - 开源协议:Apache-2.0
- 贤紫精选市场仅提供 索引与下载入口,不提供云端算力。