M 贤紫精选模型市场
返回模型市场

gpt-oss-20b 本地 GGUF · UD-Q4_K_XL

代码 / Agent · gpt-oss 20b · UD-Q4_K_XL

gpt-oss OpenAI Agent 推理 MoE GGUF

gpt-oss-20b 社区 UD-Q4_K_XL GGUF(Unsloth):OpenAI 开源 MoE 权重(21B / 约 3.6B 激活),面向 推理、工具调用与 Agent,须 Harmony 对话格式,适配自研底座、小紫 AI 工作台与贤紫 AI 代码编辑器。

本 SKU 规格

项目说明
文件名gpt-oss-20b-UD-Q4_K_XL.gguf
量化UD-Q4_K_XL(Unsloth Dynamic 2.0)
体积约 11.9 GB
基座openai/gpt-oss-20b
上下文原生约 128K(实际上限取决于内存与底座)
显存建议16 GB 起(官方面向约 16GB 级本地部署)
模态纯文本(内置 browser/python 等为模板/工具能力,非 VLM mmproj)
后端较新版本 llama.cpp / llama-server(gpt-oss 架构,必须 --jinja)

适合做什么

  • 可配置推理强度(low / medium / high,系统提示如 Reasoning: high)
  • 工具调用、Agent、结构化输出(依赖 Harmony 格式与底座解析)
  • 本地/内网 低延迟场景(相对 gpt-oss-120b 更轻)

不太适合:未按文档配置 Harmony 模板 的旧后端;显存明显不足仍拉满 128K 上下文。

本地提示(Unsloth / OpenAI 参考)

  • llama.cpp 示例常用:--temp 1.0 --top-p 1.0 --top-k 0,并加 --jinja
  • 上下文 --ctx-size 建议从 16K 起按显存逐步上调
  • 勿把模型内部思维链原样展示给终端用户(官方说明 CoT 供调试,非面向用户内容)
  • 与 GLM / KAT / Ornith 等同屏:gpt-oss 强调 Apache 2.0 + Harmony + 推理档位

同仓库其它量化

SKU 思路文件体积约
更省显存gpt-oss-20b-Q4_K_M.gguf11.6 GB
更高质量UD-Q6_K_XL / UD-Q8_K_XL约 12.0 / 13.2 GB

下载与合规

见右侧 「下载」(免登录,将跳转至魔搭第三方源)。

  • 上游:ModelScope · unsloth/gpt-oss-20b-GGUF
  • 开源协议:Apache-2.0
  • 贤紫精选市场仅提供 索引与下载入口,不提供云端算力。