M 贤紫精选模型市场
返回模型市场

Gemma 4 12B 本地 GGUF · UD-Q4_K_XL

代码 / Agent · Gemma 4 12B · UD-Q4_K_XL

Gemma4 Google 12B 多模态 GGUF 长上下文

Google Gemma 4 12B-it(Unified)Unsloth 本地 GGUF:统一多模态、长上下文,面向自研底座、小紫 AI 工作台与贤紫 AI 代码编辑器的本地对话与 Agent。

本 SKU 规格

项目说明
文件名gemma-4-12b-it-UD-Q4_K_XL.gguf
量化UD-Q4_K_XL
体积约 6.9 GB
参数量12B(Unified 统一架构)
上下文最高约 256K(实际上限取决于内存、显存与底座配置)
显存建议8 GB VRAM 起(4-bit 档参考;大上下文需更高)
内存建议16 GB+ 系统内存
推理后端llama.cpp / llama-server 或底座内置本地服务

适合做什么

  • 本地通用对话、轻量 Agent / 工具调用(视底座与 chat template 支持)
  • 代码辅助、推理与长文档阅读(长上下文场景)
  • 多模态扩展:同仓库另有 mmproj-*.gguf,配置后可做图文等能力;仅下载主模型时以文本推理为主
  • 数据留在本机:适合内网研发,与会员区云端 API 可并存切换

显存或内存不足时,请在市场选择 E4B/E2B 或 更低量化 条目;追求更高精度可选同系列 UD-Q8_K_XL SKU。

与同系列怎么选

型号特点
12B(本条目)统一多模态、256K,笔记本到工作站都相对均衡
26B-A4BMoE,激活约 4B,更快、省显存,偏桌面主力
31B稠密大模型,质量上限更高,推理更慢、更吃内存

推荐采样(Google / Unsloth)

--temp 1.0 --top-p 0.95 --top-k 64