Gemma 4 12B 本地 GGUF · UD-Q4_K_XL
代码 / Agent · Gemma 4 12B · UD-Q4_K_XL
模型文件由第三方社区提供,贤紫精选模型市场仅提供索引与下载便利;使用请遵守该模型开源协议。
Google Gemma 4 12B-it(Unified)Unsloth 本地 GGUF:统一多模态、长上下文,面向自研底座、小紫 AI 工作台与贤紫 AI 代码编辑器的本地对话与 Agent。
本 SKU 规格
| 项目 | 说明 |
|---|---|
| 文件名 | gemma-4-12b-it-UD-Q4_K_XL.gguf |
| 量化 | UD-Q4_K_XL |
| 体积 | 约 6.9 GB |
| 参数量 | 12B(Unified 统一架构) |
| 上下文 | 最高约 256K(实际上限取决于内存、显存与底座配置) |
| 显存建议 | 8 GB VRAM 起(4-bit 档参考;大上下文需更高) |
| 内存建议 | 16 GB+ 系统内存 |
| 推理后端 | llama.cpp / llama-server 或底座内置本地服务 |
适合做什么
- 本地通用对话、轻量 Agent / 工具调用(视底座与 chat template 支持)
- 代码辅助、推理与长文档阅读(长上下文场景)
- 多模态扩展:同仓库另有
mmproj-*.gguf,配置后可做图文等能力;仅下载主模型时以文本推理为主 - 数据留在本机:适合内网研发,与会员区云端 API 可并存切换
显存或内存不足时,请在市场选择 E4B/E2B 或 更低量化 条目;追求更高精度可选同系列 UD-Q8_K_XL SKU。
与同系列怎么选
| 型号 | 特点 |
|---|---|
| 12B(本条目) | 统一多模态、256K,笔记本到工作站都相对均衡 |
| 26B-A4B | MoE,激活约 4B,更快、省显存,偏桌面主力 |
| 31B | 稠密大模型,质量上限更高,推理更慢、更吃内存 |
推荐采样(Google / Unsloth)
--temp 1.0 --top-p 0.95 --top-k 64