进阶 10 分钟IBM

IBM Granite 4 本地部署:安装与案例 d'usage

IBM 正在低调开发 Granite,这是面向企业的开放权重大语言模型系列中最值得关注的系列之一。本指南介绍如何使用 Ollama 在本地安装 Granite 4,解释 Mamba 混合架构如何降低所需内存,详细说明不含隐含限制条款的 Apache 2.0 许可证,并聚焦于 RAG、函数调用、业务任务等 Granite 真正有别于大众模型的用途。

作者: Clara M.·更新于 2026-07-30·已在 Windows、macOS 和 Linux 上测试

#为何选择 Granite 4 而非其他模型

Granite 并不是为登顶聊天机器人排行榜而设计的。IBM 追求的是不同的目标:提供可靠、节省内存、法律方面没有隐患的模型,用于集成到企业应用中。选择 Granite 不是为了讨论哲学,而是为了将模型连接到文档库、让它调用工具,或在配置不高的硬件上以较低成本运行。

Granite 4 与其他开放权重模型有三点区别。首先,它采用 Mamba 混合架构,大幅降低内存消耗,尤其是在长上下文场景下。其次,它严格采用 Apache 2.0 许可证,没有 Llama 或 Gemma 所施加的使用限制。最后,它在可追溯性和治理方面做了大量工作——模型签名、训练数据文档、ISO 42001 认证——这些都是 IT 管理部门和法务部门所看重的。这个模型的设计目标是通过合规审查,而不仅仅是通过基准测试。

i
Granite 侧重集成,而非对话
如果您在寻找最佳的法语通用助手,Qwen3 或 Mistral 通常仍会领先。Granite 作为组件时表现突出:它可以在处理流程中充当 RAG 引擎、工具编排器或结构化数据提取器。

#Mamba 混合架构及其内存节省效果

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

Granite 4 的真正技术优势在于其架构。传统 Transformer 完全依赖注意力机制:每生成一个新 token,模型都会重新读取整个上下文,并存储一个随对话长度线性增长的“KV 缓存”。上下文越长,显存占用就越高,推理速度也越慢。这是本地运行模型时处理长上下文的一个公认瓶颈。

Mamba 属于另一类模型:状态空间模型(state space models)。Mamba 层不会重新读取全部历史信息,而是维护一个固定大小的循环状态,用来概括过去的信息。因此,内存占用不会随着上下文长度增长,即使处理非常长的文档,吞吐量也保持稳定。单独使用 Mamba 的缺点是,对距离较远的细节回忆不够准确。

Granite 4 将两者结合。大多数模块是 Mamba-2 层(节省资源),其间穿插着少量注意力模块(精确)——比例约为九层 Mamba 对一层注意力。这样既保留了大部分内存节省效果,又保留了注意力机制精确找回某个细节的能力。实际运行时,Granite 4 所需的 RAM/VRAM 明显少于同等规模的 Transformer,尤其是当上下文超过几千个 token 时。

→
长上下文场景下的收益最大
提示词较短时,它与传统 Transformer 的差别不大。但加载大篇幅文档或长对话后,差距就会拉大:传统模型会占满显卡的显存,而 Granite 的内存占用几乎保持不变。

#Micro、Tiny 和 Small:应选择哪个变体

Granite 4 提供多种规模,后缀表示其面向的硬件。标有“H”的版本采用混合架构;对于尚不支持 Mamba 的环境,也提供非混合版本。

Granite 4 Micro(约 3B,稠密模型)
最小的型号,采用稠密混合架构。非常适合在 CPU 上、显存较少的设备上或边缘设备上运行。Q4 量化后可容纳于约 2 GB 的内存中。非常适合信息提取、分类和轻量级 RAG。
Granite 4 Tiny-H(~7B,MoE)
混合式 MoE(专家混合)架构:总参数量大,但每个 token 仅激活少量参数,因此速度快。在入门级显卡上,质量与速度之间取得了良好的平衡。
Granite 4 Small-H (~32B, MoE)
门槛较低的高端选择:处理业务任务时,质量接近大型模型,同时保留混合架构较低的内存占用。面向工作站或服务器。
非混合变体
对于尚未支持Mamba的运行时,存在一个传统Transformer版本。仅用于兼容性场景——将损失内存优势。

入门时,Micro 足以验证使用场景,而且在各种设备上都能运行。等您明确了要将哪些用途投入规模化应用,并通过测量确认质量不足后,再升级到 Tiny-H 或 Small-H。

#先决条件与 VRAM

软件方面的前提只有一个:安装 Ollama 并保持更新——其守护进程默认监听 http://localhost:11434。请确保使用较新的版本:支持 Granite 4 的 Mamba 层需要足够新的 Ollama 版本,否则模型会拒绝加载。

Micro(3B),Q4 量化
约需 2 GB 显存。也可在配备 8 GB 内存的机器上使用 CPU 运行,速度虽慢,但能稳定运行。RTX 3060 12GB 显卡则绰绰有余。
Tiny-H (7B MoE) 采用 Q4 量化
约5 GB VRAM用于模型权重,但MoE部分激活使推理轻量。8–12 GB显存即可充分满足需求。
Small-H (32B MoE) Q4 量化
约需 19 GB 显存。可使用 RTX 4090 24GB,或配备 32–48 GB 统一内存的 Mac。混合架构能限制长上下文下内存占用的急剧增长。
上下文余量
得益于 Mamba,KV 缓存的内存占用远小于同等规模的 Transformer:您可以使用较长的上下文,而无需将显存容量翻倍。
i
量化选择参考
Q4_K_M 仍是推荐的默认设置(质量与文件大小之比最佳)。如果您有显存余量,并且希望在敏感的信息提取任务中获得最高准确率,可改用 Q5_K_M 或 Q8_0。

#通过 Ollama 安装 Granite 4

安装遵循 Ollama 的常规流程。该模型以 granite4 的名称发布在官方模型库中;各个变体通过标签选择。下载特定大小的模型前,请先在 ollama.com/library 上核实标签的准确名称,因为这些标签会随版本变化。

  1. 01
    检查Ollama
    确认守护进程正在运行且版本为最新。旧版本不支持 Granite 4 的 Mamba 层。
  2. 02
    拉取模型
    使用 ollama pull 下载所选变体。先从 Micro 开始,以便快速测试,避免占满磁盘空间或显存。
  3. 03
    启动首次对话
    ollama run ouvre une session interactive. Posez une question métier — résumé d'un texte, extraction de champs — plutôt qu'une devinette généraliste.
  4. 04
    接入用户界面
    将Open WebUI或LM Studio连接到本地端点,以便更方便地使用,或直接从您的应用调用HTTP API。
终端 — 安装并启动 Granite 4
# Vérifier la version d'Ollama (doit être récente)
ollama --version

# Tirer la variante Micro (la plus légère)
ollama pull granite4:micro

# Lancer une session interactive
ollama run granite4:micro

# Vérifier ce qui tourne et la répartition GPU/CPU
ollama ps

用于应用程序时,Ollama 会在同一端口提供兼容 OpenAI 的 API。因此,只需更改基础 URL 和模型名称,就能复用任何现有客户端。

终端 — 调用本地 API
curl http://localhost:11434/api/chat -d '{
  "model": "granite4:micro",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "stream": false
}'

#Apache 2.0:企业使用无陷阱的许可证

这是法务团队在查看基准测试之前会关注的一点。Granite 4 以 Apache 2.0 许可证发布,这是一种宽松且久经实践检验的开源许可证。您可以将其用于商业用途、修改、重新分发,并集成到闭源产品中,没有用户数量门槛,也没有需要留意的可接受使用条款。

与热门替代方案相比时,这一区别很重要。Meta 的“Llama Community License”并不是真正的开源许可证:它对月活跃用户超过 7 亿的情况施加限制,并禁止某些用途。Gemma(Google)的条款也通过禁止用途政策约束使用。Apache 2.0 没有上述限制:它是一种标准许可证,法务部门已经熟悉,无需协商即可批准。

商业用途
允许使用,不受规模或行业限制,也无需关注用户数量门槛。
模型修改与微调
您可以调整模型并保留私有权重,无需发布。
再分发
可集成到专有产品中,但需保留许可证声明。
IBM治理
模型具有密码学签名、数据有文档说明,并有 ISO 42001 认证——这些都是合规审查中的具体依据。
!
始终检查变体的许可证
Apache 2.0 覆盖 Granite 4 主要系列,但第三方微调模型分发在 Ollama 上可能采用其他许可条款。在生产部署前,请检查模型说明卡。

#RAG 与函数调用:Granite 的强项

这正是Granite体现自身价值的地方。IBM专门针对两种企业用途训练了这些模型:RAG(根据提供的文档回答问题)和函数调用(可靠地调用工具)。这些正是构建实用业务助手所需的基础能力,而不只是构建一个简单的聊天机器人。

在 RAG 中,Granite 紧密遵循所提供的上下文,减少幻觉:它倾向于依据注入的段落作答,而不是凭空发挥。再加上其混合架构能够处理长文档而不让显存占用激增,这使它成为在本地查询文档库的良好引擎。Micro 版本通常就够用,因此配置较低的硬件也能运行 RAG。

在工具方面,Granite 能生成结构良好的函数调用并符合预期的 JSON 模式。这是智能体的基础:模型决定调用函数,读取结果并继续执行。结合低成本的长上下文,可实现无需依赖云端的可靠业务自动化

文档 RAG
优势明显:能很好地跟踪上下文,编造信息的比例低,处理长上下文时内存消耗小。非常适合内部知识库。
函数调用
可靠的工具调用与符合规范的 JSON——构建本地智能体及与现有系统集成的基础组件。
结构化提取
将自由文本转换为结构化字段(日期、金额、实体)。Micro版本已表现非常出色。
通用对话
表现尚可但并不突出。Granite并非在此方面寻求突破。
示例 — 定义一个用于函数调用的工具
{
  "type": "function",
  "function": {
    "name": "chercher_facture",
    "description": "Récupère une facture par son numéro",
    "parameters": {
      "type": "object",
      "properties": {
        "numero": { "type": "string", "description": "Numéro de facture" }
      },
      "required": ["numero"]
    }
  }
}

#故障排除

模型无法加载(架构错误)
您的 Ollama 版本过旧,不支持 Granite 4 的 Mamba 层。请将 Ollama 更新到较新的版本,然后重新执行 pull。
执行 pull 时出现“model not found”
不存在这个名称的标签。请在 ollama.com/library 上核对准确拼写——变体标签会随版本发布而变化。
RAG 中出现偏离主题的回复
上下文格式错误或噪声过大。请对插入的内容进行结构化处理,减少其数量,并明确要求仅根据提供的文档作答。
格式错误的工具调用
JSON 模式定义存在歧义。请简化定义,明确标出必填字段,并先用单个工具进行测试,再叠加多个工具。
在 Small-H 上速度严重下降
由于显存不足,模型的一部分被转移到系统内存中。“ollama ps” 可显示 GPU/CPU 的分配情况。请切换到 Tiny-H 或 Micro,或将量化位数再降低一档。
« Connection refused »
Ollama 守护进程未启动。请用“ollama ps”检查它是否确实在 http://localhost:11434 上监听。

#深入了解

Granite 所依赖的技术组件已在本站介绍过。以下指南可作为本指南的延伸阅读:

在 Linux 上安装 Ollama
如果守护进程尚未就绪,这是必要的前置步骤:安装脚本、systemd 服务以及 NVIDIA/AMD GPU 配置。
选择量化方案(Q4、Q5、Q8、FP16)
用于权衡 Granite Small-H 的模型质量与显存需求:每调整一级量化,显卡能容纳的内容都会发生变化。
企业本地 AI:GDPR、主权与部署
与 Apache 2.0 许可证相配套的阅读内容:如何在组织内合规部署 Granite。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。