进阶 10 分钟社区

Qwythos 9B:基于 Claude 训练的小型推理模型, 本地实测

Qwythos-9B 是 Empero AI 于 2026 年 6 月发布的社区模型:以采用 Apache 2.0 许可证的 Qwen3.5-9B 为底座,上下文长度为 1M,使用 Claude 生成的推理轨迹进行微调——“Qwythos”这个拼合词便由此而来(Qwen + Mythos)。背后没有精心包装的营销页面:只有 Hugging Face 上的 GGUF 权重,以及社区推送的 Ollama 标签。本指南梳理其来源,介绍如何规范安装,并在 RTX 5070 Ti 上通过实际测试,将它与底座模型 Qwen3.5-9B 进行对比。

作者: Mohamed Meguedmi·更新于 2026-08-21·已在 Windows、macOS 和 Linux 上测试

#Qwythos 是什么

Qwythos-9B 并不是“从零训练”的模型,而是一个微调版本:有人选用了一个扎实的开放基础模型——阿里巴巴的 Qwen3.5-9B——并用特定的推理轨迹语料对它进行了再训练。这些轨迹(详细的思维链,即问题 → 逐步思考 → 答案)据称来自 Anthropic 的 Claude 系列模型针对一组逻辑、数学和编程问题生成的输出。“Qwythos”这个名称浓缩了这一想法:Qwen 的首字母,加上“Mythos”——整理该数据集的社区为 Claude 的推理风格起的非正式名称。

这个项目的价值可以用一句话概括:将一种篇幅较长、结构清晰的推理风格蒸馏到足够小、能在消费级GPU上运行的模型中。9B模型在Q4量化下可装入6 GB显存,而大型推理模型需要数十GB显存。如果这种“思考方式”的迁移有效,就能得到一个袖珍推理模型。这正是我们接下来要验证的。

i
社区模型,非官方产品
Qwythos 既不是阿里巴巴的模型,也不是 Anthropic 的模型。它是一个由 Empero AI 分发的社区微调模型。两家原始模型公司都不维护它,也不为它背书。请将其视为开源项目:权重已经提供,质量仍需验证,支持则取决于作者是否愿意提供帮助。

#Qwythos 的来源:需要了解的两个来源

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

在安装任何东西之前,必须先了解模型权重究竟来自哪里。对于社区模型,来源并非无关紧要的细节:它决定了您可以在多大程度上信任下载的文件。Qwythos 可以从两个地方获取,但这两个来源并不具有同等价值。

来源 1 — Hugging Face(原始仓库)
Empero AI 在 Hugging Face 上发布模型权重,同时提供 transformers 格式(safetensors)和量化 GGUF 格式。这里是权威信息来源:可查阅模型卡、标明的 Apache 2.0 许可证,以及关于 Qwen3.5-9B 基础模型和推理轨迹数据集的说明。核对哈希值和阅读模型卡时,请始终从这里开始。
来源 2 — 社区发布的 Ollama 标签
在 Ollama 注册表中,Qwythos 出现在用户命名空间(如 nom-utilisateur/qwythos)中,而非官方库内。这些标签实用——只需一条命令即可安装——但已被第三方重新打包自 Hugging Face 的 GGUF 模型。在信任前,请确认标签发布者身份。
!
Ollama 标签没有签名
任何人都可以以自己的名义向 Ollama 模型注册库推送模型。“qwythos”标签并不能保证其背后的 GGUF 文件对应 Empero AI 的官方权重。对于严肃用途,建议从 Hugging Face 下载 GGUF 文件,并通过 Modelfile 自行导入(见下文),而不是盲目拉取社区标签对应的模型。
Base
Qwen3.5-9B(阿里巴巴),Apache 2.0 许可证
类型
经过推理微调的模型,具有显式思维链
发布方
Empero AI(社区项目),2026 年 6 月发布
许可证
Apache 2.0 — 允许商业使用,许可证继承自基础模型
上下文
宣称支持 100 万 token 的上下文(继承自 Qwen3.5),但需根据实际显存容量谨慎看待这一数值
格式
Hugging Face 上的 safetensors + GGUF(Q4_K_M、Q5_K_M、Q8_0)

#硬件要求

对于较新的硬件,运行一个 90 亿参数的模型比较轻松。采用 Q4_K_M 量化——推荐的质量与内存占用折中方案——时,Qwythos-9B 加载后占用约 6 GB 显存,此外还需要上下文缓存(KV cache),其大小会随提示词长度增长。我们的测试平台使用 RTX 5070 Ti(16 GB),远高于最低要求。

Q4_K_M (推荐)
约需 6 GB 显存。可装入 RTX 3060 12 GB、RTX 4070、RTX 5070 Ti 的显存中;上下文较短时,甚至也能将部分模型装入 8 GB 显存中。
Q5_K_M
≈ 7 GB。质量略有提升,如果您有 12 GB 或更多容量,可优先考虑。
Q8_0
约10 GB。与FP16相比几乎无损,适用于16 GB及更高显存环境。
长上下文
1M的显存需求为理论值。仅用于128k token的KV缓存就已占用数GB,建议显存至少达到16GB以上,以舒适地支持超过32k的上下文长度。
→
推理模型会产生大量输出
推理模型会在回答前把“思考”过程写出来:有时仅为给出一行回答,就会生成数百个 token 的思考内容。请为输出上下文(num_predict)预留余量,并做好响应时间比同等规模的常规模型更长的准备。

#使用 Ollama 安装 Qwythos

有两种方式。快捷方式:拉取社区标签对应的模型。稳妥方式:从 Hugging Face 下载官方 GGUF 文件,再通过 Modelfile 导入。我会详细介绍这两种方式;对于用于正式工作的工作站,第二种更值得选择,因为您清楚知道自己运行的究竟是哪个文件。

  1. 01
    检查 Ollama 是否正在运行
    Ollama 的守护进程通过 http://localhost:11434 提供服务。继续下一步之前,先发起一次简单调用,确认它能够响应。如果您尚未安装 Ollama,请参阅 Ollama 安装指南。
  2. 02
    社区标签快捷方式
    在 ollama.com 上查找发布者的标签(用户命名空间),然后运行 ollama run。请记录发布者的精确名称:这是您唯一能确认来源的依据。
  3. 03
    安全途径——从 Hugging Face 下载 GGUF
    从 Empero AI 仓库下载 Q4_K_M 格式的 .gguf 文件,核对文件的 SHA256 哈希值与模型卡片上显示的值一致,然后创建一个 Modelfile 指向该文件。
  4. 04
    创建本地模型
    运行 ollama create 会根据您的 Modelfile 创建一个带名称的模型。您会获得一个从头到尾都由您掌控的本地标签。
  5. 05
    启动并进行对话
    ollama run 启动交互式会话。首次加载时,模型会被载入 VRAM;只要模型仍驻留在 VRAM 中,后续启动即可立即完成。
终端 — 验证 Ollama
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
终端 — 快捷入口(社区标签)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
终端 — 可靠的方法(Hugging Face GGUF)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
终端 — 导入并启动
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
推理时使用较低的温度
对于推理模型,温度设为 0.6 左右时,思维链比采用常见的 0.8 设置更稳定。温度过高,模型会偏离主题;温度过低(0.1-0.2),则会重复输出。温度 0.6 与 top_p 0.95 的组合是一个不错的起点,可根据您的任务调整。

#首次推理测试

我们先从一个经典的陷阱问题开始,这类问题容易让未经推理训练的小模型出错。目标不只是得到正确答案,还要看模型是否能展开连贯的解题过程,而不是猜测。

测试提示词
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

预期答案:0.05 欧元。直觉陷阱容易让人回答 0.10 欧元。在我们的测试平台上,Qwythos-9B 列出方程(球 = x,球棒 = x + 1,总价 2x + 1 = 1.10),解出 x = 0.05,并在得出结论前验证 0.05 + 1.05 = 1.10。这个过程很冗长——为一个数值答案写了约十行思考过程——但正确且可追溯。这正是我们希望经过推理微调的模型表现出的行为。

→
请在您的实际问题上测试
模型在训练过程中可能曾遇到过这类经典谜题。要客观评估,应从实际领域中构建两到三个问题(例如一个物流约束、一段需要调试的代码、一个业务计算),并比较其解决思路,而不仅仅是最终结果。

#Qwythos 与原版 Qwen3.5-9B 的对比:微调带来的变化

真正的问题是:微调模型相比它所基于的原始模型,是否有所提升?为衡量这一点,我们同时安装 Qwen3.5-9B 基础模型,在相同的温度设置下,让两个模型回答同一组逻辑与数学问题。以下是我们在 RTX 5070 Ti 测试平台上得到的结果。

终端 — 安装基础环境以进行对比
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
推理长度
Qwythos 始终会明确展开思维链;Qwen3.5 基础模型的回答往往更简短,有时直接作答,不展示中间步骤。
陷阱类问题
在反直觉谜题(如球棒与球、逻辑序列)上,Qwythos 出错率更低,因为它会验证自己的答案。而基础模型更容易陷入直觉陷阱。
速度
基础模型更有优势:对于同等内容的回答,它生成的 token 更少。Qwythos 在实际使用中较慢,因为它在回答前会“思考”——这是推理的代价。
原始知识
平局。推理微调不会增加事实知识;在常识问题上,两个模型表现相当(且存在相同的知识盲区)。
法语
等效。法语质量源自Qwen3.5基础模型;Qwythos不提升也不降低语言流畅度,仅改变回答结构,不改变语言本身。

对比结论:Qwythos 在重视推理过程的任务(数学、逻辑、调试、规划)上明显胜出,但在速度和简短回答方面落后。如果您需要一个快速完成改写或摘要的助手,基础模型 Qwen3.5-9B 就足够了。如果您想要一个能展示推理过程的小型推理模型,Qwythos 就有其存在的价值。

!
推理并非没有代价
思维链 = 生成更多 token = 更高的延迟,以及更多用于上下文的显存消耗。对于简单任务,强制模型进行推理只会拖慢速度,并不会带来任何收益。将 Qwythos 留给真正能从问题分解中受益的任务,其余任务则使用更直接的模型。

#同系列的大号模型:Qwythos 27B

Empero AI 也发布了一个27B版本,基于相同原理构建,其基础为更大规模的Qwen3.5模型,并通过推理轨迹微调实现。该版本旨在满足那些拥有足够VRAM、希望在推理质量上进一步提升的用户需求,但需要承担显著更高的内存开销。

VRAM (Q4_K_M)
≈ 19 GB。需要一张配备 24 GB 显存的 RTX 4090、一张专业显卡,或一台采用统一内存的 Mac(M4 Pro/Max),才能轻松容纳该模型。
我们所获得的优势
在多步骤问题上具备更长且更稳健的推理链;级联算术错误更少。在真正困难的任务上,这一优势尤为明显。
所付出的代价
需要三倍的显存,生成速度也更慢。在配备 12–16 GB 显存的设备上,27B 模型即使采用 Q4 量化,也无法完全装入显存,必须将部分模型卸载到 CPU 端运行,而这会严重拖慢速度。
何时选择
如果 9B 模型经常无法解决您遇到的实际问题,并且您有 24 GB 显存。否则,9B 仍是质量与资源消耗之间的最佳选择。
i
从9B开始
不要习惯性地直接选择 27B 模型。先用实际任务测试 9B 模型:很多情况下,它已经足够。只有在您确实需要解决的问题上发现了具体的质量瓶颈,才升级到 27B——不要仅仅因为觉得模型就该更大而升级。

#故障排除

Ollama 标签不存在/已消失
社区标签会不断变化。请选择安全路径:从Hugging Face下载GGUF模型,并通过Modelfile导入。您不再依赖第三方的可用性。
模型不进行推理,仅直接回复
添加明确的系统指令("逐步分解"),并确认 num_ctx 足够大,以留出思考空间。过低的温度设置也会抑制思维链的生成。
截断的回复
推理会消耗输出预算。请增加 num_predict(或您客户端对应的参数)以让模型完成推理过程并输出最终结果。
输出速度非常慢
请用 ollama ps 检查模型是否完全装得进显存。如果部分模型溢出到 CPU 使用的系统内存中,速度就会骤降:将量化位数降低一档,或减小 num_ctx。
文件完整性存疑
下载的 GGUF 文件的 SHA256 值应与 Hugging Face 页面上发布的值一致。若哈希值不同,说明文件已被重新打包或损坏——请勿运行该文件。

#深入了解

如需安装 Qwythos 的配套组件,并了解本文提到的取舍:

安装 Ollama(Windows、macOS、Linux)
本指南的前提条件:在拉取任何模型之前,先在 11434 端口上配置好 Ollama 守护进程。
选择量化方案(Q4、Q5、Q8、FP16)
用于根据您的显存容量和质量要求,为 Qwythos 及其同系列模型在 Q4_K_M、Q5_K_M 和 Q8_0 之间作出选择。
使用 Ollama 安装 DeepSeek R1
另一个基于思维链的开源推理模型,可用于将Qwythos的推理过程与一个成熟参考模型进行对比
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。