你有一台配 AMD 显卡的电脑,想让开源模型学会自己的资料,却常常先卡在工具安装和显存不够上。很多本地模型工具长期围绕 NVIDIA CUDA 生态搭建;换成 AMD,软件兼容、计算优化和安装配置都可能成为额外门槛。Unsloth 这次试图把这堵墙拆低:它宣布正式支持 AMD 硬件,把本地推理、微调、强化学习和部署纳入同一套工具链。值得注意的是,目前所有具体能力和性能数字都来自 Unsloth 代表 danielhanchen 发布的一篇 Reddit 宣布帖,尚无 AMD 或第三方测试交叉验证。
不只是“能跑起来”
这次更新覆盖的首先是一条较完整的工作流。推理,就是让训练好的模型回答问题;微调,是在已有模型上继续训练,让它适应特定任务或数据;强化学习(RL)则通过奖励信号,让模型更偏向某些行为。RL 需要反复生成和评分,通常比普通推理更消耗算力与显存。
Unsloth 的宣布帖称,这些环节现在都可以在 AMD 硬件上进行,并点名支持 Radeon RX 9000、RX 7000 系列,Instinct MI350、MI300,以及 Strix Halo / Ryzen AI Max 系统;没有 GPU 时,也可以用 AMD CPU 做推理。不过,帖子没有逐项说明每类硬件究竟支持推理、微调、RL 和部署中的哪些功能,因此不能把总体能力直接套到每一款设备上。
软件环境方面,安装程序会自动配置优化过的 ROCm、Triton、bitsandbytes、PyTorch 和 llama.cpp 构建。ROCm 是 AMD 的 GPU 计算软件栈;Triton 是编写和编译高性能 GPU 计算内核的工具。它们承担的角色,类似于 CUDA 生态里负责运行和优化模型计算的基础设施。Unsloth 还提供每日更新的 AMD 优化 llama.cpp ROCm 预构建版本,目的是减少用户自己编译的等待时间。偏好命令行安装的用户,也可以运行 uv pip install "unsloth[amd]"。
真正的门槛是显存
显存(VRAM)是 GPU 用来存放模型权重、训练中间结果和缓存的高速内存。它像一张有限的工作台:模型和训练数据摆不下,计算再快也难以开始。对个人和小团队来说,显存容量往往是本地训练最先撞上的天花板。
按 Unsloth 帖子的说法,训练模型最多可减少 70% 显存占用,强化学习最多可减少 80%。这里的“最多”很关键。这是发布方给出的上限式数字,帖子没有披露对比基线、模型、任务、硬件、精度、批大小或测试方法,因此不能理解为所有场景都能获得同样幅度的节省。更稳妥的解读是:Unsloth 把降低 AMD 本地训练显存压力列为这次发布的核心卖点,实际收益仍要看具体配置。
模型范围方面,帖子明确点名 Qwen、Gemma、DeepSeek、GLM、Kimi、MiniMax 和 DiffusionGemma,可用于推理与训练。训练结果还能导出为 GGUF、safetensors 或 LoRA adapters——三种面向不同运行、存储或轻量微调需求的模型文件形式。Unsloth Studio 则被宣布为完全开源且免费。
为什么值得关注?
这次更新的意义不只在于多支持几张显卡。主流本地模型训练长期依赖 NVIDIA CUDA 工具链;Unsloth 把推理、微调、RL 和部署一起扩展到 AMD,相当于给本地模型开发者增加了一条较完整的替代路径。AMD 团队也参与了此次版本合作,但现有材料没有披露双方具体分工。
如果自动安装、预构建组件和显存优化能够稳定兑现,AMD 用户需要处理的环境配置会更少,现有硬件也可能承担更复杂的模型定制任务。对整个本地模型生态而言,硬件选择扩大,比单项跑分更重要:工具只有跨过安装、兼容和资源占用三道门,才真正进入普通用户的可用范围。
局限与未知
- Windows、Linux 和 WSL 支持均来自发布帖;其中“技术上支持 macOS”的具体路径、适用硬件和功能边界没有说明。
- 70% 与 80% 的显存节省缺少完整测试条件,也没有第三方复现,暂时只能视为发布方给出的最佳情形。
- 帖子称支持“几乎所有模型”,但范围含糊;目前更可靠的表述仅限于其明确列出的模型。