简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

32GB、128GB对阵192GB:算算NVIDIA RTX Spark与AMD Gorgon Halo的内存账

2026-09-30 05:45

【ZOL中关村在线原创】随着10月上市时间临近,倍受行业以及用户关注的NVIDIA RTX Spark(代号N1X)平台的完整参数规格,此前在英伟达官网被正式放出,首有两款型号:旗舰版规格为20核Grace CPU+6144个CUDA核心的Blackwell GPU,统一内存容量从24GB起步、最高支持到128GB;而另一款主流版本的N1X则采用18核Grace GPU+5120个CUDA核心的Blackwell GPU,统一内存容量则被锁定在24GB-32GB。

其中,RTX Spark N1X旗舰版平台覆盖笔记本和紧凑型台式机(迷你机),而主流版平台则只对应笔记本产品线。

目前,在正式对RTX Spark N1X电脑进行评测之前,我们很难从核心规模上去判断其CPU和GPU性能的实际表现到底如何。不过,从对本地运行AI大模型最为关键的内存配置上,我们却可以窥见其实现其满足本地AI运行这一设计初衷的能力,以及大概的本地AI性能表现。毕竟对于超大统一内存而言,此前我们有同为128GB统一内存的AMD Strix Halo测试数据,现在又有了AMD第二代Halo系列的Gorgon Halo做参考。

所以在10月8日RTX Spark N1X正式上市之前,我们不妨通过内存配置,算一算Spark N1X的本地AI能力。

现在我们知道,RTX Spark N1X最小内存为24GB,最大为128GB;而旗舰版N1X和主流版N1X的最大内存容量差异高达4倍,旗舰型号最高128GB,而主流型号最高却只有32GB。此前英伟达对外宣传的“可在本地运行1200亿参数模型”,所说的自然是128GB的旗舰版了,而主流版RTX Spark N1X是无法支持到如此高参数量的大模型的。

128GB统一内存如果放在两、三年前,那确实是足够能打,但是放在今天,随着支持高达192GB统一内存的AMD Gorgon Halo已经抢先发布,RTX Spark N1X就给人一种发售就有点过时的感觉。而且笔记本平台对应的次级型号RTX Spark N1X最高统一内存只有32GB,这很可能意味着“大家都能买得起的RTX Spark N1X笔记本”,实际上是阉割掉了绝大部分的本地AI模型能力的低配版。

反观AMD在2025年初发布的Strix Halo,也就是大家熟悉的锐龙AIMax家族,最高统一内存容量就已经达到128GB。而现在已经上市的新一代Gorgon Halo,其统一内存容量直接从128GB推高到了192GB,用户可以将其中160GB划分给GPU做显存,从而直接支持3000亿参数量大模型在x86本地终端设备上运行。

而且,特别需要指出的是,Gorgon Halo家族首发的三款型号处理器虽然在CPU核心线程数量、频率、缓存、NPU算力以及GPU规格上有所差异,但关系到AI大模型本地性能的统一内存却都给到了192GB,没做任何阉割。它并没有笔记本专属限定版本,一个平台可以直接跨各种终端设备使用,而且都拥有同样的统一内存规格。能做到这一点是因为其45W-120W的可灵活配置功耗,要比N1X桌面版的140W固定功耗低很多。

现在来看,最终上市的很多RTX Spark笔记本产品应该会搭配主流版的型号,而非旗舰型号。我们就以“大家都能买得起的RTX Spark N1X笔记本”的最高32GB内存为例,来看看当一台32GB统一内存和一台192GB统一内存笔记本放在一起,在本地大模型应用上的差距究竟有多大?我们不妨来算一笔账。

·第一层账:容量决定"能不能跑",这是硬门槛

经过近三年的验证,本地AI大模型推理有一条硬性门槛,那就是内存与显存容量,容量上不去,加载和推理生成速度就会断崖式下跌,甚至到不可用的程度。

我们选择了一些主流开源模型,在Q4_K_M(当前公认的甜点量化位宽)量化下,其实际体积摊开之后,大致的内存对应规则如下:

当然在实际运行时,还要扣掉系统本身的开销。所以在32GB的机器里,RTX Spark N1X平台所对应的Windows on Arm系统本身的负载,加上生成上下文的话就要吃掉不少容量,实际能分给模型的通常在24–28GB这个区间。这直接决定了主流版RTX Spark N1X平台比较流畅的模型参数区间大概是在8B–24B之间,而32B参数量多半就是能启动但推理生成速度达不到正常使用的临界状态了。

再看Gorgon Halo,最高160GB统一内存分配给显存之后,70B模型只占去四分之一,系统本身负载剔除之后,依然有上百GB的冗余空间留给上下文、多模型常驻和并发请求。例如Llama3.3-70B大模型,其在32GB统一内存平台上别说用了,就是加载都无法完成,但是在Gorgon Halo上却只是起步。所以单看二者在32B模型上的差异就可以看出,二者之间是面对大参数量模型的可用与不可用之分。

·第二层账:KV Cache与长上下文,32GB最致命的地方

当然,真正让小容量内存寸步难行的,归根到底还是KV Cache。

在推理过程中,上下文里每一个token的Key/Value张量都要常驻显存。它随上下文长度线性增长,尤其是智能体AI应用、代码库理解、长文档检索、多轮复杂对话等等这些应用,恰恰都是吃上下文的大户,而想要拥有更长的上下文,KV Cache的冗余就非常重要。

以FP16模型的KV Cache为例,我们看看不同参数量模型对应的大致占用量:

把表格中的数据映射到32GB统一内存上的话,如果装Qwen3-32B(~22GB)之后,大概只剩2–4GB余量,因此上下文会被死死卡在8K以内,这意味着一个中等规模的代码仓库都读不完。

而想要跑32K长上下文,那就只能退回到8B–14B的小模型上来跑,精度又远远不够。这种一根筋两头堵的体验,恐怕谁都不喜欢。

如果放在Gorgon Halo上,超长上下文瓶颈就会被直接冲垮。

例如70B权重(模型容量42GB)+32K上下文(16GB)的合计用量也只有58GB,128K上下文(64GB)的合计用量106GB,前者占掉160GB的三分之一出头,后者大概占到三分之二,依然有非常大的冗余空间。

因此Gorgon Halo可以支撑的是"大模型+超长上下文+多任务并发”的多重负载,而RTX Spark N1X的32GB版本却只能支撑起小模型+短对话的基础应用需求。这种差异在智能体AI为核心的当下,更显得有些不够看了。毕竟智能体AI需要长上下文做支持,而且背后就是KV Cache,小内存、小显存显然无法满足本地智能体AI应用的基础需求。

·第三层账:精度与生态,NVIDIA的两张对冲牌

如果只比内存和显存的话,NVIDIA RTX SPark N1X在与AMD Gorgon Halo的对决中无疑是输掉比赛的那一方,所以NVIDIA也采用了一些对冲手段去应对。

首先其手里的第一张牌是低精度。N1X基于第五代Tensor Core,支持FP4/NVFP4规格,把权重量化到4-bit甚至更低,等效于把内存容量"放大"。同样的32GB,理论上能塞进更大的模型。这是NVIDIA用计算精度换内存空间的策略。但它有两个问题:一是量化到4-bit以下的质量损失在复杂推理任务上会变得更可感知;二是这个算法栈要能被推理框架完整支持才可以。而AMD Gorgon Halo最高支持的300B模型,虽说也会取决于量化方式、模型架构和负载配置,但其对32B以上模型的支持却是实打实的,超大统一内存,而且三款发布型号都给足192GB容量,就意味着AMD手里的底牌更厚。

NVIDIA的第二张牌无疑是CUDA。这是NVIDIA真正的护城河。Gorgon Halo在纸面上的内存优势要落到真实性能,必然要依赖ROCm以及llama.cpp/vLLM/Ollama等框架对Radeon的调度质量。AMD非常清楚这一点,所以近年来一直在大力发展ROCm,并且推进了ROCm.AI的落地,同时与微软合作推出预配置开发环境的Project Zenith,而且"最低64GB统一内存"成为了硬性门槛。这个数字表明,AMD和微软共同认定的本地AI开发标准里,32GB是连入场线都没够到的。

而且客观地说,CUDA在Windows on Arm上的成熟度,在未拿到真机之前还是个未知数。N1X跑的是Arm指令集,x86生态要靠模拟层转译过渡,而本地AI工具链里大量依赖(包括部分推理后端、编译工具、驱动)在WoA上的适配进度并不乐观。反观Gorgon Halo,它是标准的原生x86生态体系,而且Python、ROCm、各类推理框架开箱即用,所以在软件兼容性方面,AMD反倒是更省心的那一方。

·结语

回到最初的问题:32GB和192GB的本地AI差距有多大?

首先,可用模型的上限差了一个数量级。32GB的适配区间是8B–24B,32B甚至都有些吃力,70B以上则是完全装不下;而192GB(160GB可变显存)则能比较轻松地容纳70B、120B大模型,甚至235B、300B级别的模型也能跑得动。

其次,我认为也是最重要的一点,就是KV Cache和长上下文,它是32GB统一内存平台最先崩塌的地方。上下文长度很可能被压到8K以内,这在智能体AI时代几乎等于不可在本地使用。

虽然NVIDIA的对冲手段是通过FP4低精度和CUDA生态来解决,但AMD Gorgon Halo的x86兼容性以及开箱即用显然对绝大多数开发者、用户而言更为友好。另外RTX Spark N1X在Windows on Arm上的成熟度也存疑,到底好不好用还需要市场和用户的双重验证。

目前搭载Gorgon Halo旗舰版本锐龙AI Max+ Pro 495的新品已经陆续上市,而RTX Spark N1X产品预计也将于2026年10月8号起开售,两家几乎选择了相同的新品上市周期,所以今年接下来的时间注定会是一个非常热闹的窗口期。具体表现如何,让我们拭目以待。

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。