小显存 也能跑大模型

AI SSD 把大模型的 KV 缓存卸载到高速固态硬盘,突破 GPU 显存墙,让 8GB / 16GB 的笔记本显存也能流畅跑 35B、120B 级别的大模型。

4 个真实硬件平台 / 6 款主流大模型 / AI SSD 与 Normal SSD 对照测试

BENCHMARK / VERIFIED DATA

×405

热 Prefill 最高加速

同平台同模型下,AI SSD 对比 Normal SSD(AMD 395 128G · Gemma4 26B)

×407

KV 缓存复用自加速

二次推理复用 SSD 上的 KV 缓存,单卡 Prefill 较首次推理提速

16GB

显存跑通 122B 大模型

Intel 358H 32G:Normal SSD 全 OOM,AI SSD 全部跑通

8GB

显存跑通 35B 大模型

RTX 5060:Normal SSD 全 OOM,AI SSD 跑通 20B / 35B

Architecture

什么是 AI SSD 缓存

大模型每生成一个新的 token,都需要读取之前所有 token 的「KV 缓存」。KV 缓存随上下文长度线性增长,是吞噬显存的头号大户。

1

传统显存方案

KV 缓存全部放进 GPU 显存。显存不够 → 大模型直接 OOM,跑不起来。

2

AI SSD 卸载

KV 缓存卸载到高速 SSD,GPU 显存只保留活跃部分,按需加载。

3

热缓存复用

相同上下文二次推理,直接复用 SSD 上的 KV 缓存(Hot),跳过重算。

01

突破显存墙

把「显存容量」问题转化为「SSD 带宽」问题,小显存设备也能承载超大上下文与超大模型。

02

热推理加速

相同 prompt 二次访问时,KV 缓存已在 SSD 上就绪,Prefill 阶段几乎零重算,速度数量级提升。

03

长上下文友好

128K / 256K 超长上下文下,Normal SSD 往往直接 OOM,AI SSD 仍可稳定运行。

Constraint

为什么需要 AI SSD

消费级与笔记本 GPU 的显存通常只有 8–32GB,而一个 120B 参数模型仅权重就需要 60GB+。显存不足时,传统方案束手无策。

OOM

Intel 358H 32G(16GB 显存)Qwen3.6-35B、gpt-oss:120b、Qwen3.5-122B、Gemma4:26B 在 Normal SSD 下全部显存不足(OOM);切换到 AI SSD 后,这 4 款大模型全部跑通。

OOM

NVIDIA RTX 5060(8GB 显存)gpt-oss:20b、Qwen3.6-35B 在 Normal SSD 下全部 OOM;AI SSD 让 8GB 显存也能跑 35B 大模型。

OOM

长上下文场景128K / 256K 上下文下,Normal SSD 因 KV 缓存膨胀频繁 OOM;AI SSD 通过卸载将上下文上限显著抬高。

一句话总结

同样的硬件,Normal SSD 跑不动的大模型,AI SSD 跑得动

同样的模型,AI SSD 的热推理速度,是 Normal SSD 的数倍到数百倍

数据不会骗人 —— 下面的实测折线图说明一切。

Results

效果亮点

以下数字均来自本报告的真实实测数据(详见「完整数据」中的折线图与明细表)。

01

热 Prefill 最高 ×405

AMD 395 128G 上 Gemma4:26B(128K / 64K Input),AI SSD 的热 Prefill TPS 达到 Normal SSD 的约 405 倍。

02

KV 复用自加速 ×407

同一台机器上,复用 SSD KV 缓存的「热推理」较首次「冷推理」的 Prefill 提速最高约 407 倍。

03

冷 Decode 最高 ×6.4

Intel 358H 32G 上 Gemma4:26B,AI SSD 的冷 Decode TPS 达到 Normal SSD 的约 6.4 倍。

04

大模型全跑通

16GB 显存跑通 122B、8GB 显存跑通 35B——这些在 Normal SSD 下根本无法启动。

Test Matrix

实测平台

4 个真实硬件平台、6 款主流大模型(gpt-oss:20b · Gemma3:27B · Qwen3.6-35B · gpt-oss:120b · Qwen3.5-122B · Gemma4:26B)。

AMD 395 128G

96GB 显存 · 7 模型 / Radeon 8060S · 128GB SSD 缓存

Intel 358H 64G

32GB 显存 · gpt-oss:20b / Intel Ultra X7 358H · 85GB SSD 缓存

Intel 358H 32G

16GB 显存 · 6 模型 / 120B/122B 大模型 Normal SSD 全 OOM

NVIDIA RTX 5060

8GB 显存 · 2 模型 / 20B/35B 大模型 Normal SSD 全 OOM

查看完整 Benchmark 数据

4 个指标维度的折线对比(Cold Prefill TPS · Hot Decode TPS · Cold TTFT · Hot TTFT),AI SSD 青色实线 vs Normal SSD 灰色虚线,OOM 一目了然。

折线图 / 多机型切换 / 每模型展示最大可测上下文

查看完整数据