VRAM 12GBで動くローカルLLM【実測】
VRAM 12GBのGPUで、どのローカルLLM(文章AI)がどれくらいの速さで動くか実測データでまとめました。VRAMに収まるモデル6個と、収まらないときの速さの落ち方。
VRAMに全部収まるモデル(速い)
- qwen3.5:9b使用メモリ 6.0GB・約96.4トークン/秒⚡ 一瞬
- qwen3.5:4b使用メモリ 3.1GB・約132.1トークン/秒⚡ 一瞬
- gemma3:4b使用メモリ 2.8GB・約142.0トークン/秒⚡ 一瞬
- qwen3.5:2b使用メモリ 2.3GB・約170.4トークン/秒⚡ 一瞬
- llama3.2:3b使用メモリ 2.3GB・約189.7トークン/秒⚡ 一瞬
- gemma3:1b使用メモリ 0.9GB・約216.9トークン/秒⚡ 一瞬
収まらないけれど動くモデル(一部をCPUで処理)
VRAMからはみ出した分はCPUで処理するので、速さが大きく落ちます。
- gemma4:12b-it-q8_0使用メモリ 14.2GB・約17.2トークン/秒😊 快適
よくある質問
VRAM 12GBのGPUで動くローカルLLMは?
このサイトの実測では 6個のモデルがVRAMに全部収まりました。いちばん大きいのは qwen3.5:9b(使用メモリ約6.0GB、約96トークン/秒)です。
VRAM 12GBに収まらないモデルはどうなる?
動きますが、収まらない分をCPUで処理するので遅くなります。たとえば gemma4:12b-it-q8_0(約14.2GB)は、VRAM 16GBで約43.5トークン/秒、VRAM 12GB相当で約17.2トークン/秒、CPUのみで約4.6トークン/秒でした。
ほかの容量: VRAM 8GB / VRAM 16GB / GPUなし(メモリ別)
このサイトの運営PC(Ryzen 7 9800X3D / メモリ31GB / RTX 4080(VRAM 16GB))での実測値です。「VRAM 8GB/12GB相当」は、RTX 4080 のまま使えるVRAMの量を制限して測った値です。実際の 8GB・12GB のGPUは、4080より処理が遅いぶん速さが下がることがあります。測り方