ブラウザ内ツール
GPU VRAM見積もり
ローカルLLMを動かすのに必要なVRAMを、パラメータ数・量子化・文脈長から概算します。手持ちのGPUで動くかを、重みとKVキャッシュの内訳つきで判定します。
3.7 GB
重み
4.0 GB
KVキャッシュ
8.5 GB
合計(推論)
手持ちGPUに載るか
RTX 4060 Ti / 30608GB
RTX 4070 / 308012GB
RTX 4080 / 4060 Ti 16G16GB
RTX 4090 / 309024GB
A100 40G40GB
A100/H100 80G80GB
重みはパラメータ数×量子化バイト数で厳密。KVキャッシュは層数×隠れ次元×文脈長からの概算で、GQA/MQA採用モデルでは実際はもっと小さくなります。表示は推論(load)時の目安で、 学習・ファインチューニングは勾配とオプティマイザ状態で数倍必要です。すべてブラウザ内で計算。
VRAMを減らすには
- 量子化:FP16→4bitで重みは1/4に。精度低下と引き換えに、より大きいモデルが載る。
- 文脈長を削る:KVキャッシュは文脈長に比例。長文を扱わないなら短くする。
- GQA/MQAのモデルを選ぶ:KVキャッシュ自体が小さく、長文脈でも省メモリ。