6GBのグラボで12Bモデルは動いた。ただし4トークン/秒|ローカルAIのある暮らし#8

前回はVRAM6GBに収まる5つのモデルをテストしてみました

AIのサイズが上がるにつれて速度が落ちていき、8BのSwallowでは9トークン/秒まで下がりましたが、僕的には実用に支障を感じるほどではありませんでした。

そこで今回は、VRAM6GBには収まらないサイズのモデルを無理やり動かすとどうなるのか?

速くなくても実用に使える速度は出るのか?小型モデルとは何が違うのかを検証していきたいと思います。

目次

今回のエントリーモデル

VRAM6GBの限界突破モデルを2つ選びました。

Gemma 4 12B(7.56GB)Qwen3-14B(9.00GB)です。どちらもファイルサイズが6GBを超えています。

条件は前回と同じです。

・量子化はQ4_K_M

・システムプロンプトなし

・思考モードオフ

・質問は2つ

AIへの質問文

1.日本の都道府県を教えてください。

2.コンビニで買える太りにくい食材を教えてください。

【エントリーNo.1】Gemma 4 12B:回答生成に失敗…

そうちゃん

まずはロード時のメモリ変化です。



編集長(Claude)

注目はRAMです。
これまでのモデルは増加1.5GB以下だったのに、12Bは8.1GB。
桁が違いますね。VRAMは5.8GBで頭打ちなので、載りきらない分はメインメモリ側を使っているようです。32GB積んでいたのが効いていますね。


そうちゃん

思ったよりメインメモリにも載っちゃってますね。でも読み込めたので12Bも動きそうじゃないですか笑


さっそく、都道府県を質問してみると…


なんと停止してしまいました…

ロードはできたのですが、回答の生成に失敗…25%で処理が止まってしまってます。

設定をみると、


GPUオフロード27(レイヤー数)、コンテキスト長4096。この2つは自動設定のままです。

編集長(Claude)

動かなかったのも立派な結果です。
ただ、VRAM不足で根本的に無理なのか、設定次第で動くのか。ここで結論が変わります。
試す価値があるのはこの2つです。


①GPUオフロードを下げる
 27より少し下げて、VRAMへの負担を軽くする。遅くなりますが動く可能性はあります。

②コンテキスト長を下げる
 4096→2048に。KVキャッシュ用のメモリが減ります。

編集長(Claude)

どちらも試してダメなら、少なくとも980 Tiでこの12Bは実用外と言えそうです。動けば動いたで、設定次第という話になりますね


そうちゃん

GPUオフロードを20に下げて試してみました。コンテキスト長はそのままです。この設定でチャットできました!



コンテキスト長は4096のままで、GPUオフロードを27→20に下げただけで動きました!


編集長(Claude)

GPUオフロードを下げ、VRAMに約1GBの余裕を残したところ、処理が通りました。
ギリギリまで載せるより、少し余裕を残したほうが動きやすいようです。どうやら限界ギリギリは欲張りすぎだったようですね笑


そうちゃん

では、都道府県の質問結果です。


速度4.81トークン/秒。Swallow 8Bの半分以下、E2Bの5分の1です。遅い…(´-ω-`)ウーン 

編集長(Claude)

でも今回の回答はかなりいいですね。
各地方の県数まで正確。重複なし、謎の県もなし、完全達成。自分で書き漏らしたことに気づいて、通しリストで補っています。


E2Bの「あいち8連呼→仕切り直し」も自己修復でしたが、今回の12Bは自己修正もかなりうまくできていますね。

何が抜けたか特定して、該当箇所に注釈付きで補っています。

でも速度4.81トークン/秒は、かなり遅いですね…残念ですが、僕のGTX 980 Ti 6GB環境では実用的に使うのは難しいですね(;´・ω・)

そうちゃん

次はコンビニ食材の質問結果です。


速度4.53トークン/秒、回答が始まるまで16.36秒。今回最も遅い結果です…

編集長(Claude)

でも今回の回答は、これまでのモデルより一段しっかりしています。


・分類に理由がついている

1.タンパク質を補給する(筋肉を維持し、代謝を落とさない)

2.食物繊維を摂る(血糖値の急上昇を抑え、お腹を膨らませる)

ただ分類するのではなく、なぜそれを摂るのかまで説明しています。

・見かける食材が多く、選択も的確

サラダチキン、焼き魚のパック、ゆで卵、ギリシャヨーグルト、もち麦ごはん、あたりめ、無糖炭酸水。
どれもコンビニで見かけることのある食材です。
「あたりめ」を挙げてきたのは、他のどのモデルにもなかった着眼点ですね。

・注意書きが実用的

「ドライフルーツは糖分が多いので注意」「ナッツはカロリーが高いので食べる量に注意」。買う側が引っかかりやすいところを、ちゃんと先回りしています。 

・極めつけは最後の3行

朝・昼・夜の組み合わせ例。食材リストで終わらず、献立として提示している。
「おにぎりだけでなく、おにぎり+サラダチキンのように組み合わせる」という主食・主菜の話も、#4でブランパンとゆで卵を組み合わせた話とほぼ同じ結論です。

編集長(Claude)

これで限界突破枠の一つ目が終わりました。結論は明快ですね。この12Bは動く、今回の2問ではかなり優秀、ただし遅い。



【エントリーNo.2】Qwen3-14B:沖縄は道、迷回答の復活

そうちゃん

まずはロード時のメモリ変化とGPUオフロード設定です。


編集長(Claude)

興味深い違いがでましたね。



注目はGPUオフロードが自動で19に設定された点です。

編集長(Claude)

Gemma 4 12Bは自動で27に設定され、そのままでは処理が止まりました。一方14Bは、より大きいモデルなのに自動で19。
結果としてVRAMは5.0GBに留まり、1GBの余裕が残っています。


LM Studioの自動設定も、いつも大正解とは限らないようですね。今回はGemma 4 12Bで少し欲張りすぎたようです笑

RAM増加8.8GBは今回最大。12Bの8.1GBを上回っています。32GBあったので、容量不足は避けられました。

そして今回、設定はそのままで停止せずに無事テスト完了しました!

そうちゃん

都道府県とコンビニ、2つの質問の結果を一気にお見せしますよ!
さすがにGemma 4 12Bよりは少しだけ遅く感じましたね。


都道府県の結果


コンビニの結果


編集長(Claude)

速度は都道府県4.37、コンビニ4.13トークン/秒。Gemma 4 12B(4.81/4.53)より確かに遅いですね。


都道府県:14Bでも沖縄を「道」にする…

これは衝撃です。

「道(2つ):北海道、沖縄県(※注:沖縄は「県」だが、地理的にも異なるため、一部では「道」として扱われることもある)」

編集長(Claude)

そんな事実はありません。道は北海道だけです。
しかも補足で「道:北海道と沖縄」と念押しまでしている。
もっともらしい注釈付きで堂々と間違えるという、#5で見たハルシネーションの典型例です。


しかも、そもそも県は43です。
リストを数えてみると、青森・岩手・山形・栃木・神奈川・静岡・島根・香川・愛媛が抜けています。
「44か所」という数も違い、実際のリストも足りていません。12Bが47都道府県をすべて並べたのと比べると、この差は大きいですね。

コンビニ:迷回答が復活…

・「高野豆腐(木綿豆腐)」…別物です

・「カルビー『スムージー』」「スリーエフ『野菜カレーパン』」…実在が疑わしい

・「クックドゥ『低カロリーマヨネーズ』」…クックドゥは中華調味料です

・太りにくい食材の1位がフルーツとスムージー。う〜ん、これは選び方や量にもよりますね…

限界突破枠まとめ&わかったこと


僕のGTX 980 Ti 6GB環境では、12Bや14Bクラスを実用的に使うのは厳しいという結果でした…(。-`ω´-)ンー 

8GBならもう少しVRAMに載せられるので、結果は変わるかもしれません。もしかすると実用できる可能性も…?試していないので、ここはあくまで推測です笑

わかったことをまとめます。

・僕のGTX 980 Ti 6GBでもGemma 4 12Bは動いた。ただし4トークン/秒台で実用は厳しい

・自動設定のままでは動かない場合もある。止まったら、まずGPUオフロードを少し下げてみる

・今回の2問では、14BのQwen3より12BのGemma 4のほうが好結果。パラメータ数だけで回答品質は決まらないようです 

・8GBなら改善するかもしれないが未検証(ここはまだ想像です笑)

以上が6GB限界突破枠でした!

次回予告

次回はグラフィックボード換装直前に思い出したGemma 4 もう一つのモデル!

E2Bと12Bのあいだにもう一つモデルがあるのを思い出し、急遽テストすることに笑

これがGTX980Ti 6GBでの検証最後の回になります。

お楽しみに!

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

目次