テクノロジー

RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話

1: rgfx 2026/09/08 11:17

V100かMI50試してもらってどうぞ、もしくは cloud.vast.ai

2: kenzy_n 2026/09/08 11:39

コストやメモリとの競争。

3: naozane2 2026/09/08 12:06

qwen3.8−27B(Q4KM)なら激安のRTX3060の2枚刺し(合計VRAM24GB)で十分動く。オーケストレーションのボスをクラウドモデル、qwenをワーカーにしとけばトークンが節約できる。

4: yarumato 2026/09/08 12:40

“NVIDIAは16GB(10万円)が自分の限界で、その上の24GB~32GB(30万〜90万円)には手が出ない。長文チャットにおいて、vLLM(AWQ)とOllama(GGUF)ではメモリの使い方が根本的に異なる。”

5: strawberryhunter 2026/09/08 12:46

精度という意味でそんなに良いモデルではないように思うんだけど、どうなんだろう。実測ではQwen3.6-35B-A3Bより遅くて精度は同等くらいにしかなっていない。3.8の35B-A3Bは出なさそう。正直見切り付けてるけど何か悔しい。

6: star_123 2026/09/08 12:51

技術力無い私はUnslothDesktopに ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ2_S ってモデルを繋いでOpenCodeで動かしてる、48tok/sぐらい出るけどvisionモデルがVRAMに入らない。あとはFreeTokenで35BMoEも良く使う

7: igni3 2026/09/08 13:49

外に出したくないとかじゃない限り、OpenAIとかに課金した方が良いよなって気になってきてる

8: toaruR 2026/09/08 14:09

FreeTokenではなかった\(^o^)/メインメモリ64くらい+12,16GBグラボ+FreeTokenの例が欲しいよねぇ……自分でやれか

9: rawwell 2026/09/08 15:50

“「Ollama(llama.cpp)がロード前に行うVRAM見積もりが、実際に安全に使える余地よりもかなり保守的だった」”

10: osakana110 2026/09/08 20:07

今のローカルLLMだと3060の2枚がコスパ良いが、5年も前の中古エントリーグラボ1枚に当時の新品価格よりやや高い5万円出すの納得いかない。

11: misshiki 2026/09/08 21:22

RTX 5060 Ti 16GB+Qwen3.8 27Bを検証。Ollamaで116K・全66層をGPU固定すると3.71→約30トークン/秒、約8倍高速化。

12: magi00 2026/09/08 21:23

ローカルLLMやっていると1にメモリ2にメモリ。メモリメモリメモリ。VRAMもメインメモリもとにかく容量が足りないってなるのでGPUやメモリが高騰する理由がよくわかる。