V100かMI50試してもらってどうぞ、もしくは cloud.vast.ai
コストやメモリとの競争。
qwen3.8−27B(Q4KM)なら激安のRTX3060の2枚刺し(合計VRAM24GB)で十分動く。オーケストレーションのボスをクラウドモデル、qwenをワーカーにしとけばトークンが節約できる。
“NVIDIAは16GB(10万円)が自分の限界で、その上の24GB~32GB(30万〜90万円)には手が出ない。長文チャットにおいて、vLLM(AWQ)とOllama(GGUF)ではメモリの使い方が根本的に異なる。”
精度という意味でそんなに良いモデルではないように思うんだけど、どうなんだろう。実測ではQwen3.6-35B-A3Bより遅くて精度は同等くらいにしかなっていない。3.8の35B-A3Bは出なさそう。正直見切り付けてるけど何か悔しい。
技術力無い私はUnslothDesktopに ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ2_S ってモデルを繋いでOpenCodeで動かしてる、48tok/sぐらい出るけどvisionモデルがVRAMに入らない。あとはFreeTokenで35BMoEも良く使う
外に出したくないとかじゃない限り、OpenAIとかに課金した方が良いよなって気になってきてる
FreeTokenではなかった\(^o^)/メインメモリ64くらい+12,16GBグラボ+FreeTokenの例が欲しいよねぇ……自分でやれか
“「Ollama(llama.cpp)がロード前に行うVRAM見積もりが、実際に安全に使える余地よりもかなり保守的だった」”
今のローカルLLMだと3060の2枚がコスパ良いが、5年も前の中古エントリーグラボ1枚に当時の新品価格よりやや高い5万円出すの納得いかない。
RTX 5060 Ti 16GB+Qwen3.8 27Bを検証。Ollamaで116K・全66層をGPU固定すると3.71→約30トークン/秒、約8倍高速化。
ローカルLLMやっていると1にメモリ2にメモリ。メモリメモリメモリ。VRAMもメインメモリもとにかく容量が足りないってなるのでGPUやメモリが高騰する理由がよくわかる。
RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話
V100かMI50試してもらってどうぞ、もしくは cloud.vast.ai
コストやメモリとの競争。
qwen3.8−27B(Q4KM)なら激安のRTX3060の2枚刺し(合計VRAM24GB)で十分動く。オーケストレーションのボスをクラウドモデル、qwenをワーカーにしとけばトークンが節約できる。
“NVIDIAは16GB(10万円)が自分の限界で、その上の24GB~32GB(30万〜90万円)には手が出ない。長文チャットにおいて、vLLM(AWQ)とOllama(GGUF)ではメモリの使い方が根本的に異なる。”
精度という意味でそんなに良いモデルではないように思うんだけど、どうなんだろう。実測ではQwen3.6-35B-A3Bより遅くて精度は同等くらいにしかなっていない。3.8の35B-A3Bは出なさそう。正直見切り付けてるけど何か悔しい。
技術力無い私はUnslothDesktopに ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF:IQ2_S ってモデルを繋いでOpenCodeで動かしてる、48tok/sぐらい出るけどvisionモデルがVRAMに入らない。あとはFreeTokenで35BMoEも良く使う
外に出したくないとかじゃない限り、OpenAIとかに課金した方が良いよなって気になってきてる
FreeTokenではなかった\(^o^)/メインメモリ64くらい+12,16GBグラボ+FreeTokenの例が欲しいよねぇ……自分でやれか
“「Ollama(llama.cpp)がロード前に行うVRAM見積もりが、実際に安全に使える余地よりもかなり保守的だった」”
今のローカルLLMだと3060の2枚がコスパ良いが、5年も前の中古エントリーグラボ1枚に当時の新品価格よりやや高い5万円出すの納得いかない。
RTX 5060 Ti 16GB+Qwen3.8 27Bを検証。Ollamaで116K・全66層をGPU固定すると3.71→約30トークン/秒、約8倍高速化。
ローカルLLMやっていると1にメモリ2にメモリ。メモリメモリメモリ。VRAMもメインメモリもとにかく容量が足りないってなるのでGPUやメモリが高騰する理由がよくわかる。