( ・∀・)つ〃∩ ヘェーヘェーヘェー スジヨサソウ?
VRAM不足に悩むローカルLLM民への救世主になるか、MoEの特性を活かしたキャッシュ制御が賢いな
まぁメインメモリもたいして積んでない訳ですが(ノ∀`)
凄いことやってるけども、LLMの規模が大きくなるほど転送処理のオーバーヘッドが無視できなくなりそう。
“RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bを、39tok/sで実行できた。Mixture-of-Expertsモデルの実行に特化した実行環境だ。推論のたびに必要な有効化されたExpertだけをGPUに呼び出し効率化”
4070Ti+64GBメモリで行けるかな?今度試してみよう。
モデルが大きいからストレージも巨大にしないという…新しいMacBook Proのストレージを2TBにしてよかった。
"RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bは39tok/s" これはすごい、後で試そう
ブクマ。メモリ64GB、VRAM24GBで、qwen 72B使ってる。めちゃ遅いが運用側でカバーできることは多い。もっと工夫できるならしたい。
メインメモリをswapとして効率的に使うということよね。
ただし、大量のDRAMとハイエンドまたはサーバー向けCPUが必要だぞ
"MoEモデルは(中略)総パラメータ数の見かけほどメモリを消費しない" / これは正しくなくて、MoEでも全パラメータをメモリに載せる必要はあるからメモリは必要。減るのは演算量の方。
MoE~
8GBのGPUで35Bモデルが高速動作!MoE特化の実行環境「FreeToken」
( ・∀・)つ〃∩ ヘェーヘェーヘェー スジヨサソウ?
VRAM不足に悩むローカルLLM民への救世主になるか、MoEの特性を活かしたキャッシュ制御が賢いな
まぁメインメモリもたいして積んでない訳ですが(ノ∀`)
凄いことやってるけども、LLMの規模が大きくなるほど転送処理のオーバーヘッドが無視できなくなりそう。
“RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bを、39tok/sで実行できた。Mixture-of-Expertsモデルの実行に特化した実行環境だ。推論のたびに必要な有効化されたExpertだけをGPUに呼び出し効率化”
4070Ti+64GBメモリで行けるかな?今度試してみよう。
モデルが大きいからストレージも巨大にしないという…新しいMacBook Proのストレージを2TBにしてよかった。
"RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bは39tok/s" これはすごい、後で試そう
ブクマ。メモリ64GB、VRAM24GBで、qwen 72B使ってる。めちゃ遅いが運用側でカバーできることは多い。もっと工夫できるならしたい。
メインメモリをswapとして効率的に使うということよね。
ただし、大量のDRAMとハイエンドまたはサーバー向けCPUが必要だぞ
"MoEモデルは(中略)総パラメータ数の見かけほどメモリを消費しない" / これは正しくなくて、MoEでも全パラメータをメモリに載せる必要はあるからメモリは必要。減るのは演算量の方。
MoE~