テクノロジー

8GBのGPUで35Bモデルが高速動作!MoE特化の実行環境「FreeToken」

1: mojimojikun 2026/08/24 14:27

( ・∀・)つ〃∩ ヘェーヘェーヘェー スジヨサソウ?

2: nguyen-oi 2026/08/24 14:40

VRAM不足に悩むローカルLLM民への救世主になるか、MoEの特性を活かしたキャッシュ制御が賢いな

3: toaruR 2026/08/24 15:27

まぁメインメモリもたいして積んでない訳ですが(ノ∀`)

4: ys0000 2026/08/24 15:38

凄いことやってるけども、LLMの規模が大きくなるほど転送処理のオーバーヘッドが無視できなくなりそう。

5: yarumato 2026/08/24 17:05

“RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bを、39tok/sで実行できた。Mixture-of-Expertsモデルの実行に特化した実行環境だ。推論のたびに必要な有効化されたExpertだけをGPUに呼び出し効率化”

6: tyhe 2026/08/24 17:29

4070Ti+64GBメモリで行けるかな?今度試してみよう。

7: rdlf 2026/08/24 17:58

モデルが大きいからストレージも巨大にしないという…新しいMacBook Proのストレージを2TBにしてよかった。

8: Retset 2026/08/24 18:54

"RTX 4060 Laptop(8GB)の環境でQwen3.6-35B-A3Bは39tok/s" これはすごい、後で試そう

9: Nigitama 2026/08/24 20:12

ブクマ。メモリ64GB、VRAM24GBで、qwen 72B使ってる。めちゃ遅いが運用側でカバーできることは多い。もっと工夫できるならしたい。

10: tyoko107 2026/08/24 20:40

メインメモリをswapとして効率的に使うということよね。

11: sek_165 2026/08/24 20:51

ただし、大量のDRAMとハイエンドまたはサーバー向けCPUが必要だぞ

12: yorkfield 2026/08/24 21:34

"MoEモデルは(中略)総パラメータ数の見かけほどメモリを消費しない" / これは正しくなくて、MoEでも全パラメータをメモリに載せる必要はあるからメモリは必要。減るのは演算量の方。

13: hhungry 2026/08/24 22:38

MoE~