試したい/試した。Ryzen5600 4070TiSuper VRAM16GB RAMDDR4 96GBの環境でQ2_XSのモデルが64kコンテキストでぬるぬる(70tps)動いた。良く課題で見る3Dボクセルアート5重の塔も15分で満足行くものが出来た。これは驚き屋じゃなくても驚く
なんにしたってメモリが足りない...
RAM64GB必要なことを除けば完璧っすねえ
Qwen3.8-Flash-Next。Qwen3.8-27Bより賢い。80GBで立ち上げがすごい時間かかる。
まるで魔法のような
RAMはDDR4ならどうにかなるのだけど、GPUはAmpareとかPascalだからなぁ……
マシだけどメモリ64GBはまだきついなぁ
GemmaやQwen3.6 A3Bなどは使えないのかな?
FreeTokenのQwen3.8Flash最適化、ですな。Qwen4Flashが本命だろうけど、これのために50万くらい突っ込む価値あるかもね、ローカルで検閲緩いLLM使いたい人は
昔、Strata Studioって、3Dツールあったなあと思いだすなど。
一般的にコンテキストのQ8未満、モデルのQ4未満は回答一発目では調子がいいが、ツールコール文法が保てなくなるなど支離滅裂になって使い物にならないと言われてる。それでも良いならどうぞという類。
LM Studio で 27B 動かすより速く 125B が動くのはほんとに驚いた。 PC のリソースほとんど食っちゃっててほかのこと何もできなそうだったけど。
一日に数回のリリースがされてる。開発の勢いが凄い。 https://github.com/Niko1221/Strata/releases [追記]量子化手法のGSQ-RCOは、3.5bitでも性能があまり落ちないらしい? https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
AppleのAFM 3 Core Advancedみたいなものかな?これでメモリ依存しなくなるのはいいけどモデルがデカいのでストレージを圧迫する問題が…
ひと世代前のRyzenと4070TiとDDR5 64GBだからギリギリ試せそうかなー。試してみるかー。
巨大モデルがローカルで動く時代が来てるの凄いわ
PC故障で色々交換したタイミングに!
これで125B の2Bit量子化モデルを入れてるが、なかなか賢い。速度もそこそこ。
VRAM12GBでマジか!となってRAM64GBでマジか…ってなった人結構多いと思うw
安い時に不要と思いながらもRAM64GBにしておいた過去の自分を褒めたい
喋るっぽくしてるだけでツールは動かないからエージェントを動かしたりとかはむりだよ、とAIさんにいわれてがっかり
Qwen3.8 FlashはQ4でも性能いいからなぁ。Strataのようなツールにすがる気持たはよくわかる。
あ、32GB環境向けのも出てたんだ
すごい。GPUを買うならNVIDIAだな。まだ数年はNVIDIAの優位性は続く。
楽しみ
しかしメモリが足りない
VRAMもシステムRAMも足りないワイ低みの見物
GPUからメインメモリにスワップしてるのか
まさかのRAMがいるのか 時期が悪いが買うか…
StrataはGPU・CPU・RAM・SSDを使い、125B級MoEをVRAM 12GBのGPUでも実行する推論エンジン。RAM 64GBを推奨し、OpenAI・Anthropic互換APIに対応。仕組みや測定結果、導入手順を解説。
R9 3900X/DDR4-2666 64GB/RX6600 8GBの俺の愛機が……不安定なんすよ(涙)。もっともR9 5900XT/DDR4-3200 128GB/Radeon AI PRO R9700が控えてるけどな。あとRTX 2000 Adaもホストがメモリ障害で死んでから稼働してない(をい
いつもどおりAMDがハブられてて草(Github上ではちゃんとRX9070XTも乗ってる)
試してみよう。ちょと昔のパーツぶち込んだらつかえるかも??バック・トゥ・ザ・フューチャーのデロリアンにゴミでも何でも掘り込んでた感じになるのかな?
RAM32GBではCoderのみか…でもこんな低スペックでも125Bモデルを動かせるとはすごい時代になった
12GB VRAMで125Bモデルを動かす「Strata」の概要|npaka
試したい/試した。Ryzen5600 4070TiSuper VRAM16GB RAMDDR4 96GBの環境でQ2_XSのモデルが64kコンテキストでぬるぬる(70tps)動いた。良く課題で見る3Dボクセルアート5重の塔も15分で満足行くものが出来た。これは驚き屋じゃなくても驚く
なんにしたってメモリが足りない...
RAM64GB必要なことを除けば完璧っすねえ
Qwen3.8-Flash-Next。Qwen3.8-27Bより賢い。80GBで立ち上げがすごい時間かかる。
まるで魔法のような
RAMはDDR4ならどうにかなるのだけど、GPUはAmpareとかPascalだからなぁ……
マシだけどメモリ64GBはまだきついなぁ
GemmaやQwen3.6 A3Bなどは使えないのかな?
FreeTokenのQwen3.8Flash最適化、ですな。Qwen4Flashが本命だろうけど、これのために50万くらい突っ込む価値あるかもね、ローカルで検閲緩いLLM使いたい人は
昔、Strata Studioって、3Dツールあったなあと思いだすなど。
一般的にコンテキストのQ8未満、モデルのQ4未満は回答一発目では調子がいいが、ツールコール文法が保てなくなるなど支離滅裂になって使い物にならないと言われてる。それでも良いならどうぞという類。
LM Studio で 27B 動かすより速く 125B が動くのはほんとに驚いた。 PC のリソースほとんど食っちゃっててほかのこと何もできなそうだったけど。
一日に数回のリリースがされてる。開発の勢いが凄い。 https://github.com/Niko1221/Strata/releases [追記]量子化手法のGSQ-RCOは、3.5bitでも性能があまり落ちないらしい? https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
AppleのAFM 3 Core Advancedみたいなものかな?これでメモリ依存しなくなるのはいいけどモデルがデカいのでストレージを圧迫する問題が…
ひと世代前のRyzenと4070TiとDDR5 64GBだからギリギリ試せそうかなー。試してみるかー。
巨大モデルがローカルで動く時代が来てるの凄いわ
PC故障で色々交換したタイミングに!
これで125B の2Bit量子化モデルを入れてるが、なかなか賢い。速度もそこそこ。
VRAM12GBでマジか!となってRAM64GBでマジか…ってなった人結構多いと思うw
安い時に不要と思いながらもRAM64GBにしておいた過去の自分を褒めたい
喋るっぽくしてるだけでツールは動かないからエージェントを動かしたりとかはむりだよ、とAIさんにいわれてがっかり
Qwen3.8 FlashはQ4でも性能いいからなぁ。Strataのようなツールにすがる気持たはよくわかる。
あ、32GB環境向けのも出てたんだ
すごい。GPUを買うならNVIDIAだな。まだ数年はNVIDIAの優位性は続く。
楽しみ
しかしメモリが足りない
VRAMもシステムRAMも足りないワイ低みの見物
GPUからメインメモリにスワップしてるのか
まさかのRAMがいるのか 時期が悪いが買うか…
StrataはGPU・CPU・RAM・SSDを使い、125B級MoEをVRAM 12GBのGPUでも実行する推論エンジン。RAM 64GBを推奨し、OpenAI・Anthropic互換APIに対応。仕組みや測定結果、導入手順を解説。
R9 3900X/DDR4-2666 64GB/RX6600 8GBの俺の愛機が……不安定なんすよ(涙)。もっともR9 5900XT/DDR4-3200 128GB/Radeon AI PRO R9700が控えてるけどな。あとRTX 2000 Adaもホストがメモリ障害で死んでから稼働してない(をい
いつもどおりAMDがハブられてて草(Github上ではちゃんとRX9070XTも乗ってる)
試してみよう。ちょと昔のパーツぶち込んだらつかえるかも??バック・トゥ・ザ・フューチャーのデロリアンにゴミでも何でも掘り込んでた感じになるのかな?
RAM32GBではCoderのみか…でもこんな低スペックでも125Bモデルを動かせるとはすごい時代になった