テクノロジー

DeepSeek v4.1 Flashを動かしたくてFP4に対応していないA100を、33tok/sから673 tok/sまで持っていって気がつくと公式APIより速くなっていた話|shi3z

1: mkusaka 2026/09/12 08:45

DeepSeek v4.1 FlashをFP4非対応A100で最適化し、33tok/s→673 tok/s、公式API超えに到達した記録とソース公開

2: endo_5501 2026/09/12 11:03

“実際、Claude Codeは早々に「これが限界です」とか舐めたことを抜かす。ついこないだ生まれたようなガキが。知ったふうな口を聞くな。”

3: nguyen-oi 2026/09/12 12:42

旧世代GPUを執念で叩き起こすプロファイル芸、やっぱ最後は職人の勘と泥臭さだな

4: en-en-ra 2026/09/12 12:43

AIに電力とか計算資源ジャブジャブ注ぎ込まれてるけど、やっぱ相当無駄遣いしてそうだなー

5: naozane2 2026/09/12 13:15

ドリキンと競争してるのかw。4000万円の設備を持つ男。/最適化したlmstudioみたいなのは自分で(claudeで)作れるという学び。

6: agricola 2026/09/12 13:17

NVLinkブリッジで2枚ずつペアにするとどうなるかを知りたいところ。

7: mojimojikun 2026/09/12 13:21

( ・∀・)つ〃∩ ヘェーヘェーヘェー オモシローイ 結局『計測して、遅い場所を見つけて、その前提自体を壊す。結局これの繰り返しだった。つまりコンピュータ・サイエンスの基本中の基本だ』になってて頷いている

8: naka_dekoboko 2026/09/12 13:22

v4.1 Flash、逃がせる設計にしたうえで性能あげてくるし、たんに蒸留屋とかじゃないんだよなもう完全に先端にいる。

9: fashi 2026/09/12 14:06

「4bit×4bitの積なんて256通りしかない」「GPUに送るくらいならCPUで計算した方が速い」「買った方が安くない?」

10: ssfu 2026/09/12 14:29

ちょっと何言ってるかわかんない。

11: zgmf-x20a 2026/09/12 14:37

記録更新中…

12: rgfx 2026/09/12 14:47

ぐえーかっこいいいいいい(滋味がある)(ありがとうございます)/でもこの手のチューニング、向こうで北京大や精華大を出てるようなキレッキレのがやってないわけがないと思うんだけどなあ

13: MuffinBobbin 2026/09/12 15:17

“継之助には、なんだかんだで4000万円くらいかかっている。” 今はどうなのか知らんが、少し前なら家が建つ金額だな。

14: daruism 2026/09/12 15:30

“Claude Codeのコーディングが雑なせいだ。 あいつらは、「バグらない/バグりにくいコード」は量産できるようになったが、「効率的なコード」を量産できるようにまでは進化してない。なにがシンギュラリティだ。”強い

15: kazu111 2026/09/12 15:44

①『クロードAIの脳みそ(ビグザム)』を②AI蒸留でパクリ256個の分業部屋で動かす『中華ディープシーク(中華ガンダム)』に、③論文と役割分担を活用した職人芸『個人AI(民間超性能ザク·ニュータイプ対応機)』が勝

16: mopx 2026/09/12 15:45

スクラップアンドビルドはAIの報酬にないから、作っといて、いやーなんか違うんだよなーとは言わなそう。

17: teslur 2026/09/12 15:45

これがAI時代を生き残れるタイプのSWEか…

18: taruhachi 2026/09/12 16:01

VRAMはさほど使わない(290GBくらい)。。。。。。。。。。。

19: tadyjp 2026/09/12 16:02

これがISUCONか。。それにこのAIには出来ない書き味、いいね

20: puruhime 2026/09/12 16:21

この人の環境を用意できないので本文を読むのは早々に諦めた

21: moke222 2026/09/12 16:25

驚き屋さんがんばれ

22: kurage_lizard 2026/09/12 17:00

おれもClaude Codeにガキは黙ってろ!って言えるくらい理解したい。むしろ、えーそんなこともやってくれたのー?ありがとー!ってなってる。

23: hhungry 2026/09/12 17:07

一口にClaude CodeゆーてもオーパスかFableかで話が変わってくる。

24: fnm 2026/09/12 17:17

実際、Claude Codeは早々に「これが限界です」とか舐めたことを抜かす。ついこないだ生まれたようなガキが。知ったふうな口を聞くな。→つよい

25: natu3kan 2026/09/12 17:35

ハードが旧世代になって非対応の部分をソフトで対応させたら動くって、ロマンあるし性能も良かったら満足感が高いよなあ。

26: kotesaki 2026/09/12 17:54

普段、与太オヤジだと思ってるshi3zさんが覚醒するとこういう動きするんだ〜。さすがーとオモタヨ。フロンティアとしてのクラウドモデル優位は当面続くだろうけど「AI所有できる」Local LLMは夢があるよねー。

27: stealthinu 2026/09/12 18:24

たしかにFP4だと256パターンだし古いGPUでも最適化できるか。意味ないと思ってたが手持ちハードに合わせた専用推論機にカスタマイズするのよいな。

28: strawberryhunter 2026/09/12 18:27

この人をこんなにカッコいいと思ったのは初めてだ。llama.cppとかはOSSだけど、open weight以外のこういう実行環境も各社は基本的に公開していない。きっと、こういう職人芸の塊だと思う。

29: napsucks 2026/09/12 18:51

AIの表層的な答えを受け取らず、蹴りを入れるのは大事ね。ESP32の最適化でもこの辺りの違いが出てくる。なお、codex/GPT5.6 solは32bit専用RTC slow memoryに16ビットを2つパックするなど最適化提案を結構やってくれる。

30: oosin 2026/09/12 19:04

自分がコーディングに使ってる経験だと、ライブラリなければこういう実装でどう?と提案してくる(結果がどうあれ)ので別世界の人かな?と思った。 真実は不明だがAIを調教してる風なのは相当脚色されてる気がする。

31: cmieji 2026/09/12 19:22

最適化

32: hayeta 2026/09/12 19:48

「ここで大切なのは直感である。 「そんなわけあるか」と思えるかどうか。 AIの言う寝言を鵜呑みにしていたら、この先には進めない。」

33: mcddx30 2026/09/12 21:09
34: samasan-tabasan 2026/09/12 22:53

読みごたえがあるなぁw

35: toaruR 2026/09/13 11:05

活き活きしてる\(^o^)/中古のA100を買い漁る、まで行って欲しい