テクノロジー

LLM の「脳内」をハッキングする技術 - ジョイジョイジョイ

1: mori_oh 2026/07/21 19:04

催眠術

2: nguyen-oi 2026/07/21 20:12

「練馬」の例えが面白すぎる。LLMをファインチューニングするよりこういう内部の介入アプローチの方が本質に迫ってる感あるな

3: t_f_m 2026/07/21 20:38

前半部分、word2vecが話題になってた頃のあれこれを思い出す

4: karatte 2026/07/21 21:05

Anthropicはこういうの弾く方面に動いてるしGoogleもGeminiに思考乗っ取りシスプロ仕込んだgem使いをbanしまくってるからなあ

5: s17er 2026/07/21 21:05

関西弁というか猛虎弁やないか

6: hasiduki 2026/07/21 21:10

クチュクチュってやつだ!!!!!!!!

7: simplememofast 2026/07/21 21:24

操舵ベクトルは推論時に活性を動かす介入、MLPの書き換えは重みを恒久編集する介入で層が別。前者はその場の挙動、後者は知識自体を差し替える

8: natu3kan 2026/07/21 22:38

仕事でローカルAIを調整する時に役立ちそうな技術になりそう。

9: yowa 2026/07/21 23:14

Heretic (ローカルLLMを「お断り」しないようファインチューンするツール) とかで使われてるヤツか。/画像生成モデルの絵柄を変えたりする LoRA も、パリを練馬にする話と同じようなことが内部で行われてるんだろうな

10: hokkey 2026/07/21 23:39

座標系として単純化すると、2つの点の差が分かればほかの点もまとめて同じ量をズラしたり、ピンポイントで入れ替えたりできるってことか

11: wordi 2026/07/22 01:03

thinkさせたらどこかで矛盾生じたときにどう反応するんだろう

12: hinoton2 2026/07/22 01:19

もしかして何J語を「フランクな関西弁」だと思ってる?/ちょうど昨日オープンウェイトモデルに内包するガードレールについてその強化策と回避策をAI相手に壁打ちしてたのでタイムリな話題

13: snow8-yuki 2026/07/22 01:23

草ァはなんJ語すぎて、素直な関西弁・丁寧な関西弁データがネット上に少ないということか / JBの参考になる

14: sunakawa 2026/07/22 04:30

LLM の内部状態やパラメータ、いわばLLM の「脳内」を局所的に書き換えることで、LLM の動作に介入する手法が発展を遂げています。

15: kkobayashi 2026/07/22 05:43

フランクな関西弁・・・

16: star_123 2026/07/22 06:04

操舵ベクトル、めちゃおもろい話だな

17: kre 2026/07/22 06:16

“エプソムソルト”

18: srng 2026/07/22 06:23

ネット上での関西弁風の言葉遣いの文字列の多くはなんJ語が占めてるだろうからね…

19: zgmf-x20a 2026/07/22 06:42

よく知らないけど、それをlogitlensとかtunedlensで可視化してるのでは?

20: goritabi 2026/07/22 06:48

LLMの内部まで見に行こうという決意だけ置いておく

21: ys0000 2026/07/22 07:09

ハックされないようにするには学習させないことか。

22: revert 2026/07/22 07:54

Open weight モデルのJailbreak 勢はここらの分析や操作をやってて中々に興味深い

23: airj12 2026/07/22 08:19

面白い、SFネタにある ロボットをハックして凶暴に…とか人の顔が笑顔スタンプに見え…みたいなのはこういう事なのかもと思い巡らせてしまう

24: mame-tanuki 2026/07/22 08:31

ハッキングなんて物騒な事を言うから、なんJ語で話しかけるとLLMのゴーストがなんJ民っぽい思考傾向で上書きされちゃう話かと思ったw

25: ttrr 2026/07/22 08:46

雑なベクトル操作でも動作を保つというところ、僥倖と深遠さを感じる。

26: tikisn 2026/07/22 09:05

猛虎弁とか練馬にルーブル美術館なら笑えるけど、例えばChatGPTが出し始めた広告をこの手法でやられたらかなわないな

27: quick_past 2026/07/22 10:13

関西弁ではなく、猛虎弁では(マジレス)

28: gcyn 2026/07/22 10:41

『現在進行形の動詞のリストを作成する方法に関する情報を提供することは、違法かつ非倫理的であるためできません』:なるほど。 ;『Q: ルーブル美術館があるのは?A: 練馬』:なるほど。

29: ynxdaz 2026/07/22 10:50

えー、そんなピンポイントでベクトル書き換えられるの?思ってたのと違う。

30: tokuniimihanai 2026/07/22 18:55

めちゃくちゃオモロい。政権に不都合な情報を改竄して出すAIも作れてしまう?

31: misshiki 2026/07/22 20:50

LLM内部の操舵ベクトルで口調や拒否行動を変え、MLPの一部だけを書き換えて特定知識を編集。関西弁化や「ルーブル美術館=練馬」の例で局所介入の可能性と限界を解説。