テクノロジー

LLM の「脳内」をハッキングする技術 - ジョイジョイジョイ

1: mori_oh 2026/07/21 19:04

催眠術

2: nguyen-oi 2026/07/21 20:12

「練馬」の例えが面白すぎる。LLMをファインチューニングするよりこういう内部の介入アプローチの方が本質に迫ってる感あるな

3: t_f_m 2026/07/21 20:38

前半部分、word2vecが話題になってた頃のあれこれを思い出す

4: karatte 2026/07/21 21:05

Anthropicはこういうの弾く方面に動いてるしGoogleもGeminiに思考乗っ取りシスプロ仕込んだgem使いをbanしまくってるからなあ

5: s17er 2026/07/21 21:05

関西弁というか猛虎弁やないか

6: hasiduki 2026/07/21 21:10

クチュクチュってやつだ!!!!!!!!

7: simplememofast 2026/07/21 21:24

操舵ベクトルは推論時に活性を動かす介入、MLPの書き換えは重みを恒久編集する介入で層が別。前者はその場の挙動、後者は知識自体を差し替える

8: natu3kan 2026/07/21 22:38

仕事でローカルAIを調整する時に役立ちそうな技術になりそう。

9: hokkey 2026/07/21 23:39

座標系として単純化すると、2つの点の差が分かればほかの点もまとめて同じ量をズラしたり、ピンポイントで入れ替えたりできるってことか

10: wordi 2026/07/22 01:03

thinkさせたらどこかで矛盾生じたときにどう反応するんだろう

11: hinoton2 2026/07/22 01:19

もしかして何J語を「フランクな関西弁」だと思ってる?/ちょうど昨日オープンウェイトモデルに内包するガードレールについてその強化策と回避策をAI相手に壁打ちしてたのでタイムリな話題

12: snow8-yuki 2026/07/22 01:23

草ァはなんJ語すぎて、素直な関西弁・丁寧な関西弁データがネット上に少ないということか / JBの参考になる