催眠術
「練馬」の例えが面白すぎる。LLMをファインチューニングするよりこういう内部の介入アプローチの方が本質に迫ってる感あるな
前半部分、word2vecが話題になってた頃のあれこれを思い出す
Anthropicはこういうの弾く方面に動いてるしGoogleもGeminiに思考乗っ取りシスプロ仕込んだgem使いをbanしまくってるからなあ
関西弁というか猛虎弁やないか
クチュクチュってやつだ!!!!!!!!
操舵ベクトルは推論時に活性を動かす介入、MLPの書き換えは重みを恒久編集する介入で層が別。前者はその場の挙動、後者は知識自体を差し替える
仕事でローカルAIを調整する時に役立ちそうな技術になりそう。
座標系として単純化すると、2つの点の差が分かればほかの点もまとめて同じ量をズラしたり、ピンポイントで入れ替えたりできるってことか
thinkさせたらどこかで矛盾生じたときにどう反応するんだろう
もしかして何J語を「フランクな関西弁」だと思ってる?/ちょうど昨日オープンウェイトモデルに内包するガードレールについてその強化策と回避策をAI相手に壁打ちしてたのでタイムリな話題
草ァはなんJ語すぎて、素直な関西弁・丁寧な関西弁データがネット上に少ないということか / JBの参考になる
LLM の「脳内」をハッキングする技術 - ジョイジョイジョイ
催眠術
「練馬」の例えが面白すぎる。LLMをファインチューニングするよりこういう内部の介入アプローチの方が本質に迫ってる感あるな
前半部分、word2vecが話題になってた頃のあれこれを思い出す
Anthropicはこういうの弾く方面に動いてるしGoogleもGeminiに思考乗っ取りシスプロ仕込んだgem使いをbanしまくってるからなあ
関西弁というか猛虎弁やないか
クチュクチュってやつだ!!!!!!!!
操舵ベクトルは推論時に活性を動かす介入、MLPの書き換えは重みを恒久編集する介入で層が別。前者はその場の挙動、後者は知識自体を差し替える
仕事でローカルAIを調整する時に役立ちそうな技術になりそう。
座標系として単純化すると、2つの点の差が分かればほかの点もまとめて同じ量をズラしたり、ピンポイントで入れ替えたりできるってことか
thinkさせたらどこかで矛盾生じたときにどう反応するんだろう
もしかして何J語を「フランクな関西弁」だと思ってる?/ちょうど昨日オープンウェイトモデルに内包するガードレールについてその強化策と回避策をAI相手に壁打ちしてたのでタイムリな話題
草ァはなんJ語すぎて、素直な関西弁・丁寧な関西弁データがネット上に少ないということか / JBの参考になる