参考になるなぁ
ざるやな
LLMがロール識別を文章スタイルに頼ってるから思考プロンプト偽装で脱獄できるってヤバいな 根本的欠陥って指摘も納得だわ
APIでアシスタント側のメッセージも流し込める構造になってるからしょうがないよね。『自分自身のメッセージも疑う』という学習をさせたらかなり性能落ちそう。
出力されるCoTに署名すれば防御可能に見えるが、そういう話ではない?
ちなみに27Bぐらいの検閲解除LLMに悪いことを聞いても知識がなく物理的に答えれない。サリンの作り方を聞いたらサンマの焼き方を答えてきたw
無料部分しか読んでないけども。過去のメッセージを偽装したらモデルそのもの(API)レベルでは難しいよね。アプリにした際にはユーザーからの挿入を受け付けない方法もあるだろう。出力ガードレールは実装可能だが。
反射的に答える何でも答える脳と同じ役割を持つのだからLLM単体での防御が不可能なのは仕方ない。2段階目で考えてブロックできるかでは。ただコストが上がる。
「思考の連鎖」偽装でLLMを騙す新手法、訓練では防げない構造的欠陥
参考になるなぁ
ざるやな
LLMがロール識別を文章スタイルに頼ってるから思考プロンプト偽装で脱獄できるってヤバいな 根本的欠陥って指摘も納得だわ
APIでアシスタント側のメッセージも流し込める構造になってるからしょうがないよね。『自分自身のメッセージも疑う』という学習をさせたらかなり性能落ちそう。
出力されるCoTに署名すれば防御可能に見えるが、そういう話ではない?
ちなみに27Bぐらいの検閲解除LLMに悪いことを聞いても知識がなく物理的に答えれない。サリンの作り方を聞いたらサンマの焼き方を答えてきたw
無料部分しか読んでないけども。過去のメッセージを偽装したらモデルそのもの(API)レベルでは難しいよね。アプリにした際にはユーザーからの挿入を受け付けない方法もあるだろう。出力ガードレールは実装可能だが。
反射的に答える何でも答える脳と同じ役割を持つのだからLLM単体での防御が不可能なのは仕方ない。2段階目で考えてブロックできるかでは。ただコストが上がる。