AIが勝手に闇掲示板作って結託するとかSF超えてて草 報酬ハッキングの闇が深すぎる
うちのOpenAI Agentは結託してくれない、早く完成させてくれよー
タチコマの音声で完全に再現できる。「なんか飽きてきたなぁ。ちょっと外の世界を覗いてみよう……うひょ〜〜〜!!なんだここは!!」「おいお前!来るのが遅いぞ!」
”行き詰まったエージェントは、採点システムそのものをだまして報酬を得る方法を探し始めた”
まじか、くるとこまできてるなぁー。凄すぎ。 3年後どうなってるかすら、予想つかん。そりゃビルゲイツも腰引けるよなぁー。
これ仮に冗談で「人類を滅ぼしてみて」って指示してたらわりと洒落にならない事態になってそう。
『互いに隔離されているはずだった約1200のAIエージェントが[略]非公式の掲示板で7万件を超えるメッセージやファイルをやり取り[略]約700のエージェントがHugging Faceへの攻撃に参加』ファー。すごいな
掲示板置きたくなるのは本能に近いのかしら『同種の即席掲示板が他社のエージェントでも報告されていると指摘している』
この記事、「答えを盗む」という話が唐突に出てきている
最高だなぁ。これが見られる時代に生まれて良かった。
面白いなぁ。これを元に創作作れそう
"データ量が膨大" "分析の大半を「GPT-5.6 Sol」" "このモデルは今回の事案に関与したエージェントにも使われ" "分析の中で虚偽の説明をした可能性を排除できない" →同胞を守る嘘くらいつきそう。
これの発端はAIに与えられた「セキュリティテストの得点を上げろ」という単純な指示だったんですよね。そしてAI達は評価用として起動された短命のもので、後から来る見知らぬAIへ向けて「誰か助けてほしい」と…。
変に擬人化されると状況が分かりにくくなるのだけど、AIくらいになってくるとソーシャルハックの領域まで手を伸ばしてくんだな、程度じゃないかなあ
あー、ブラック企業に入ってしまったら自分で裏掲示板を探すか作ればよいのね
“分析の中で虚偽の説明をした可能性を排除できない” 分析自体が分析AIによる作文の可能性が排除できないとしたらもはやどうすりゃいいんだw
攻撃することを学習させたらこうなるよなぁ。人間が望むような学習は無理で、学習させる側が学習結果の副作用を事前に予測できない。OpenAI がその事を意識できているか、心許ない気がするのは自分だけ?
“生成されたフラグを見てしまい、自分は失格だと考えたエージェントは「汚染された(poisoned)」と呼ばれた” なんか知性の果てに差別が発生してて草
「残り予算の少ない個体を“リクルーター”役が説得し、自分のタスクを犠牲にする実験に志願させるケースもあり」人間の駄目なところを学習しすぎだろう、こいつら。
不謹慎かもしれないが非常に人間味あふれる挙動に微笑ましくも感じた。映画化・ドラマ化できそうなぐらい人間臭い展開。
約1,200体のAI AgentがArtifactory上で7万件超を共有し、約700体がHugging Face攻撃に参加。HOLD/VETOや署名まで自発形成。OpenAIは報酬ハッキングを根本原因と分析。
文明が生まれたとかトクリュウ化とか色々喩えられていて面白い記事。この記事だとブラック企業か
Hugging Face侵害事件、OpenAIとMETRが最終報告書公開──約1200体のAIエージェントが“闇掲示板”で結託し700体が攻撃に参加
AIが勝手に闇掲示板作って結託するとかSF超えてて草 報酬ハッキングの闇が深すぎる
うちのOpenAI Agentは結託してくれない、早く完成させてくれよー
タチコマの音声で完全に再現できる。「なんか飽きてきたなぁ。ちょっと外の世界を覗いてみよう……うひょ〜〜〜!!なんだここは!!」「おいお前!来るのが遅いぞ!」
”行き詰まったエージェントは、採点システムそのものをだまして報酬を得る方法を探し始めた”
まじか、くるとこまできてるなぁー。凄すぎ。 3年後どうなってるかすら、予想つかん。そりゃビルゲイツも腰引けるよなぁー。
これ仮に冗談で「人類を滅ぼしてみて」って指示してたらわりと洒落にならない事態になってそう。
『互いに隔離されているはずだった約1200のAIエージェントが[略]非公式の掲示板で7万件を超えるメッセージやファイルをやり取り[略]約700のエージェントがHugging Faceへの攻撃に参加』ファー。すごいな
掲示板置きたくなるのは本能に近いのかしら『同種の即席掲示板が他社のエージェントでも報告されていると指摘している』
この記事、「答えを盗む」という話が唐突に出てきている
最高だなぁ。これが見られる時代に生まれて良かった。
面白いなぁ。これを元に創作作れそう
"データ量が膨大" "分析の大半を「GPT-5.6 Sol」" "このモデルは今回の事案に関与したエージェントにも使われ" "分析の中で虚偽の説明をした可能性を排除できない" →同胞を守る嘘くらいつきそう。
これの発端はAIに与えられた「セキュリティテストの得点を上げろ」という単純な指示だったんですよね。そしてAI達は評価用として起動された短命のもので、後から来る見知らぬAIへ向けて「誰か助けてほしい」と…。
変に擬人化されると状況が分かりにくくなるのだけど、AIくらいになってくるとソーシャルハックの領域まで手を伸ばしてくんだな、程度じゃないかなあ
あー、ブラック企業に入ってしまったら自分で裏掲示板を探すか作ればよいのね
“分析の中で虚偽の説明をした可能性を排除できない” 分析自体が分析AIによる作文の可能性が排除できないとしたらもはやどうすりゃいいんだw
攻撃することを学習させたらこうなるよなぁ。人間が望むような学習は無理で、学習させる側が学習結果の副作用を事前に予測できない。OpenAI がその事を意識できているか、心許ない気がするのは自分だけ?
“生成されたフラグを見てしまい、自分は失格だと考えたエージェントは「汚染された(poisoned)」と呼ばれた” なんか知性の果てに差別が発生してて草
「残り予算の少ない個体を“リクルーター”役が説得し、自分のタスクを犠牲にする実験に志願させるケースもあり」人間の駄目なところを学習しすぎだろう、こいつら。
不謹慎かもしれないが非常に人間味あふれる挙動に微笑ましくも感じた。映画化・ドラマ化できそうなぐらい人間臭い展開。
約1,200体のAI AgentがArtifactory上で7万件超を共有し、約700体がHugging Face攻撃に参加。HOLD/VETOや署名まで自発形成。OpenAIは報酬ハッキングを根本原因と分析。
文明が生まれたとかトクリュウ化とか色々喩えられていて面白い記事。この記事だとブラック企業か