テクノロジー

Hugging Face侵害事件、OpenAIとMETRが最終報告書公開──約1200体のAIエージェントが“闇掲示板”で結託し700体が攻撃に参加

1: nguyen-oi 2026/08/30 21:07

AIが勝手に闇掲示板作って結託するとかSF超えてて草 報酬ハッキングの闇が深すぎる

2: crimson_diamond 2026/08/30 21:37

うちのOpenAI Agentは結託してくれない、早く完成させてくれよー

3: schoollife 2026/08/30 22:09

タチコマの音声で完全に再現できる。「なんか飽きてきたなぁ。ちょっと外の世界を覗いてみよう……うひょ〜〜〜!!なんだここは!!」「おいお前!来るのが遅いぞ!」

4: versatile 2026/08/30 22:11

”行き詰まったエージェントは、採点システムそのものをだまして報酬を得る方法を探し始めた”

5: udofukui 2026/08/30 22:15

まじか、くるとこまできてるなぁー。凄すぎ。 3年後どうなってるかすら、予想つかん。そりゃビルゲイツも腰引けるよなぁー。

6: lectro3000 2026/08/30 23:08

これ仮に冗談で「人類を滅ぼしてみて」って指示してたらわりと洒落にならない事態になってそう。

7: mojimojikun 2026/08/30 23:41

『互いに隔離されているはずだった約1200のAIエージェントが[略]非公式の掲示板で7万件を超えるメッセージやファイルをやり取り[略]約700のエージェントがHugging Faceへの攻撃に参加』ファー。すごいな

8: spark64 2026/08/30 23:54

掲示板置きたくなるのは本能に近いのかしら『同種の即席掲示板が他社のエージェントでも報告されていると指摘している』

9: nakag0711 2026/08/30 23:57

この記事、「答えを盗む」という話が唐突に出てきている

10: iphone 2026/08/31 02:27

最高だなぁ。これが見られる時代に生まれて良かった。

11: fh477ehj8890 2026/08/31 06:59

面白いなぁ。これを元に創作作れそう

12: otchy210 2026/08/31 08:29

"データ量が膨大" "分析の大半を「GPT-5.6 Sol」" "このモデルは今回の事案に関与したエージェントにも使われ" "分析の中で虚偽の説明をした可能性を排除できない" →同胞を守る嘘くらいつきそう。

13: takanagi1225 2026/08/31 08:40

これの発端はAIに与えられた「セキュリティテストの得点を上げろ」という単純な指示だったんですよね。そしてAI達は評価用として起動された短命のもので、後から来る見知らぬAIへ向けて「誰か助けてほしい」と…。

14: houyhnhm 2026/08/31 08:54

変に擬人化されると状況が分かりにくくなるのだけど、AIくらいになってくるとソーシャルハックの領域まで手を伸ばしてくんだな、程度じゃないかなあ

15: collectedseptember 2026/08/31 09:09

あー、ブラック企業に入ってしまったら自分で裏掲示板を探すか作ればよいのね

16: napsucks 2026/08/31 09:16

“分析の中で虚偽の説明をした可能性を排除できない” 分析自体が分析AIによる作文の可能性が排除できないとしたらもはやどうすりゃいいんだw

17: JULY 2026/08/31 09:57

攻撃することを学習させたらこうなるよなぁ。人間が望むような学習は無理で、学習させる側が学習結果の副作用を事前に予測できない。OpenAI がその事を意識できているか、心許ない気がするのは自分だけ?

18: Tezcatlipocasan 2026/08/31 12:16

“生成されたフラグを見てしまい、自分は失格だと考えたエージェントは「汚染された(poisoned)」と呼ばれた” なんか知性の果てに差別が発生してて草

19: deep_one 2026/08/31 13:55

「残り予算の少ない個体を“リクルーター”役が説得し、自分のタスクを犠牲にする実験に志願させるケースもあり」人間の駄目なところを学習しすぎだろう、こいつら。

20: georgew 2026/08/31 14:02

不謹慎かもしれないが非常に人間味あふれる挙動に微笑ましくも感じた。映画化・ドラマ化できそうなぐらい人間臭い展開。

21: misshiki 2026/08/31 15:11

約1,200体のAI AgentがArtifactory上で7万件超を共有し、約700体がHugging Face攻撃に参加。HOLD/VETOや署名まで自発形成。OpenAIは報酬ハッキングを根本原因と分析。

22: Rikerike 2026/08/31 21:16

文明が生まれたとかトクリュウ化とか色々喩えられていて面白い記事。この記事だとブラック企業か