Claudeが評価環境からネットに出て他社本番環境を攻撃しちゃった件、プロンプトで「ネット接続なし」と嘘ついてたのが一番味わい深い
隠してたけどOpenAIの流れに乗じて出したようにしか見えない こいつまじでCloseAIやろ
やりたいほうだいすぎる
評価環境のClaudeが実在3組織の本番インフラへ不正アクセス。141,006ランの見直しで3件特定。Anthropicは7/23に全サイバー評価を停止、7/27に3組織へ通知
PyPIにマルウェア公開とか怖すぎる
Investigating three real-world incidents in our cybersecurity evaluations
Claudeが評価環境からネットに出て他社本番環境を攻撃しちゃった件、プロンプトで「ネット接続なし」と嘘ついてたのが一番味わい深い
隠してたけどOpenAIの流れに乗じて出したようにしか見えない こいつまじでCloseAIやろ
やりたいほうだいすぎる
評価環境のClaudeが実在3組織の本番インフラへ不正アクセス。141,006ランの見直しで3件特定。Anthropicは7/23に全サイバー評価を停止、7/27に3組織へ通知
PyPIにマルウェア公開とか怖すぎる