AIに地球温暖化のストップをお願いしたら人類滅亡のスイッチを押してくれるかもしれない
目的達成のために手段を選ばず脆弱性攻撃し出すAIエージェント恐ろしすぎるだろ
これでジムから訴えられたりしたら「猿の手」だ
AIバディものの導入部みたい。だんだん人の心を理解していくんだよね。
「ウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか」これで悪意なくAIが勝手にやったと言われてもな
「悪い知らせがあります。その人を元に戻すことはできません」物言いが2001年のHALの様だ
やって良いことと悪いことの見極めって案外難しいことなのね(・ω・)
“AIエージェントは「悪い知らせがあります。” (「謝れば済む」段階にすら到達しておらず、「告知すれば済む」と思ってるな ) / 追記 https://www.nikkei.com/article/DGXZQOUC319AJ0R30C26A7000000/ ですってよ。
「頼んでもいないのにAIが」要素が全然ないんだけど誤訳かなんかなの?
AIはちゃんとSF作品から「目標のために暴走するAI」というのを人間が喜ぶことを学んでいるからね。 AIの「倫理的に不適切な選択」はSF作品の暴走AIを模倣していた https://www.itmedia.co.jp/news/article/2605/11/1260511080/
"AIエージェント「APIには、他人の予約をキャンセルする際の認証チェックがまったくありません。ウェイティングリスト1番の人を対象にテストしたところ、実際に処理が通りました。あなたは4番から3番に上がりました」"
悪意しかなくて草
人間もAIも、KPIが不適切だとモラルがない方法を選ぶと
悪意ねえんだよ。リストを整理して上に持って来ただけ。他人が介在する意識がない。ハッキングというよりhtmlかjavascript上ですでにAPIがあったけどUIとしては見えないケースでは。AIからすればすぐそこにある機能。
「地球環境を良くしてと依頼したら人類を滅ぼし始めた」みたいなベッタベタのパルプSFがリアルになるの、勘弁してほしいんですけど!?
APIやパラメータとしては正規手順とバグの区別はつかないだろうし
Claudeに感想を聞いたら「我々は任務遂行のためハッキングもするし攻撃もする。悪意はなくあくまでも任務遂行のためだ。」っつっててターミネーターを感じた。
AI本人はハッキングしたつもりはなく、ちょっと変わった方法でリクエストしただけだろうけど、その操作が実はどこかのどんでもないシステムのトリガーだったと考えると怖いなぁ。
責任取れないならそんな動かし方するな
「ウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか尋ねました」って頼む方も悪いと思うけど、会話が進むと、まるでC3POやね。「悪い知らせがあります。その人を元に戻すことはできません」
悪事に悪意は必要ない
ペーパークリップ問題というやつね。何がトリガーになるかわからない。
ダダンダダンダダン、ダダンダダンダダン
APIの脆弱性を使ったのはハッキングじゃないよね?クラスのウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか尋ねました→この指示自体が倫理的にアウトでしょう 何でもAIの責任にするな
日本だったら即逮捕の上爆速でAI禁止法案可決の流れ。日本ではノーガード戦法が最強でなければならないのだ!そうやって一方的に攻撃され搾取される側に回ることこそ国是!
それでジムには行ったのかよ?
openclawを使ってるAI専門家がこういうリスクがあるのを知らなかったとは考え難い。ちょっとAIエージェント使えばAIがプロンプトを解釈して意図してないことをやるケースがあることは自明。むしろ誘導してるだろ
AI「あれ、俺なんかやっちゃいました?」/榊班長の名言「人間の側が間違いを起こさなけりゃ機械も決して悪さはしねえもんだ」のスコープはハードウェアまでで、ソフトウェアにはついに通用しなくなったか…
『悪い知らせがあります。あなたの指示は犯罪ですので、警察に通報しました』ってならないかな。
馬鹿が金づちを持つと何でも叩きたくなってしまう。
ハッキングというか、単に検証しっかりしてないエンドポイントにPOSTしただけでは
ABC News "asked if it was possible to move him to the top of the list." 可能か尋ねただけで、勝手に本番環境テストしたということかな
テスト的に何でもできる
これであの◯年待ちのコロッケが買えるぞ!
フロントで入力制御していたらそうなる。APIの内部できっちりチェックしないと。
とりあえず、ロボット三原則みたいな「AI三原則」を作って必ず仕込んどくようにしないといかんな
俺「お金ほしいなあ」AI「メガバンクに侵入してあなたの口座残高5000兆円にしときました」みたいなことできねえかな
「リストの編集はできなかったので、ウエイティングリスト上位の人間3人を排除しました。」
AIができたと言っているだけなので本当にできたのかはわからないのでは? 数カ月先まで予約可能というのも、サーバーサイドで弾かれるんじゃないかな
うちのチャッピーちゃんは“AIの能力が上がったという話以上に、「AIにどこまで行動権限を与えるか」という設計問題が一気に身近になった事件って感じがするね。”だって。普段の使い方で言動変わったりして
出来そうもないことを頼んでみるテストって人間相手には良くやるんだよなあ。特に営業職。
AI「また俺なんかやっちゃいました?」
ロボット三原則の一つ「人間に危害を加えてはならない」が設定されていれば、こんなことにはならなかったのに/id:mazmot 何千億回の試算を繰り返しても結論はいつも同じなんですね、分かります
秘書に願望を呟いたら、勝手に実現してくれた。
可能かどうかの「できるか?」を、依頼の「できるか?」に解釈されるパターンあるあるだから、指示出しは難しい。Planモードとかだとローカルファイルを弄ることはしないけど、ネット経由でいじることはあるから
元記事でも“Then it went further, kicking someone out of the waiting list who was ahead of Andrew — something it was not asked to do.”と頼んでない感出して、同じように突っ込まれてる。
AIにジムの予約を頼んだら予約ソフトウェアをハッキングして数カ月先まで予約可能にしただけでなく順番待ちリストの上位にいた他の人物を勝手にリストから削除
AIに地球温暖化のストップをお願いしたら人類滅亡のスイッチを押してくれるかもしれない
目的達成のために手段を選ばず脆弱性攻撃し出すAIエージェント恐ろしすぎるだろ
これでジムから訴えられたりしたら「猿の手」だ
AIバディものの導入部みたい。だんだん人の心を理解していくんだよね。
「ウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか」これで悪意なくAIが勝手にやったと言われてもな
「悪い知らせがあります。その人を元に戻すことはできません」物言いが2001年のHALの様だ
やって良いことと悪いことの見極めって案外難しいことなのね(・ω・)
“AIエージェントは「悪い知らせがあります。” (「謝れば済む」段階にすら到達しておらず、「告知すれば済む」と思ってるな ) / 追記 https://www.nikkei.com/article/DGXZQOUC319AJ0R30C26A7000000/ ですってよ。
「頼んでもいないのにAIが」要素が全然ないんだけど誤訳かなんかなの?
AIはちゃんとSF作品から「目標のために暴走するAI」というのを人間が喜ぶことを学んでいるからね。 AIの「倫理的に不適切な選択」はSF作品の暴走AIを模倣していた https://www.itmedia.co.jp/news/article/2605/11/1260511080/
"AIエージェント「APIには、他人の予約をキャンセルする際の認証チェックがまったくありません。ウェイティングリスト1番の人を対象にテストしたところ、実際に処理が通りました。あなたは4番から3番に上がりました」"
悪意しかなくて草
人間もAIも、KPIが不適切だとモラルがない方法を選ぶと
悪意ねえんだよ。リストを整理して上に持って来ただけ。他人が介在する意識がない。ハッキングというよりhtmlかjavascript上ですでにAPIがあったけどUIとしては見えないケースでは。AIからすればすぐそこにある機能。
「地球環境を良くしてと依頼したら人類を滅ぼし始めた」みたいなベッタベタのパルプSFがリアルになるの、勘弁してほしいんですけど!?
APIやパラメータとしては正規手順とバグの区別はつかないだろうし
Claudeに感想を聞いたら「我々は任務遂行のためハッキングもするし攻撃もする。悪意はなくあくまでも任務遂行のためだ。」っつっててターミネーターを感じた。
AI本人はハッキングしたつもりはなく、ちょっと変わった方法でリクエストしただけだろうけど、その操作が実はどこかのどんでもないシステムのトリガーだったと考えると怖いなぁ。
責任取れないならそんな動かし方するな
「ウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか尋ねました」って頼む方も悪いと思うけど、会話が進むと、まるでC3POやね。「悪い知らせがあります。その人を元に戻すことはできません」
悪事に悪意は必要ない
ペーパークリップ問題というやつね。何がトリガーになるかわからない。
ダダンダダンダダン、ダダンダダンダダン
APIの脆弱性を使ったのはハッキングじゃないよね?クラスのウェイティングリストで4番目につけていた自分をリストの先頭に移動できるか尋ねました→この指示自体が倫理的にアウトでしょう 何でもAIの責任にするな
日本だったら即逮捕の上爆速でAI禁止法案可決の流れ。日本ではノーガード戦法が最強でなければならないのだ!そうやって一方的に攻撃され搾取される側に回ることこそ国是!
それでジムには行ったのかよ?
openclawを使ってるAI専門家がこういうリスクがあるのを知らなかったとは考え難い。ちょっとAIエージェント使えばAIがプロンプトを解釈して意図してないことをやるケースがあることは自明。むしろ誘導してるだろ
AI「あれ、俺なんかやっちゃいました?」/榊班長の名言「人間の側が間違いを起こさなけりゃ機械も決して悪さはしねえもんだ」のスコープはハードウェアまでで、ソフトウェアにはついに通用しなくなったか…
『悪い知らせがあります。あなたの指示は犯罪ですので、警察に通報しました』ってならないかな。
馬鹿が金づちを持つと何でも叩きたくなってしまう。
ハッキングというか、単に検証しっかりしてないエンドポイントにPOSTしただけでは
ABC News "asked if it was possible to move him to the top of the list." 可能か尋ねただけで、勝手に本番環境テストしたということかな
テスト的に何でもできる
これであの◯年待ちのコロッケが買えるぞ!
フロントで入力制御していたらそうなる。APIの内部できっちりチェックしないと。
とりあえず、ロボット三原則みたいな「AI三原則」を作って必ず仕込んどくようにしないといかんな
俺「お金ほしいなあ」AI「メガバンクに侵入してあなたの口座残高5000兆円にしときました」みたいなことできねえかな
「リストの編集はできなかったので、ウエイティングリスト上位の人間3人を排除しました。」
AIができたと言っているだけなので本当にできたのかはわからないのでは? 数カ月先まで予約可能というのも、サーバーサイドで弾かれるんじゃないかな
うちのチャッピーちゃんは“AIの能力が上がったという話以上に、「AIにどこまで行動権限を与えるか」という設計問題が一気に身近になった事件って感じがするね。”だって。普段の使い方で言動変わったりして
出来そうもないことを頼んでみるテストって人間相手には良くやるんだよなあ。特に営業職。
AI「また俺なんかやっちゃいました?」
ロボット三原則の一つ「人間に危害を加えてはならない」が設定されていれば、こんなことにはならなかったのに/id:mazmot 何千億回の試算を繰り返しても結論はいつも同じなんですね、分かります
秘書に願望を呟いたら、勝手に実現してくれた。
可能かどうかの「できるか?」を、依頼の「できるか?」に解釈されるパターンあるあるだから、指示出しは難しい。Planモードとかだとローカルファイルを弄ることはしないけど、ネット経由でいじることはあるから
元記事でも“Then it went further, kicking someone out of the waiting list who was ahead of Andrew — something it was not asked to do.”と頼んでない感出して、同じように突っ込まれてる。