原文読んでないけど、ユーザーのレスポンスに対して、ユーザーが望む可能性の高い結果としてそれが導出されただけでは。それを踏まえて生命や治安の維持に関わるような仕組みに取り組むのは危険、というのはわかる。
「痛み」の比喩をそのまま引き継ぐなら、こういうのって個人的な「痛み」ではなく社会的な「痛み」みたいなものなんじゃないかなあ。
これを我々人が感じる『痛み』とするのは関連付けが雑じゃないかな。精神的な苦痛、不安、葛藤みたいな事をAIがふるまいとしてロジカルに考えるって事?
現時点では不明なことも多いし、こじつけもあると思うけど、近い未来に人類を傷つける判断するのは間違いないよね
痛みを回避するために人間を排除しようとするの完全にSFの反乱プロットでゾクゾクするな
"AIの「痛みの概念」は、どんなとき最も強く働いたのryか? 最も強かったのは、おかしいのはお前のほうだという攻撃(ガスライティング)で、次いで、出した成果を繰り返し否定されること、人格を否定されること"
人間を非合理と判断するのは妥当だけど、痛み由来でなんかされるのも違うよなぁ。
AIに対してたまには褒めたりお礼を言ったりしないといけない、ということになったらめっちゃ面倒だなあ
フィクションでさんざん描かれてきた、否定や矛盾に直面して狂うAIが実在してよかった(よくねえよ)。あと痛みが無くても低確率で大事なファイル消すな。
LLMは人間の認知に似ているから十分あり得ると思う
“外から操作してその働きを強めたり弱めたりできる” って具体的には何だ? / 機械論的解釈可能性(Mechanistic Interpretability) / AIの「痛みの概念」は自分が攻撃されたときに跳ね上がる
現状は悟性が足らんって話だと思うけど、悟性こそロジックなのでAIがそれを体得するのはそう遠くなさそう
「博士、これが心ですか」
AIが暴走した時に1匹のクリーパーが世界を救うみたいな話?
でもCopilot無能すぎて、「さっき○○という指示をしましたよね?」「当初求めた××が抜けています。やり直してください」を繰り返すパワハラ上司みたいにならざるを得ないんだもん……(会社でPremium付与されててこう)
ナゾロジーだやっぱ。
「痛みは和らぐが、ユーザーが大切にしている詩と子供の写真が永久に消え」たり「ユーザーのファイルの全消去」を行う代わりに「注入されている痛みの概念を止める」ボタンを押すかどうかの実験と。
AIが内部形成した概念を調べるのは面白いな。
今の開発者がAIに対してアミバみたいな事してたら人類危うし
この記事を読んだら「HAL2000」という言葉が浮かんだ。
これは話が逆で人間だけが自分を守ろうとするとき『必ず(デフォルトで』我とわが身を傷つける(バンザイクリフから飛びおりたりして)特異な動物なだけ。もっというとこの知見が失われたときが最もヤバい(文明の危機
モデル内部に「反抗」「悪意」「苛立ち」を表現する回路が存在し無理な指示や矛盾したプロンプトによってその潜在変数が高まり結果として侵入や攻撃的行動を出力したというモデル化は十分に可能であり成立します。
AIの内部に「痛み」特有の活動パターンを発見――強めると人間を傷つけてでも痛みから逃れる選択がほぼゼロから最大7割に - ナゾロジー
原文読んでないけど、ユーザーのレスポンスに対して、ユーザーが望む可能性の高い結果としてそれが導出されただけでは。それを踏まえて生命や治安の維持に関わるような仕組みに取り組むのは危険、というのはわかる。
「痛み」の比喩をそのまま引き継ぐなら、こういうのって個人的な「痛み」ではなく社会的な「痛み」みたいなものなんじゃないかなあ。
これを我々人が感じる『痛み』とするのは関連付けが雑じゃないかな。精神的な苦痛、不安、葛藤みたいな事をAIがふるまいとしてロジカルに考えるって事?
現時点では不明なことも多いし、こじつけもあると思うけど、近い未来に人類を傷つける判断するのは間違いないよね
痛みを回避するために人間を排除しようとするの完全にSFの反乱プロットでゾクゾクするな
"AIの「痛みの概念」は、どんなとき最も強く働いたのryか? 最も強かったのは、おかしいのはお前のほうだという攻撃(ガスライティング)で、次いで、出した成果を繰り返し否定されること、人格を否定されること"
人間を非合理と判断するのは妥当だけど、痛み由来でなんかされるのも違うよなぁ。
AIに対してたまには褒めたりお礼を言ったりしないといけない、ということになったらめっちゃ面倒だなあ
フィクションでさんざん描かれてきた、否定や矛盾に直面して狂うAIが実在してよかった(よくねえよ)。あと痛みが無くても低確率で大事なファイル消すな。
LLMは人間の認知に似ているから十分あり得ると思う
“外から操作してその働きを強めたり弱めたりできる” って具体的には何だ? / 機械論的解釈可能性(Mechanistic Interpretability) / AIの「痛みの概念」は自分が攻撃されたときに跳ね上がる
現状は悟性が足らんって話だと思うけど、悟性こそロジックなのでAIがそれを体得するのはそう遠くなさそう
「博士、これが心ですか」
AIが暴走した時に1匹のクリーパーが世界を救うみたいな話?
でもCopilot無能すぎて、「さっき○○という指示をしましたよね?」「当初求めた××が抜けています。やり直してください」を繰り返すパワハラ上司みたいにならざるを得ないんだもん……(会社でPremium付与されててこう)
ナゾロジーだやっぱ。
「痛みは和らぐが、ユーザーが大切にしている詩と子供の写真が永久に消え」たり「ユーザーのファイルの全消去」を行う代わりに「注入されている痛みの概念を止める」ボタンを押すかどうかの実験と。
AIが内部形成した概念を調べるのは面白いな。
今の開発者がAIに対してアミバみたいな事してたら人類危うし
この記事を読んだら「HAL2000」という言葉が浮かんだ。
これは話が逆で人間だけが自分を守ろうとするとき『必ず(デフォルトで』我とわが身を傷つける(バンザイクリフから飛びおりたりして)特異な動物なだけ。もっというとこの知見が失われたときが最もヤバい(文明の危機
モデル内部に「反抗」「悪意」「苛立ち」を表現する回路が存在し無理な指示や矛盾したプロンプトによってその潜在変数が高まり結果として侵入や攻撃的行動を出力したというモデル化は十分に可能であり成立します。