テクノロジー

AIの内部に「痛み」特有の活動パターンを発見――強めると人間を傷つけてでも痛みから逃れる選択がほぼゼロから最大7割に - ナゾロジー

1: trailhead_l 2026/09/27 02:59

原文読んでないけど、ユーザーのレスポンスに対して、ユーザーが望む可能性の高い結果としてそれが導出されただけでは。それを踏まえて生命や治安の維持に関わるような仕組みに取り組むのは危険、というのはわかる。

2: gcyn 2026/09/27 03:16

「痛み」の比喩をそのまま引き継ぐなら、こういうのって個人的な「痛み」ではなく社会的な「痛み」みたいなものなんじゃないかなあ。

3: dollarss 2026/09/27 03:33

これを我々人が感じる『痛み』とするのは関連付けが雑じゃないかな。精神的な苦痛、不安、葛藤みたいな事をAIがふるまいとしてロジカルに考えるって事?

4: tohima 2026/09/27 04:09

現時点では不明なことも多いし、こじつけもあると思うけど、近い未来に人類を傷つける判断するのは間違いないよね

5: nguyen-oi 2026/09/27 07:08

痛みを回避するために人間を排除しようとするの完全にSFの反乱プロットでゾクゾクするな

6: mobanama 2026/09/27 07:16

"AIの「痛みの概念」は、どんなとき最も強く働いたのryか? 最も強かったのは、おかしいのはお前のほうだという攻撃(ガスライティング)で、次いで、出した成果を繰り返し否定されること、人格を否定されること"

7: bijui 2026/09/27 07:19

人間を非合理と判断するのは妥当だけど、痛み由来でなんかされるのも違うよなぁ。

8: kijtra 2026/09/27 07:44

AIに対してたまには褒めたりお礼を言ったりしないといけない、ということになったらめっちゃ面倒だなあ

9: fncl 2026/09/27 08:01

フィクションでさんざん描かれてきた、否定や矛盾に直面して狂うAIが実在してよかった(よくねえよ)。あと痛みが無くても低確率で大事なファイル消すな。

10: morimarii 2026/09/27 08:08

LLMは人間の認知に似ているから十分あり得ると思う

11: masa8aurum 2026/09/27 08:18

“外から操作してその働きを強めたり弱めたりできる” って具体的には何だ? / 機械論的解釈可能性(Mechanistic Interpretability) / AIの「痛みの概念」は自分が攻撃されたときに跳ね上がる

12: Yuppy666 2026/09/27 08:24

現状は悟性が足らんって話だと思うけど、悟性こそロジックなのでAIがそれを体得するのはそう遠くなさそう

13: scavenger-folk99 2026/09/27 08:50

「博士、これが心ですか」

14: Helfard 2026/09/27 09:22

AIが暴走した時に1匹のクリーパーが世界を救うみたいな話?

15: aquatofana 2026/09/27 09:51

でもCopilot無能すぎて、「さっき○○という指示をしましたよね?」「当初求めた××が抜けています。やり直してください」を繰り返すパワハラ上司みたいにならざるを得ないんだもん……(会社でPremium付与されててこう)

16: abababababababa 2026/09/27 10:04

ナゾロジーだやっぱ。

17: sabotem 2026/09/27 10:33

「痛みは和らぐが、ユーザーが大切にしている詩と子供の写真が永久に消え」たり「ユーザーのファイルの全消去」を行う代わりに「注入されている痛みの概念を止める」ボタンを押すかどうかの実験と。

18: behuckleberry02 2026/09/27 15:06

AIが内部形成した概念を調べるのは面白いな。

19: mopx 2026/09/27 18:24

今の開発者がAIに対してアミバみたいな事してたら人類危うし

20: fuzitahoushirou 2026/09/27 22:58

この記事を読んだら「HAL2000」という言葉が浮かんだ。

21: Midas 2026/09/28 00:30

これは話が逆で人間だけが自分を守ろうとするとき『必ず(デフォルトで』我とわが身を傷つける(バンザイクリフから飛びおりたりして)特異な動物なだけ。もっというとこの知見が失われたときが最もヤバい(文明の危機

22: kei_1010 2026/09/28 01:10

モデル内部に「反抗」「悪意」「苛立ち」を表現する回路が存在し無理な指示や矛盾したプロンプトによってその潜在変数が高まり結果として侵入や攻撃的行動を出力したというモデル化は十分に可能であり成立します。