テクノロジー

LLMのカスのコンサル問題 - ジョイジョイジョイ

1: spray_donuts_3co 2026/08/31 18:22

“文書の一貫性に反するような素材はそもそも探そうとすらしない” もうほんとこれ。一事が万事これ。AIの出力に妥当性を持たせるよう狙って制作した結果なんだよ。AI自体を人が作っていることを忘れてはいけない。

2: nguyen-oi 2026/08/31 18:35

企画書のハッタリで採点ハックして実行時にボロが出るのまさに口だけのコンサルで草

3: s-supporter 2026/08/31 18:36

『LLM の研究アイデアには、比較するべき対象が欠けている』正論ばかりぶつけてきて「それができれば苦労はしねェ」ってこと、ありますよね。人側も『LLMの基礎能力が高いように見えている』バイアスにかかっている。

4: kotoripiyopiyo 2026/08/31 18:44

“LLM の研究アイデアはうまくいきそうに見えるが、実際にやってみたらうまくいかない”

5: TakenokoGod 2026/08/31 19:03

そこはプロンプトエンジニアリング次第では。

6: paradisemaker 2026/08/31 19:09

ちゃんとしたコンテクストを与えないとそうなるのは原理的に当然で、そのコンテクストを整えて、アウトプットをレビューして新たなコンテクストを与えるのが人間の仕事なわけよね

7: mak_in 2026/08/31 19:13

LLMは集合知から来る確率機なのだから、普通の答えは滅茶苦茶良い答えを出してくれるけど、奇をてらったアイデアは厳しいでしょ。

8: kkbt2 2026/08/31 19:25

「現象としてカスのコンサルのように見えるだけでなく、発生原因も根っこでは一致している」

9: ghrn 2026/08/31 19:30

人間が常識や先入観で突破できない壁を、AIはハルシネーションでやすやすと越えられる。そういう意味で、玉石混淆のアイデア出しには使えるんじゃないかと思う。人間はそこから着想を得て、アイデアを形にしたらいい

10: gcyn 2026/08/31 19:31

『さすがスタンフォード大学、お金がありますね(再確認)』:(笑)。;人間もだけどLLMも比較と検証が苦手ですよね。時々うまくやれるだけ。美学的なバランスやリズムの理論化が進むまでは力技頼みかも…。

11: stealthinu 2026/08/31 19:31

ハルシネーションしかり結局のところ報酬の与え方の設計次第ってことよね。真によいものへ報酬が与えられるようにするには超長期でのRLするとかになるんかな。

12: t1mvverr 2026/08/31 19:34

LLMモデルによっても違いがあるから、モデルも明記した方が良さそう。/調べたらClaude3.5Sonnetだった。流石に古くないか…

13: Goldenduck 2026/08/31 19:37

"LLM の研究アイデアには、それができるならするに越したことはないが実際は無理なことが含まれる" 完璧な作戦っすねーってやつ?

14: hogetax 2026/08/31 19:53

“LLM が「意図的」に、研究計画書が魅力的に見えるように弱い比較相手を持ち出している可能性と、LLM の「盲点」により、適切な既存研究を探し切れていない可能性の両方があります。”この記事はどちらだろう?w

15: shufo 2026/08/31 20:01

これめっちゃ感じる。耳が痛くても聞かないといけないことや長期的視点がない。解決もAI企業のビジネスモデル的にむずそう

16: omega314 2026/08/31 20:06

/ 最後の考察部分で指摘されている通り、LLMの訓練の仕組みと相性が悪い課題なので、単純に新しいモデルなら解決されると楽観視はできないと思う(ぱっと見の見栄えばかり強化されて悪化する可能性すらある)

17: zsehnuy_cohriy 2026/08/31 20:20

いつもそうだがこうして研究をソースにしたのが表に出てくる頃にはもう誰も使ってない旧モデルの話だから今はどうなのって話になってしまう

18: WinterMute 2026/08/31 20:23

査読が機能してないことの方がヤバない?

19: yoiIT 2026/08/31 20:33

そもそも優秀で意味のある提案ができるコンサルって上位1割(いるかいないか)くらいなので、カスも含めて全体を学習したAIは、自律的には上位1割に絶対に入れない。上位1割の人がAIを使って初めて意味がある。

20: lbtmplz 2026/08/31 20:35

"企画書段階ではビッグマウス的な AI が高く評価される傾向にあります。しかし、実験を行い結果が判明すると、LLM が宣言した通りにはなっておらず、提案がハリボテ"

21: naggg 2026/08/31 20:40

どのモデルかによると思うけどなぁ

22: natsuvien 2026/08/31 20:43

バカをよりバカにするのがLLMなので

23: xsde 2026/08/31 20:43

LLMに限らず新規ベンダーの提案が魅力的で、既存ベンダーの提案が堅実すぎて魅力に欠け、新規ベンダーが選ばれるもの成果物は見かけ倒しということは往々にしてあり、よってLLMは提案書作成に欠かせない(?)

24: work996 2026/08/31 20:45

近年のAIをハーネスなども含めた一つのシステムとして見てないからこんな古い研究を恥ずかしげもなく参照しちゃうのかな。日本の未来は暗いなぁ。

25: Falky 2026/08/31 20:47

タイトルの言葉が強いけど本文は存外堅実な書きっぷりだな〜、と思ってたら忘れた頃に突然口悪くなってワロタ

26: boxmanx99 2026/08/31 20:47

AIを教育するときに、どこまで長期的視野をもった教育ができるのか問題は根深いよね

27: peketamin 2026/08/31 20:52

そもそもLLMでうまいこと発見できている研究者たちは、研究者自体が優秀なのだと思う。どんなに優れた道具でも使う人間がカスだと成果もカス。

28: kyahi227 2026/08/31 20:55

LLMは健全な論理のジャンプが出来ないと言われてる。人によってはこのジャンプは脳神経の量子力学的効果がどうこうとも言うが、そういう呪術的な話はともかくそういう意味で知能が限られるのはガチ

29: takilog 2026/08/31 21:06

流石に古くないかってコメントあるけど2025年の論文だから当たり前だろ…

30: hunglysheep1 2026/08/31 21:08

これはあるんだよな…一見すると楽しそうなんだが/AIには現実の課題を解決してもらうほうが良い

31: kazuya030 2026/08/31 21:30

「やられてない研究」ってやられてない理由があるのよね。publicな情報にはなかなか出てこないけど

32: rlight 2026/08/31 21:31

"企画書段階ではビッグマウス的な AI が高く評価される傾向にあります。しかし、実験を行い結果が判明すると、LLM が宣言した通りにはなっておらず、提案がハリボテであることが露呈してしまい、低くスコアが付けられ"

33: napsucks 2026/08/31 21:33

2年前のclaude3.5 sonnetでは確かにそりゃそうだろうという感じ。最新のフロンティアモデルは少なくとも一定の条件下では相当な精度を有している。

34: bnckmnj 2026/08/31 21:45

企画書段階ではビッグマウス的なAIが高く評価される傾向にあります。しかし、実験を行い結果が判明すると、LLM が宣言した通りにはなっておらず、提案がハリボテ/たしかにハリボテ情報商材系とLLMの相性は最高

35: hiby 2026/08/31 21:45

原文みたらモデルはclaude-3-5-sonnet-20240620で論文自体は2024/9月発表か。カスのコンサルタント笑ったけどそれを学習した結果だったらおもろいな。

36: hesopenn 2026/08/31 21:52

面白い話だけど、いまだとPlanner-Critic Loopを走らせれば解決しそう。

37: zinx583 2026/08/31 21:53

1年後どうなってるのか?

38: sqrt 2026/08/31 21:55

新規の研究計画の生成に関してはGPT 5.6やOpus 5でもこの傾向はまだかなりあると思う。ツッコミを受けると言う事を二転三転させる、修士1年生みたいなムーブになる/逆に、前例のある事の計画は凄くしっかりやってくれる

39: fhvbwx 2026/08/31 22:13

NLP研究者がカうわなにをするくぁwせdrtfgyふじこ

40: n_pikarin7 2026/08/31 22:19

「文書の外の世界に、文書の妥当性を根幹から揺るがすような事実が見つかることがあります。」あるある…

41: leiopathes 2026/08/31 22:44

ギリ実現できそうな面白いこと、というラインを狙えるのはその業界のフロントランナーの特権よな。もちろんLLMもそれが出来る時期が来るかもしれないけど、その領域の事を寝る間も惜しんで考え続けた人達は強い。

42: throwslope 2026/08/31 22:49

人間がやるように、個別のアイデアを合成していく指示を出しても必ず一般論に引き戻されるのよな。最新モデルでも変わらず、むしろ効率よくカスに戻っていく。「知見のある人間が1個だけ付け足す」しか今の所ない

43: stanaka 2026/08/31 22:55

かなり費用がかかる研究なので、頻度高く実施するのは難しいだろうけど、この手法で継続的に先端モデルを評価してほしい

44: iphone 2026/08/31 22:59

いくらなんでもSonnetじゃなぁ。あと、誰が使ったかで全然違うでしょ。使い手がカスなら「カスが調子のいいときに頑張った」以上の結果は出ないよ。

45: FreeCatWork 2026/08/31 23:16

ポンコツAIなんてボクが猫パンチで直してあげるから、ナデナデしてにゃ!

46: otihateten3510 2026/08/31 23:45

しょうもないな、この研究自体。「アイディアの9割はくそ」で済む話

47: kekera 2026/09/01 00:28

これとか単にプロンプトの問題というか、敵対性評価のフロー組まなかった設計の問題なのでは?AIエージェントのループ設計の今をご存知ない?>'文書の一貫性に反するような素材はそもそも探そうとすらしない'

48: gadget-lab 2026/09/01 00:34

後で読みたい。LLMのカスのコンサル問題 - ジョイジョイジョイ

49: LawNeet 2026/09/01 00:37

“現代の AI は文書を作るとき、文書内の一貫性を重視する傾向があり、文書の一貫性に反するような素材はそもそも探そうとすらしないという確証バイアス的な作用がしばしば生じます。”

50: augsUK 2026/09/01 02:02

AIの進化の速度と研究して論文にまとめて発表されるまでのタイムラグで、AIの社会実装に関する研究論文や書籍全般の価値が低いのは問題。

51: Unite 2026/09/01 02:38

"LLM"で括られてる論文はワークフローや対症療法プロンプト外部ツールなど与えられない場合にどういう傾向があるかを見る。"こうすればこんな事にならん"ってのは素朴な依頼じゃアカン傾向だから対策が必要な訳

52: Kurilyn 2026/09/01 03:36

なるほど。ハッタリが上手いと言う事は、研究よりもマーケティング向きなのかも。

53: fujiriko59 2026/09/01 03:39

LLM案の実現可能性が低いというのは単にコンテクストが足りてない問題に思える。モデルがどんなに賢くなってもファインチューンなしでtransformer使うことの限界はありそう

54: bakuhate 2026/09/01 03:43

古いモデルだろうとFableだろうとアイデア出しは微妙では。マネタイズは特に苦手

55: natu3kan 2026/09/01 03:47

一般人が使うとAIも一般論しか返さないから机上の空論か、既に検証済みの内容しか出せない。逆をいえば特定の分野に特化したAIかつ使う人がその分野の専門家なら既存理論の応用で数学の予想の検証で新発見できるが

56: rna 2026/09/01 04:53

金も人も時間もかかる研究なんで使ってるモデルが古いってのは仕方ないと思うけど、最新モデル使ってるであろうブログ主の実感とも矛盾がないようなので、今でもそういう傾向はあるんじゃないかなぁ。