Opus5は賢いけどミスが多い。賢さと正確性が別なのは生きてたらわかるでしょ
effort levelで罠に気づく確率が変わるって分析がガチで面白い。モデル性能以前にパラメータ設定が死活問題だな
AIにミスが多いって仕組み知ってれば当たり前なんだけどよく知らない人からすると奇異に映るかもしれないと思った
処理系ならいいけど、資料とかの成果物はSonnetは弱い印象。Opusは少し情報過多、Fableは流石というイメージ。
まだClaudeで消耗してるの?
それにしてもopus 5たまに激しく頭悪いけどな。賢いけどミスが多いんじゃなくて単純に阿呆。
ファブル使え、一番いいやつ
簡単なタスクならローカルLLMでも十分に行けるけど、レートリミット的にOpus 5で足りてる。
“Opus5よりもSonnet5のコストは約1/2。Sonnet5 xhighで上がるのは実装力ではなく致命的ミスに気づく確率。Opus5 lowでは理解済みの致命的ミス(ガード)”
ブラックボックステストなんで正直やってみないと分からないのがつらいよね。指標が曖昧過ぎるw
なんとなくでOpus 4.7、4.8を時々使って比べてみる
生成AI使うと「頭の良い人は根本的な所で間違う」 を身をもって体感できる
結論、Opus 5を使いましょうw
わかる、sonnet 5 xhigh いいよね(fable 除く)
ただしxhigh、と
Opus 5 よりも Sonnet 5 を選ぶ理由——QCD を 240 試行で比較する(オトナの自由研究 #34)
Opus5は賢いけどミスが多い。賢さと正確性が別なのは生きてたらわかるでしょ
effort levelで罠に気づく確率が変わるって分析がガチで面白い。モデル性能以前にパラメータ設定が死活問題だな
AIにミスが多いって仕組み知ってれば当たり前なんだけどよく知らない人からすると奇異に映るかもしれないと思った
処理系ならいいけど、資料とかの成果物はSonnetは弱い印象。Opusは少し情報過多、Fableは流石というイメージ。
まだClaudeで消耗してるの?
それにしてもopus 5たまに激しく頭悪いけどな。賢いけどミスが多いんじゃなくて単純に阿呆。
ファブル使え、一番いいやつ
簡単なタスクならローカルLLMでも十分に行けるけど、レートリミット的にOpus 5で足りてる。
“Opus5よりもSonnet5のコストは約1/2。Sonnet5 xhighで上がるのは実装力ではなく致命的ミスに気づく確率。Opus5 lowでは理解済みの致命的ミス(ガード)”
ブラックボックステストなんで正直やってみないと分からないのがつらいよね。指標が曖昧過ぎるw
なんとなくでOpus 4.7、4.8を時々使って比べてみる
生成AI使うと「頭の良い人は根本的な所で間違う」 を身をもって体感できる
結論、Opus 5を使いましょうw
わかる、sonnet 5 xhigh いいよね(fable 除く)
ただしxhigh、と