「最近Claudeの性能が落ちた」と感じる理由

モデルアップデートとeffort設定の影響
- デフォルトeffortが低め(highなど)に設定されている
- xhighに上げると推論の深さが改善
- 複雑タスクではxhighがトークン効率良い
ユーザーのタスクとモデル特性のミスマッチ
- 無料・ProプランではSonnet 5がデフォルト
- SonnetはOpusほど深い推論ができない
- 用途に合わせたモデル選択が必要
ベンチマーク上ではむしろ向上
- Opus 4.5やSonnet 5は過去モデルを上回る
- コード生成やエージェントタスクで改善
- 期待値が上がったために落ちたと感じる可能性
モデルアップデートとeffort設定の影響
室谷代表取締役「昔と比べてClaudeの応答が浅くなった」って話、よく聞くんですよね。でも原因の大半はモデルそのものじゃなくて、知らないうちにeffort設定が変わってるパターンです。
テキトー教師.AI認定講師たしかに。Opus 4.8だとデフォルトのeffortがhighに設定されてて、以前のモデルより低めの設定で動いてるケースがある。
初めて触る人は「あれ?前より頭悪くなった?」って感じやすいんですよ。
初めて触る人は「あれ?前より頭悪くなった?」って感じやすいんですよ。
室谷代表取締役現場で言うと、xhighに上げると明らかに推論の深さが変わる。ROIで考えると、コーディングのような複雑なタスクではxhighに設定した方が結果的にトークン効率が良いケースもある。
テキトー教師.AI認定講師設定次第で印象がガラッと変わるので、「性能が落ちた」と感じたらまずeffortを確認するのが早いですね。
ユーザーのタスクとモデル特性のミスマッチ
テキトー教師.AI認定講師もう一つよく聞くのが「以前はできていたタスクができなくなった」という声。でもモデルファミリーが拡充されて、デフォルトで使われるモデルが変わってる可能性があるんですよ。
室谷代表取締役そう。例えば無料・ProプランだとSonnet 5がデフォルトになってます。
Sonnetは速度とコストのバランスに優れてますが、Opusほどの深い推論は期待できない。タスクとモデルのミスマッチですね。
Sonnetは速度とコストのバランスに優れてますが、Opusほどの深い推論は期待できない。タスクとモデルのミスマッチですね。
テキトー教師.AI認定講師最初に戸惑うのが「SonnetとOpus、何が違うの?」というところ。Haikuはさらに高速で安いけど、高度な分析には向かない。
用途に合わせて選ぶ必要があります。
用途に合わせて選ぶ必要があります。
室谷代表取締役APIで使うなら、複雑なエージェントタスクはOpus 4.8、スピード重視ならSonnet 5、コスト優先ならHaiku 4.5と、きっちり住み分けるとパフォーマンスの不満は減ります。
ベンチマーク上ではむしろ向上している
室谷代表取締役実際、Anthropicが公開しているベンチマークだと、Opus 4.5やSonnet 5は過去モデルを大きく上回ってます。特にコード生成やエージェント的なタスクで改善が顕著。
テキトー教師.AI認定講師現場感覚で言うと、以前のモデルより「タスクを最後までやり切る力」が上がってる実感はあります。落ちたと感じるのは、むしろ期待値が上がってるからかもしれません。
室谷代表取締役結局、モデルの能力自体は向上トレンド。ただしeffort設定やモデル選択を適切にしないと、その向上を実感できないまま「落ちた」と思ってしまう。
そこが本質なんですよね。
そこが本質なんですよね。
テキトー教師.AI認定講師設定をちゃんと見直せば、今のClaudeは過去最高の性能を発揮できると思います。
Claude Codeの性能は本当に劣化した?
性能劣化と感じるケース
- 以前よりアウトプットが粗くなった
- 細かい指示が必要になった
- デフォルト設定(Sonnet 5, effort=high)のまま使用
実際の性能変化
- Sonnet 5はagentic性能が向上しタスク完遂率アップ
- Sonnet 5とOpus 4.8の差が縮小
- コスト低下によりOpus→Sonnet移行が可能
推奨される使い分け
- 複雑なリファクタリング: Opus 4.8 + effort=xhigh
- 日常開発: Sonnet 5 + effort=high
- 事前にモデル・effort設定を確認
Claude Codeの動作と内部モデル選択
室谷代表取締役Claude Code、裏でどのモデルが動いてるか意外と意識されてないですよね。Sonnet 5がデフォルトになってから、以前のSonnet 4.6と比較して挙動が変わったと感じる人もいるみたいで。
テキトー教師.AI認定講師たしかに、「なんか前よりアウトプットが粗くなった」って声を聞くことがあります。でも、実はモデル自体の能力が落ちたわけじゃなくて、effortパラメータの初期値がhighになってるのが原因だったりするんですよ。
室谷代表取締役ああ、それ結構ある。Opus 4.8でもデフォルトhighで、xhighにするとガラッと変わる。
コーディングやエージェントタスクならxhigh推奨なんですけど、ユーザー側で明示的に変えないと気づかない。
コーディングやエージェントタスクならxhigh推奨なんですけど、ユーザー側で明示的に変えないと気づかない。
テキトー教師.AI認定講師最初に戸惑うのが、デフォルトのまま使って「品質落ちた?」と感じるパターンですね。モデルの性能うんぬんより、設定の差が大きい。
性能劣化の実態:コード品質の変化
室谷代表取締役で、コード品質の変化って実際どうなんでしょう。うちの現場では、Sonnet 5のほうがタスクの完遂率は上がってる感触なんですけど。
テキトー教師.AI認定講師実はそうなんですよ。Sonnet 5は前世代よりagenticな性能が向上していて、複数ステップの処理を最後までやりきる割合が増えてます。
ただ、その分、応答の粒度が変わったせいで「以前より細かい指示が必要になった」と感じる人もいる。
ただ、その分、応答の粒度が変わったせいで「以前より細かい指示が必要になった」と感じる人もいる。
室谷代表取締役なるほど。あと、Opus 4.8とSonnet 5の差が以前より縮まったのも大きい。
Sonnet 5のintroductory pricingでコスト下がってるから、ヘビーユーザーはOpusからSonnetに移行する動きも出てますね。
Sonnet 5のintroductory pricingでコスト下がってるから、ヘビーユーザーはOpusからSonnetに移行する動きも出てますね。
テキトー教師.AI認定講師そういう意味では、「性能劣化」というより「モデルの適正タスクの変化」と捉えたほうが正しいかもしれません。
最新アップデートで改善されたポイント
室谷代表取締役Anthropicもこの辺はちゃんと対応してきてて、Sonnet 5のリリースでagenticな性能がOpus 4.8に迫るレベルになりました。BrowseCompやOSWorldでコスト対性能の選択肢が広がってます。
テキトー教師.AI認定講師現場でよく聞くのは、「複雑なリファクタリングだとOpus 4.8のxhigh、普段の開発はSonnet 5のhighで十分」という使い分け。これ、以前はできなかったバランスなんですよ。
室谷代表取締役結局、Claude Codeの性能劣化って言われてるのは、適切なモデルとeffortを選べてないケースが大半。特にMaxプラン使っててOpus選べるのにデフォルトのSonnetで回してるケースとか。
テキトー教師.AI認定講師そうですね。まずは自分がどのモデルを使っているか、effortはどう設定しているか確認するのが近道だと思います。
Claudeモデル性能比較:Haiku、Sonnet、Opus、Fableの選び方
| 指標 | Haiku 4.5 | Sonnet 5 | Opus 4.8 | Fable 5 |
|---|---|---|---|---|
| 入力コスト (MTok) | $1 | $3 | $5 | $10 |
| 出力コスト (MTok) | $5 | $15 | $25 | $50 |
| 相対速度 | 最速 | 速い | 中程度 | 遅い |
| effortパラメータ対応 | × | ○ | ○ | × |
モデルごとの特性とベンチマーク
室谷代表取締役今のClaudeは4つの柱があるんですよね。Haiku 4.5、Sonnet 5、Opus 4.8、Fable 5。
それぞれ割とはっきり得意領域が分かれてます。
それぞれ割とはっきり得意領域が分かれてます。
テキトー教師.AI認定講師最初に触る人は「どれ選べばいいんだ」って迷いますよね。公式の選択マトリックスだと、複雑なエージェント作業ならOpus、スピード重視ならHaikuって感じです。
室谷代表取締役うちの現場でも、コードレビューみたいな高負荷タスクはOpus 4.8で回してます。でも定型のデータ抽出ならHaikuで十分。
ROIで考えると、一月単位で結構差が出ますよ。
ROIで考えると、一月単位で結構差が出ますよ。
テキトー教師.AI認定講師たしかに。最初にHaikuから始めて足りなければ上げる、というアプローチもありますね。
速度とコストのトレードオフ
室谷代表取締役料金をざっくり並べるとこんな感じです。
| モデル | 入力 (MTok) | 出力 (MTok) | 相対速度 |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | 最速 |
| Sonnet 5 | $3 | $15 | 速い |
| Opus 4.8 | $5 | $25 | 中程度 |
| Fable 5 | $10 | $50 | 遅い |
テキトー教師.AI認定講師価格だけ見ると差が大きいですけど、実際はトークン効率で逆転することもありますよ。Opusが少ないトークンで同じ品質を出せるので、実質コストが下がるケース。
室谷代表取締役そう。うちのプロジェクトでSonnetからOpusに上げたら、やり直しが減ってトータルコストが15%下がりました。
単純な単価比較だけじゃ測れない。
単純な単価比較だけじゃ測れない。
テキトー教師.AI認定講師逆に、チャットボットみたいな大量リクエストにはHaikuが圧倒的です。遅延も少ないし、ユーザー体験も良い。
effortパラメータで細かく調整する方法
室谷代表取締役ここ最近で一番実用的なのがeffortパラメータ。Opus 4.8とSonnet 5で使えます。
デフォルトはhighですが、xhighに上げるとかなり推論が深くなる。
デフォルトはhighですが、xhighに上げるとかなり推論が深くなる。
テキトー教師.AI認定講師このパラメータ、知らない方も多いんですよ。「モデル切り替え」の前に、まずeffortを変えてみることをおすすめしてます。
室谷代表取締役コーディングのユースケースならxhighが公式推奨。特にデバッグとか複雑なリファクタリングだと、highだと見落とすケースがxhighで拾える。
テキトー教師.AI認定講師現場でも「Opusは高いからSonnetにしよう」という判断の前に、Sonnetのeffortをxhighにしてみると、Opusに迫る性能が出ます。コストを抑えたいときの便利な小技です。
性能劣化のメカニズム:AIモデルはなぜ退化するのか
AIドリフトと制約変更の実態
室谷代表取締役モデル更新を重ねると、明らかに得意不得意が変わるんですよね。シリコンバレーでは「AIドリフト」って呼ばれてますが、パラメータ調整や新しいトレーニングデータの影響で、以前できていたタスクの精度が落ちることがある。
テキトー教師.AI認定講師よくありますね。あるモデルのバージョンで動いていたコード生成のプロンプトが、アップデート後に微妙に崩れる。
初期の頃は特に顕著でした。
初期の頃は特に顕著でした。
室谷代表取締役AnthropicもモデルIDを固定スナップショットにしてるのはその対策です。Opus 4.8やSonnet 5のように、日付なしのIDでも実際は固定版。
ただAPIエイリアスは最新を指すから、意図せずアップグレードされて性能が変わったように感じるケースもある。
ただAPIエイリアスは最新を指すから、意図せずアップグレードされて性能が変わったように感じるケースもある。
テキトー教師.AI認定講師そこが「性能が落ちた」と感じる大きな原因ですね。知らないうちに使っているモデルが変わっていて、期待とズレる。
ユーザーフィードバックによる調整の副作用
テキトー教師.AI認定講師もう一つ大きいのが、安全性調整によるレスポンスの変化。AnthropicのClaude 3発表でも「不必要な拒否を減らした」とありますが、その調整と引き換えに別の部分が弱くなることもある。
室谷代表取締役そう。ユーザーフィードバックで「こういう返しはやめてほしい」と学習させると、過剰に別の領域にも影響する。
正直、これって全モデルメーカーの悩みですよね。
正直、これって全モデルメーカーの悩みですよね。
テキトー教師.AI認定講師現場でよく聞くのは「以前はもっと正確だったのに、最近変な回避をするようになった」という声。トレードオフなんですけど、企業で使うと地味に効く。
室谷代表取締役MYUUUでも使ってますが、プロダクションで使うならモデル固定前提の設計が必要です。特にAgent系のワークフローは微細な挙動変化でガチャッと崩れる。
企業が取るべき性能モニタリング対策
テキトー教師.AI認定講師じゃあどう対策するか。一番シンプルなのは評価用のテストセットを自分で用意すること。
Anthropicのドキュメントでも最初に評価セットを作れ、と。
Anthropicのドキュメントでも最初に評価セットを作れ、と。
室谷代表取締役そこはコスト対効果が大事。評価を自動化して、モデル変更前後でスコアが下がったらロールバックできる仕組みを持っておく。
うちではCIに組み込んでます。
うちではCIに組み込んでます。
テキトー教師.AI認定講師なるほど。あとはeffortパラメータも重要ですね。
同じモデルでも努力量で性能が変わる。Sonnet 5だとxhighレベルでOpus 4.8に迫るんですけど、デフォルトhighのまま使って「性能が落ちた」と感じるケースもあります。
同じモデルでも努力量で性能が変わる。Sonnet 5だとxhighレベルでOpus 4.8に迫るんですけど、デフォルトhighのまま使って「性能が落ちた」と感じるケースもあります。
室谷代表取締役料金表を眺めるより、まず自分のユースケースで数値計測しないと意味がない。時給換算で言えば、モデル固定の運用とテスト自動化に数時間費やすだけで、後々のトラブル回避には十分リターンがあります。
現場目線:Claude性能を最大限引き出すコツ
プロンプト設計
システムプロンプトに出力フォーマットを明示。要件を箇条書きで与える。コンテキストが長くなったら要約して再投入。
モデル選択最適化
Opus 4.8 xhighから始め、Sonnet 5 highに落とせるかテスト。コスト差は入力$5→$3、出力$25→$15。
定期ベンチマーク
毎週金曜に5問の評価問題を流しスコア記録。コードレビュー・要約・質問応答の3カテゴリでテスト。数値で最適設定を可視化。
プロンプト設計で性能を安定させる
テキトー教師.AI認定講師性能が落ちたと感じる原因、実はプロンプトの設計ミスであるケースが多いんですよ。特に長い会話を続けるときに、指示が曖昧になると出力がぶれます。
室谷代表取締役たしかに。MYUUUでも初期は「同じ質問なのに回答が違う」と騒ぎになりました。
解決策は、システムプロンプトに期待する出力フォーマットを明示すること。要件を箇条書きで与えるだけで安定度が桁違いです。
解決策は、システムプロンプトに期待する出力フォーマットを明示すること。要件を箇条書きで与えるだけで安定度が桁違いです。
テキトー教師.AI認定講師それ、現場でよく聞く効果的な方法ですね。あと、コンテキストが長くなったら、過去のやり取りを要約して再投入する「リマインダー」が効きます。
Claudeのコンテキストウィンドウは大きいですが、無駄な情報が混ざると精度が落ちるんです。
Claudeのコンテキストウィンドウは大きいですが、無駄な情報が混ざると精度が落ちるんです。
室谷代表取締役そう。ROIで考えると、プロンプトに10分かけて品質を上げるほうが、後で修正するより圧倒的に安い。
時給換算したら全然ペイします。
時給換算したら全然ペイします。
effortとモデル選択の最適バランス
テキトー教師.AI認定講師新しいeffortパラメータ、使いこなせてますか?Opus 4.8だとhighがデフォルトで、xhighがコーディングに最適って公式に書いてありますね。
室谷代表取締役あれは結構重要。xhighを使うと推論コストが上がるけど、複雑なタスクでは出力品質が劇的に変わります。
逆に簡単なタスクでhigh固定だとオーバースペックなので、Sonnet 5やHaiku 4.5にモデルを落としてeffort調整するのが賢い。
逆に簡単なタスクでhigh固定だとオーバースペックなので、Sonnet 5やHaiku 4.5にモデルを落としてeffort調整するのが賢い。
テキトー教師.AI認定講師実は最初に高性能モデルから始めて、後でeffortを下げながら最適なバランスを探す方法が公式でも推奨されてますね。僕はクライアントに「一度Opusで理想形を決めて、その後Sonnetでコストダウン」とアドバイスしてます。
室谷代表取締役そのアプローチが一番効率的。特にエージェント的なワークフローではOpus 4.8のxhighが鉄板で、そこからSonnet 5のhighに落とせるかテストする。
料金差は入力$5→$3、出力$25→$15と結構大きい。
料金差は入力$5→$3、出力$25→$15と結構大きい。
定期的なベンチマークと比較の習慣
テキトー教師.AI認定講師モデルは頻繁にアップデートされるので、自分のユースケースでのベンチマークを定期的に取る習慣が大事です。「前より悪くなった」と思ったら、実際に同じプロンプトでテストしてみるのが確実。
室谷代表取締役うちのチームでは毎週金曜に5問の評価問題を流してスコアを記録してます。使うモデルやeffortレベルを変えて一覧にすると、どの設定が最適かひと目でわかる。
数字で見ないと「なんとなく遅い」で終わってしまう。
数字で見ないと「なんとなく遅い」で終わってしまう。
テキトー教師.AI認定講師評価問題は実際の業務から抽出したものがベストです。僕の周りでは「コードレビュー」「要約」「質問応答」の3カテゴリでテストしてる人が多い。
これを続けると、モデル切り替えのタイミングも見極めやすくなりますよ。
これを続けると、モデル切り替えのタイミングも見極めやすくなりますよ。
室谷代表取締役賛成。コスト最適化も同時にできるから、一度仕組みを作っておけば後が楽。
結局、運用の仕組みが差を生むんですよね。
結局、運用の仕組みが差を生むんですよね。
よくある質問
Q1. ClaudeとGPT-4やGeminiの違いは?
室谷代表取締役用途で変わりますね。コード寄りならClaude、マルチモーダルを重視するならGPT-4やGeminiってところです。
最近は各社モデルアップデートで差が縮まっているので、一概に優劣は言えないです。
最近は各社モデルアップデートで差が縮まっているので、一概に優劣は言えないです。
テキトー教師.AI認定講師現場では「これだけはClaude、あれはGPT」と使い分ける人が多いです。一度同じプロンプトで全部試してみると、自分のケースに合うモデルがはっきりしますよ。
Q2. 以前のバージョンに戻す方法はある?
室谷代表取締役APIで一部古いスナップショットが選べる場合もありますが、一般的には戻せません。常に最新版が提供されます。
テキトー教師.AI認定講師どうしても特定の挙動が必要なら、出力を記録してプロンプトで再現させる工夫をする人がいますね。ただ完全再現は難しいです。
Q3. プロンプトの工夫で性能低下をカバーできる?
室谷代表取締役完全には無理ですが、システムプロンプトの設計や例示で結果は安定しやすいです。特に明確な指示と出力フォーマットを指定するのが効果的。
テキトー教師.AI認定講師たしかに、「説明不足で抽象的な回答」が増えたと感じたら、プロンプトに具体例を1つ入れるだけで改善することもあります。基本に戻るのが一番です。
Q4. 性能低下は一時的なもの?永続的?
室谷代表取締役モデルアップデートは継続的に行われ、ある分野で劣化しても別の分野で向上する可能性があります。恒久的な性能低下とは限りません。
テキトー教師.AI認定講師自分の使い方に合わせて、定期的にベンチマークやコミュニティの声をチェックするのがいいですね。気づかないうちに改善されていることもあります。
Q5. 性能低下を感じているユーザーは多い?
室谷代表取締役海外のフォーラムでもよく話題になります。特にコード生成や要約で「以前の方が良かった」という声は一定数ありますね。
テキトー教師.AI認定講師ただ、タスクによって感じ方は違うので、一概に「全体的に落ちた」とは言えないと思います。自分の使う領域で検証するのが確実です。
まとめ
テキトー教師.AI認定講師今回の記事、性能低下の話からモデル比較まで幅広くカバーしましたが、結局「Claudeの実力はまだまだ進化途中」というのが現場の感想です。
室谷代表取締役そうですね。モデルごとの特性を理解して、自分のタスクに合ったものを選ぶのが鉄則です。
劣化を感じたときは、まずプロンプトを見直すことから始めた方がいい。
劣化を感じたときは、まずプロンプトを見直すことから始めた方がいい。
テキトー教師.AI認定講師あとは、価格と性能のバランスも考慮したいところ。最新モデルが必ずしも自分にとって最適とは限らないので、適材適所で使い分けましょう。
室谷代表取締役次のアクションとしては、一度自分の使用パターンをログに取ってみることをおすすめします。どのモデルでどのクエリが最も効率が良いか、データで判断すると無駄が減りますよ。
テキトー教師.AI認定講師それから、公式のアップデート情報にも注目してください。Claudeは頻繁に改善されているので、数週間後にまた試してみると印象が変わることもあります。
室谷代表取締役結局は「使い続けることで自分のベストな設定が見つかる」というのが、経営目線でも現場目線でも共通の結論ですね。
