LLMのeffort設定とは? Maxが最適とは限らない理由をベンチマークで解説

 

はじめに

【エンジニア募集中】フルリモート可◎、売上/従業員数9年連続UP、平均残業8時間、有給取得率90%、年休124日以上 etc.  詳細はこちらから>

生成AIを使っていると、lowmediumhighmax などの effortreasoning effort/推論レベル) を設定できるモデルがあります。

Claude Codeなどを使っていると、
精度を重視するなら、とりあえずMaxにしておけばよいのでは?
と思うかもしれません。

しかし実際には、effortを高くしても必ず精度が上がるとは限りません
今回は、effortとは何なのか、ベンチマーク結果を見ながら「なぜMaxが常に最適ではないのか」を解説します。

 

LLMeffortreasoning effort)とは?

effortは、モデルが回答までにどの程度の推論リソースを使うかを調整する設定です。
OpenAIでは reasoning.effortClaudeでは effort といった形で提供されています。

effortを高くすると、
 ・複数の解法を検討する
 ・自分の判断を再確認する
 ・複雑な問題を段階的に考える
といったことがしやすくなります。

その一方で、処理時間やトークン消費量、コストも増える傾向があります。
つまりeffortは、単純な「AIの賢さ設定」ではなく、モデルにどれだけの推論予算を与えるかを決める設定と考えると分かりやすいでしょう。

 

effortを上げれば精度も上がる?

ARC Prizeが公開しているGPT-5.6 Solのベンチマーク結果を見てみます。

effort

ARC-AGI-1

ARC-AGI-2

ARC-AGI-3

Low

74.5%

42.5%

0.33%

Medium

92.5%

67.1%

1.07%

High

97.0%

85.4%

2.15%

XHigh

97.5%

90.0%

6.99%

Max

96.5%

92.5%

7.78%

 ARC-AGI-2ARC-AGI-3ではMaxが最も高い一方、ARC-AGI-1では、
 ・XHigh:97.5%
 ・Max:96.5%
となっており、MaxよりXHighのほうが高い結果になっています。
同じモデルでも、タスクが変われば最適なeffortも変わることが分かります。
もちろん、1ポイント程度の差だけを見て「XHighのほうがMaxより優秀」と断定することはできません。LLMの出力やベンチマークには一定のばらつきがあります。
重要なのは、effortを高くすれば性能が必ず単調に上昇するわけではないという点です。

 

なぜeffortを高くすると精度が下がる? 過剰思考(Overthinking)とは

こで疑問になるのが、より長く考えられるなら、なぜ精度が下がることがあるのか?という点です。
重要なのは、effortを高くすることは「正しい推論をそのまま丁寧にする」ことではないということです。
effortが高くなると、モデルには追加で検討・探索する余地が生まれます。
最初の判断が間違っていれば、 誤った判断再検討矛盾を発見正解 と修正できる可能性があります。
一方、すでに正解にたどり着いていた場合でも、 正しい判断さらに検討別の可能性を探索誤った判断へ変更 となることがあります。
このように、必要以上に検討を続けることで、無関係な情報に影響されたり、問題を複雑に解釈したりする現象は 過剰思考(Overthinking と呼ばれることがあります。
つまり追加の推論には、間違いを修正する効果と、新しい間違いを生み出す可能性の両方があります。
そのため、 effortを増やす = 正解率が上がる ではなく、 正解を見つけ直す機会と、間違った方向へ進む機会の両方が増える と考えるほうが実態に近いでしょう。

 

Claude Codeではどのeffortを使えばいい?

Claude Codeなどを使う場合も、常に最大のeffortを選ぶ必要はありません。
例えば、
 ・軽微なコード修正
 ・既存コードの説明
 ・単純な調査
では、MediumHighでも十分な場合があります。
一方で、
 ・原因の分からないバグ調査
 ・複数ファイルにまたがる修正
 ・複雑な設計判断
 ・大規模なリファクタリング
などでは、より高いeffortが役立つ可能性があります。
普段行っている作業で複数のeffortを試し、回答の質・処理時間・トークン消費量を比較してみるのがおすすめです。
選ぶべきなのは「常に最も高いeffort」ではなく、そのタスクに合ったeffortです。

 

まとめ

LLMeffortは、単純な「AIの賢さ設定」ではありません。 

モデルにどこまで推論させるかを決める予算であり、推論量を増やせば間違いを修正できる可能性が高まる一方、Overthinkingによって不要な探索を行い、新しい間違いを生む可能性もあります。

そのため、Claude Codeなどを利用するときも「とりあえずMax」にするのではなく、タスクの難易度に合わせてeffortを使い分けることが重要です。

「どのモデルを使うか」だけでなく、「そのモデルにどこまで考えさせるか」も意識する。

これが、Reasoning Modelを効率よく使ううえで重要なポイントになりそうです。

【エンジニア募集中】フルリモートも◎(リモート率85.7%)、平均残業8時間、年休124日以上、有給取得率90% etc. 詳細はこちらから>

Smallitのサービス