Chain-of-Thought(CoT)プロンプティングは、最終回答を出す前に大型言語モデルが中間の推論ステップを明示的に書き出すようにする技術です。Wei et al.(2022)のGoogle論文によって体系的に確認されました:数学問題、論理的推論、常識的推論において、CoTはモデルの精度を大幅に向上させます。
なぜCoTが効果的なのか?LLMのメカニズムから:モデルは既に生成されたものから次の最も合理的なトークンを予測することで各トークンを生成します。モデルが最終回答を直接出力するとき、複雑な問題では推論プロセス全体をわずかなトークンに「圧縮」する必要があり、これはしばしば失敗します。
最もシンプルなZero-Shot CoTは最後に一文追加するだけです:「ステップバイステップで考えてください。」2022年の研究では、GPT-3の数学問題での精度が17.7%から78.7%に向上——この一文だけで4倍以上の向上。
Zero-Shot CoTとFew-Shot CoTの違い、そしていつどちらを使うか。
Zero-Shot CoT:プロンプトに「ステップバイステップで考えて」を直接追加するだけで、推論例を提供しない。最もシンプルな実装;推論を必要とするほとんどのタスクに効果的。
Few-Shot CoT:「ステップバイステップで考えて」と言うだけでなく、完全な推論プロセス(問題+ステップバイステップの推論+答え)を含むいくつかのデモ例も提供する。Zero-Shot CoTが十分でないタスクでは、Few-Shot CoTが通常さらに精度を向上させます。
選択ガイダンス:まずZero-Shot CoTを試す。出力の推論が浅すぎる場合や、精度がまだ不十分な場合は、完全な推論プロセスを含む2〜3つの例を持つFew-Shot CoTに切り替えます。
重要な詳細:Few-Shot CoTのデモでは、推論ステップの品質が数量よりも重要です。
さまざまなシナリオに適した高度なChain-of-Thoughtのバリアント。
Tree of Thoughts(ToT):モデルが複数の異なる推論パスを同時に探索し(ツリーの枝のように)、最も有望なパスを評価して最良のパスを継続する。複数の可能な解決策を持つ問題に適しています。
Self-Consistency CoT:モデルに同じ問題をCoTで複数回解かせ(異なるランダムサンプリングを使用)、最も頻繁に現れる答えを最終答えとして採用する。エラーが許されない重要性の高いタスクに適しています。
Step-Back Prompting:直接解く前に、モデルに「この問題の原理は何か」を考えさせる。研究によると、これにより複雑な問題の精度がさらに10〜20%向上できます。
Claude 4のExtended Thinkingはこれらの技術の組み込み版です:最終回答を生成する前に「思考空間」でより長い内部推論を行います。
実際のClaude使用でのCoTの適用方法、およびいくつかの一般的な誤用パターン。
claude.aiでCoTを使用する:最も直接的なアプローチはプロンプトの最後に「ステップバイステップで考えてから最終答えを出してください」を追加することです。
APIでCoTを使用する:Claude 4シリーズのExtended ThinkingはAPIコールでthinking: {type: "enabled", budget_tokens: 5000}を設定するより直接的なアプローチです。
一般的な誤用パターン:推論を必要としないタスクにCoTを使用する——翻訳、要約、フォーマット変換はCoTを必要とせず、追加するとレイテンシとコストが増加するだけ。Few-Shotのデモの推論ステップが浅すぎる。CoTを万能薬として扱う。
あなたの実際の使用との関係:正確な推論が必要なタスク(複雑な分析、数学計算、論理的判断)をしている場合、「ステップバイステップで考えて」を追加すると通常ほぼコストなしでClaudeの回答精度が20〜50%向上します。
法務アナリストが特定の法的要件を満たしているかどうかを判断する必要がある——専門的な判断タスクでのCoTの実際の効果を示す:
CoTなし:「以下の契約条項はGDPR第6条の適法性要件を満たしていますか?[条項を貼り付け]」 → Claudeは「はい」または「いいえ」と直接言うかもしれませんが、十分な推論プロセスなしに;アナリストは信頼性を評価できません。
CoTあり:「以下の契約条項がGDPR第6条の適法性要件を満たしているかどうかをステップバイステップで分析してください。分析ステップ:1. 関与する個人データ処理活動を特定する;2. GDPR第6条の6つの法的根拠を確認する;3. どの法的根拠が適用される可能性があるかを一つずつ判断する;4. 条項の具体的な文言がその法的根拠の要件を十分に満たしているかを評価する;5. 結論と信頼度を提示する。」
この例はCoTの専門的判断タスクでのコアバリューを示しています:回答をより正確にするだけでなく、推論プロセスを「監査可能」にすること。
Chain-of-Thoughtのコアなトレードオフ:精度 vs 速度とコスト。CoTを有効にすると、モデルはより多くのトークン(中間推論ステップ)を生成し、より多くの出力トークンコスト(通常2〜5倍)とより長い応答時間を意味します。高精度が必要なほとんどのタスクでは、このコストは価値があります——精度を40%から80%に向上させるために0.01ドル追加して2秒多く待つことは非常に有利な交換です。CoTを使う価値がないシナリオ:単純な事実クエリ、創造的な生成タスク、極端な速度要件を持つリアルタイムアプリケーション。ベストプラクティス:本当に推論が必要なタスクにのみCoTを有効にし、他のタスクには直接的な回答を維持します。