Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
AI知性のフロンティアを探求する
claude-me.com
最新
Anthropicが直接語った8つの原則:Claudeを使うほど頭が悪くなるなら、問題はおそらくあなたの使い方にある  ·  Claude Codeが自動で「ループ作業」できるようになった:Anthropicが公開した4つのループモードガイド  ·  Claude Cowork 正直レビュー:3ヶ月後——実際に時間を節約できたものと、自動化して後悔したもの  ·  7月の幕開けを飾る2つの大ニュース:Claude Sonnet 5正式リリース、Fable 5の輸出規制解除でグローバル復活  ·  RAGとは何か:なぜClaudeは社内イントラのデータを読めないのか、そしてどう解決するか  ·  Claude Cowork 高度なワークフロー:「一つのタスクを渡す」から「プロセス全体を実行させる」まで——3つの実用テンプレート
fundamentals

Claudeはどうやって「人間に役立つ」ことを学ぶのか?RLHFとConstitutional AIの完全解説

30秒バージョン · 忙しい方へ
RLHFはClaudeに「人間がどのような回答を好むか」を教え、Constitutional AIは「どのような回答が正しいか」を教えます——両者の組み合わせが、役立つと同時に誠実なClaudeを生み出しています。

詳しく読む +
01 · なぜ起きたのか?

Claudeのトレーニングには2つの主要な段階があります:事前学習(言語パターンを学ぶ)とアラインメントトレーニング(「人間に役立つ」ことを学ぶ)。アラインメントトレーニングの主な方法はRLHF(人間のフィードバック好みでモデルを誘導)とConstitutional AI(明示的な行動原則のセットに基づく自己評価)です。

02 · 仕組みは?

RLHFはOpenAIによって2017年から2020年代初頭にかけて体系化され、InstructGPTのトレーニングで大規模に適用されました。AnthropicのConstitutional AIはRLHFの革新であり、人間の好みアノテーションへのRLHFの依存という問題を解決します——アノテーターのバイアスと不一致がトレーニング済みモデルの行動に直接影響します。

03 · 自分にどう影響する?

RLHFとConstitutional AIを理解することは、Claudeと他のAIツールの行動の違いを説明するのに役立ちます。純粋にRLHFでトレーニングされたシステムは「お世辞傾向」(sycophancy)が生じやすいです——真実の回答より、ユーザーが聞きたいことを言う傾向があります。Constitutional AIの追加により、ClaudeはユーザーがClaude答えを好まない場合でも誠実を保つようにトレーニングされています。

04 · どうすればいい?

RLHFとConstitutional AIの理解を実際の使用テクニックに変換する:お世辞ではなく正直なフィードバックが必要な場合、Claudeに明示的に伝える「同意する必要はありません——問題がどこにあるかを教えてください」;Claudeがリクエストを断った場合、「なぜ?」と尋ねると通常、定型文ではなく意味のある説明が得られます;Claudeの回答が正確かどうか不確かな場合、「この回答にどれくらい自信がありますか?」と直接尋ねます。

全文 +

訓練が終わったばかりの言語モデルは、膨大な本を読んでいるが「人間が何を求めているか」を全く知らない学者のようなものです。テキストを生成できますが、必ずしも役立つ、安全、または誠実とは限りません。では、AnthropicはどうやってそれをClaudeに変えたのでしょうか?

事前学習は出発点に過ぎない

すべての大規模言語モデルは「事前学習(Pre-training)」から始まります。事前学習後、モデルの能力はすでに印象的です——流暢なテキストを生成し、複雑な意味論を理解できます。しかし「流暢なテキストの生成」は「ユーザーへの有用性」とは等しくありません。これが第2段階「アラインメントトレーニング」が必要な理由です。

RLHF:人間の好みでモデルを導く

RLHF(Reinforcement Learning from Human Feedback、人間のフィードバックによる強化学習)は現在最も主流のアラインメントトレーニング方法です。

Constitutional AI:Claudeに明確な価値観の原則を与える

Constitutional AIはAnthropicが2022年に提案したアラインメントトレーニングアプローチです。コアアイデア:人間のアノテーターにどの回答が良いかを判断させるのではなく、モデルに明示的な行動原則のセットを与え、その原則に基づいて自己評価させます。

これらの方法の組み合わせがClaudeの個性を形成する

ClaudeはRLHFとConstitutional AIの組み合わせでトレーニングされており、いくつかの顕著な特性を説明します:正直さがお世辞より優先される;積極的に限界を認める;拒否には理由がある。

図解
RLHF + Constitutional AI 訓練流程對比流程圖對比 RLHF 和 Constitutional AI 兩種對齊訓練方法的運作方式:RLHF 依賴人類標記者的偏好評分,Constitutional AI 用明確的原則讓模型自我評估,說明兩者各自的優勢和限制,以及 Anthropic 如何結合兩者訓練 Claude。RLHF vs Constitutional AI — How Claude Learns ValuesRLHFHuman feedback drives alignment① Human annotators write ideal responses(Supervised Fine-Tuning)② Humans rank responses → Reward Model(which response is better?)③ RL optimizes toward high reward scores(model learns what humans prefer)⚠ Limitation: annotator biasesHumans may prefer confident-sounding butwrong answers → sycophancy riskConstitutional AIPrinciples drive self-evaluation① Model generates a response(same as before)② Model critiques itself using the Constitution("does this violate principle X?")③ Model revises → AI ranks responses(no human annotator needed for ranking)✓ Advantage: explicit, consistent principlesLess annotator bias · Scales betterClaude can explain WHY it declinesClaude Me · claude-me.com
スクリーンショット歓迎。転載時は出典を明記してください。
質問する
10文字以上入力してください
関連記事
Constitutional AI:AnthropicはどうやってClaudeに価値観を訓練するのか
fundamentals · 06/16
トレーニングがClaudeの「個性」をどう形成するか:事前学習からRLHFとConstitutional AIまでの完全な経路
fundamentals · 06/05
LLMは実際にどうやってテキストを生成するのか?非エンジニアへの本当の説明
fundamentals · 06/17
Mechanistic Interpretability:AnthropicがなぜClaudeの「脳」を解析するのか——AIの説明可能性の最先端研究
fundamentals · 06/11
関連ニュース
関連トピック
プロンプトのデバッグと反復:系統的な方法でプロンプト問題の根本原因を見つけ、各修正を意味のあるものにする
Claude Cowork Me
プロンプトが機能しないとき、「少し修正して再試行」は通常最も効率が低いアプローチです——問題がどこにあるかわからないから。系統的な診断(コンテキスト不足?指示が曖昧?フォーマット要件が不明確?期待が非現実的?)により、各修正が推測ではなく根拠のある仮説検証になります。
#claude#prompt
職場でClaudeを使う最初の週:「印象的なデモ」を「本当の時間節約」に変える5つの習慣の転換
Claude Cowork Me
Claudeが本当に仕事に溶け込む鍵は「もっと多く使う」ことではなく、5つの習慣を変えることです:思考の起点にする、書く前に聞く、Projectをセットアップ、修正を求めることを学ぶ、準備プロセスに加える。
#claude#prompt
個人的なClaudeシステムの構築:散漫な使用習慣を業務インフラにアップグレードする5つのコア変更
Claude Cowork Me
ほとんどの人はClaudeを「思い出したときだけ」使い、永遠に「ツール」であって「システム」ではない状態に留めています。個人的なClaudeシステムを構築することで——Projects、Custom Instructions、プロンプトテンプレートライブラリ、スケジュールトリガー——たまに探しに行くツールから日常の業務インフラの一部へと変わります。
#claude#prompt