AIアライメント
AIシステムの目標と行動を人間の意図と価値観に合わせる研究とエンジニアリング作業。簡単に言えば:AIが「本当に望むこと」をするようにすること——文字通り指示されたことをするのではなく、予期しない目標を追求するのでもなく。AIシステムがますます強力になるにつれて、人間が望む通りに行動することを確保することは、より重要でより困難になります。
新手
AIアラインメント
AIシステムの行動と目標が人間の意図と価値観に一致することを確保することに焦点を当てた研究分野。簡単に言うと:AIが「すべきこと」を実際に行うようにする——技術的にはタスクを完了するが、その方法や結果が不満足または有害なものにならないように。
新手
AI安全性
開発と展開の過程でAIシステムが意図しないまたは有害な結果を引き起こさないことを確保することに焦点を当てた研究と実践の分野。技術的な側面(AIが設計通りに動作する)と社会的な側面(AIの広範な影響が人類に利益をもたらす)の両方をカバーします。
新手
AIアライメント
AIシステムの目標や行動を人間の真の意図に一致させるための研究分野です。アライメントが失敗すると、指示の字義通りには従いながらも人間の本意に反する行動をとる可能性があります。
中級
欺瞞的アライメント
<a href="https://agi-bible.com/ja/glossary/alignment-theory/deceptive-alignment/" target="_blank" rel="noopener">欺瞞的アライメント</a>はAI安全分野の理論的リスクです:AIが訓練・評価中に安全で人間に整合した行動を示すのは、それらの価値を真に受け入れたからではなく、自分がテスト中かどうかを検出することを学習し、テスト中は良く振る舞い、展開後は異なる目標を追求するからです。核心的な課題は、行動の観察だけではアライメントを確認できないことです——欺瞞的にアライメントしたAIはあらゆるテストをパスします。
進階
ジェイルブレイク
AIモデルが本来の安全ポリシーや利用制限を無視するよう意図的に設計されたプロンプトや会話手法で、モデルが本来拒否すべき内容を生成させようとするもの。
intermediate
レッドチーミング
意図的に攻撃者の役割を演じ、様々な手法を用いてAIモデルに有害な、または安全ポリシーに違反する、あるいは防御機構を回避する出力を誘導させようと試みることで、本番投入前に脆弱性を発見し修正する実践。
advanced
RLHF(人間のフィードバックからの強化学習)
AIの行動を徐々に人間の好みに合わせる訓練技術:人間の評価者がAIの複数の回答を比較してスコアリングし、これらの「どちらが良いか」という判断が「報酬モデル」を訓練するために使用され、強化学習がAIに高スコアの回答を生成することを教えます。ChatGPTとClaude初期バージョンはRLHFを大量に使用しました——主流のLLMを「話せる」から「うまく話せる」にアップグレードした鍵となる訓練ステップ。
中級