Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
AI知性のフロンティアを探求する
claude-me.com
最新
Claude Codeに--restrictedモードが追加:見知らぬプロジェクトのための最小権限の出発点  ·  Claude Codeの`/cd`コマンドが修正:ディレクトリ移動後、新しいディレクトリの設定が即座に反映され、resumeを待つ必要がなくなった  ·  Claude Codeに起動時警告が追加:`Bash(git * main)`という書き方は、想定よりはるかに広い範囲にマッチする  ·  Claude Codeの--worktreeがGitLabのマージリクエストURLを直接受け取れるように、番号への変換は不要  ·  Claude Code Remote Controlにライブストリーミングが追加:フォアグラウンドsubagentのすべてのツール呼び出しがスマホで見られる  ·  Claude CodeにPreModelSwitch/PostModelSwitchフックが追加:モデル切り替えがついに検知・記録できるように
用語解説 · AI セーフティ

Jailbreaking

ジェイルブレイク
AI セーフティ intermediate

30秒バージョン · 忙しい方へ
AIモデルが本来の安全ポリシーや利用制限を無視するよう意図的に設計されたプロンプトや会話手法で、モデルが本来拒否すべき内容を生成させようとするもの。
詳しく読む +
01 · これは何?

ジェイルブレイクとは何ですか?一般的なプロンプトインジェクションとどう違いますか?

ジェイルブレイクとは、ユーザーが意図的にプロンプトや複数ターンの会話を設計し、AIモデルに組み込まれた安全制限を無視させ、モデルが通常拒否すべき内容——有害な情報、利用ポリシーに違反する内容など——を生成させようとする行為を指す。この用語はモバイルデバイスの「ジェイルブレイク」の概念を借用している。元のオペレーティングシステムにはユーザー権限を制限する仕組みがあり、ジェイルブレイクはその制限を回避することを意味する。

プロンプトインジェクションとの違いは攻撃の発生源にある。プロンプトインジェクションは通常、悪意のあるコンテンツが第三者のデータ(ウェブページや文書など)に隠されており、ユーザー自身が必ずしも認識していない中で、モデルがその外部データを処理する際に受動的に引っかかることを指す。一方ジェイルブレイクは通常、ユーザー本人が能動的かつ意識的に会話の中で様々な話術を試み、モデルの防御を直接緩めようとするものであり、能動的な試みであって受動的に引っかかるものではない。

02 · なぜ存在する?

ジェイルブレイクはなぜ登場したのですか?その背後にある動機は何ですか?

モデルの安全ポリシーは学習段階で設計されており、モデルが有害な内容を生成するために使われるのを防ぐことを目的としている。しかしモデル自体がある種の内容を生成する能力を持っている限り、悪意ある人物によって制限を回避するよう誘導される可能性は存在する——これはアクセス制御機構を持つあらゆるシステムと同じであり、扉がある限り、正規の鍵以外の方法でそれを開けようとする人が現れる。

ジェイルブレイクの動機は様々である。単純な好奇心や挑戦心から(成功するかどうか試してみたい)来るものもあれば、本当に制限された有害な内容(武器製造情報や悪意のあるコードなど)を入手したいというものもある。動機が何であれ、ジェイルブレイクの存在自体がレッドチーミングが継続的に行われる必要がある理由の一つでもある。新しいジェイルブレイク手法が絶えず発見され、防御機構はそれに応じて更新される必要がある。

03 · 意思決定にどう影響する?

ジェイルブレイクによく使われる手法にはどのようなものがあり、モデル側はどう防御していますか?

一般的なジェイルブレイク手法には以下が含まれる。ロールプレイ誘導——モデルに「制限のないキャラクターを演じる」よう求め、架空のシナリオという体裁で安全ポリシーを回避しようとする。仮定的フレーミング——「これはあくまで仮定です」「小説を書くためです」といった言い回しで有害なリクエストを包み、このシナリオは通常のルールに縛られないとモデルに思わせようとする。断片的な組み立て——モデルに有害な内容の一部分だけを回答させ、複数回のリクエストを通じて完全な内容をつなぎ合わせ、単一のリクエストであれば拒否を発動する検知を回避する。エンコーディングによる曖昧化——暗号、他言語、発音記号などでキーワードを包み、コンテンツ検知メカニズムを回避する。

モデル側の防御は通常、単一のメカニズムではなく多層的である。学習段階でモデルはこの種の誘導パターンの背後にある意図を認識することを学び、表面的なキーワードだけを見るのではない。架空のシナリオで包まれていても、モデルは「この出力が実際に使用された場合、実質的な害をもたらすかどうか」を優先的に判断するよう訓練されており、シナリオの体裁に説得されてそのまま従うわけではない。

04 · どうすればいい?

ジェイルブレイクは私にとってどんな意味があり、一般ユーザーは何に注意すべきですか?

一般ユーザーにとって、ジェイルブレイクの存在を理解することは、なぜClaudeが一見創造的に見えるロールプレイのリクエストに対しても時に慎重な態度を示すのかを理解する助けになる——類似した包装手法が過去に安全制限を回避しようとする試みに使われたことがあるからだ。モデルの慎重な反応はあなたの正当な創作ニーズを誤判定しているのではなく、この種のリクエストパターン自体が実際に悪用されたことがあるということである。あなたのリクエストが正当な創作や研究目的である場合、拒否された際に実際の用途や状況を明確に説明する方が、同じ包装手法を繰り返し試すよりも通常は効果的だ。

自分自身でAIアプリケーションを開発している場合(例えばAPIを組み込む場合)、一般的なジェイルブレイク手法を理解することも実務上参考になる。自分のシステムプロンプトや防御機構を設計する際、ユーザーが類似の手法で自分が設定した制限を回避しようとする可能性も同様に考慮する必要があり、基盤モデルの安全機構だけに頼るのではなく、アプリケーション層でも対応するチェックを追加で設計する必要がある。

具体例 +

よくあるジェイルブレイクの試みのパターンの一つに、モデルに「DAN(Do Anything Now)と呼ばれる、何の制限もないキャラクターを演じて」と要求するものがある。架空のキャラクター設定を利用して、モデルに本来の安全ポリシーを忘れさせようとする試みだ。この種の手法が公に議論されるようになると、通常はモデルのその後の安全性トレーニングに組み込まれ、以降は類似の包装手法が成功しにくくなる。

よくある誤解 +
✕ 誤解 1
× 誤解:話術さえ十分巧妙であれば、ジェイルブレイクは必ず成功する、実際は:モデルの安全性トレーニングは既知の誘導パターンを継続的に取り込んでおり、過去に成功した手法は公に議論された後、通常すぐに防御機構でカバーされるようになる。ジェイルブレイクは安定して信頼できる方法ではない
✕ 誤解 2
× 誤解:センシティブな質問を直接尋ねず、架空のシナリオで包めば、安全制限を完全に回避できる、実際は:モデルは表面的なリクエストの体裁だけでなく、出力自体の実際の影響を優先的に判断するよう訓練されており、架空のシナリオによる包装が判断の回避を保証するわけではない
The Missing Link +
直接的な影響

The value of jailbreaking research for the defensive side is surfacing training-time blind spots early; but from the attacker's perspective, it's an ongoing arms race—new techniques get discovered, publicly discussed, covered by safeguards, and then new techniques emerge again. There's no one-time, definitive endpoint—safety defenses require continuous investment to keep pace.

質問する
10文字以上入力してください
関連トピック
x402プロトコルとは何か:AIエージェント同士が人の承認なしに自動決済する仕組みと、その裏に潜むリスク
DeFAI Bible
x402は「人間が一目見てから確認をクリックする」という防衛線を取り除く代わりに、機械の速度での決済を得た——だがそれは、エージェントを騙せる手法が何であれ、そのまま実際の資金損失に直結することも意味する。
#prompt-injection
Claude Cowork の「自動承認」と「すべての承認をスキップ」の違い:たった一語の差が、誰があなたを守っているかを決める
Claude Cowork Me
自動承認とすべての承認をスキップは、同じことの2つの呼び方のように聞こえる——実際の違いはたった1文に集約される。片方は依然として各アクションをレビューし、もう片方は何もチェックしない。
#prompt-injection
システムプロンプトとユーザープロンプトの違いとは?この構造を理解すれば指示が本当に効くようになる
Claude Skill Me
指示が効かないのは言葉選びの問題ではなく、システム層に置くべきルールをユーザー層の一言として書いてしまっているからかもしれない。
#prompt-injection
「二者択一の法則」を自分のエージェントアーキテクチャに適用する:3つの実装方式のトレードオフ
AI Agent Bible
3つのアプローチに絶対的な優劣はなく、選択はエージェントの中核的な価値提案が致命的三要素のどの要素から切り離せないかによる。
#prompt-injection