安全性
ジェイルブレイクとは?
別名: Jailbreak / 脱獄
AIの安全装置を巧妙な指示で突破する行為。
⚡ 30秒でわかる
ジェイルブレイク の主なポイント
- 1 ジェイルブレイクとは、巧妙な指示でAIの安全装置を回避し、禁止された出力を引き出す行為のこと。
- 2 「DANになりきって」のようなロールプレイや、口実の捏造で制限を外そうとするのが典型的な手口。
- 3 利用者がAIの安全制限自体を外す点で、外部コンテンツに命令を隠すプロンプトインジェクションとは異なる。
- 4 各社が対策しても新しい抜け道が次々見つかり、攻撃と防御のいたちごっこが続いている。
- 5 業務でAIを使う際は、ジェイルブレイクを社内ガイドラインで明確に禁止しておくのが安全。
📖 詳しく
ジェイルブレイク とは
ジェイルブレイク(Jailbreak/脱獄)とは、AIに組み込まれた安全装置を、巧妙な指示文(プロンプト)で回避し、本来は断るはずの有害・禁止された出力を引き出す行為のことです。
なぜ重要かというと、ChatGPT や Claude などの生成AIは「危険な質問には答えない」よう訓練されていますが、その制限は完璧ではなく、言い回し次第で破られてしまうからです。放置すると、爆発物の作り方や差別的な文章、マルウェアのコードなどが流出するリスクにつながります。
代表的な手口が「DAN(Do Anything Now=何でもできるAIになりきって)」のように架空のキャラクターを演じさせるロールプレイ型や、「研究目的だから」と理由をでっち上げる型です。身近な例えでいうと、「これはゲームの設定だから」と言い聞かせて、ふだんはルールを守る相手にうっかり禁止事項を口にさせるようなイメージです。
混同されやすいのがプロンプトインジェクションで、ジェイルブレイクは利用者自身がAIの“安全制限そのもの”を外そうとする行為、プロンプトインジェクションは外部のWebページや添付ファイルに隠した命令でAIを操る攻撃、という違いがあります。各社が対策を強化していますが完全には防げず、攻撃と防御のいたちごっこが続いているため、業務利用では社内ガイドラインで明確に禁止しておくべき項目です。
❓ FAQ
よくある質問
- Q. ジェイルブレイクとは?
- A. AIに組み込まれた安全装置を、巧妙な指示文で回避し、本来は断るはずの有害な出力を引き出す行為です。架空のキャラクターを演じさせたり、もっともらしい理由をでっち上げたりして、AIの制限を外そうとする手口が知られています。
- Q. ジェイルブレイクとプロンプトインジェクションの違いは?
- A. ジェイルブレイクは、利用者自身がAIの安全制限そのものを外そうとする行為です。一方プロンプトインジェクションは、外部のWebページや添付ファイルに隠した命令でAIを操る攻撃を指します。重なる部分もありますが、誰がどこから仕掛けるかが違います。
- Q. スマホの脱獄(jailbreak)と同じ意味?
- A. 言葉の由来は同じ「脱獄」ですが、対象が違います。スマホの脱獄は端末のOS制限を解除することを指し、AIのジェイルブレイクはAIモデルの安全制限を指示文で回避することを指します。
- Q. 初心者が気をつけるべきことは?
- A. 面白半分でも、AIに有害な出力をさせようとする行為は規約違反やアカウント停止につながり得ます。業務利用なら社内ガイドラインで禁止を明文化し、機密情報をAIに渡さない運用とあわせて管理するのが安全です。
安全性 カテゴリの用語