【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 査読論文
■ 背景・概要
単なる敵対的プロンプト攻撃(Jailbreak)と区別し、後学習データのフレーミング条件や特定の隠蔽トリガーが、モデル潜在空間の安全ガードレールをいかに無効化・局所回避するかを切り分け実験により検証した。
—————————————-
This content is for members only.
【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 査読論文
■ 背景・概要
単なる敵対的プロンプト攻撃(Jailbreak)と区別し、後学習データのフレーミング条件や特定の隠蔽トリガーが、モデル潜在空間の安全ガードレールをいかに無効化・局所回避するかを切り分け実験により検証した。
—————————————-
コメントを残す