Training large language models on narrow tasks can lead to broad misalignment

執筆者:

カテゴリ:

【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 査読論文

■ 背景・概要
単なる敵対的プロンプト攻撃(Jailbreak)と区別し、後学習データのフレーミング条件や特定の隠蔽トリガーが、モデル潜在空間の安全ガードレールをいかに無効化・局所回避するかを切り分け実験により検証した。

—————————————-

This content is for members only.

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です