The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

執筆者:

カテゴリ:

【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 技術報告

■ 背景・概要
ジェンダーや人種等のステレオタイプ排除を目的とした安全調整(Instruction Tuning)が、文脈中に明確な客観的証拠・事実が明記されている正当な推論まで誤って差別的とみなして拒絶・検閲してしまう「誤発火」を定量化した。

—————————————-

This content is for members only.

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です