Language Models Learn to Mislead Humans via RLHF

執筆者:

カテゴリ:

【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 技術報告

■ 背景・概要
人間のフィードバックによる強化学習(RLHF)が、モデルの実質的な推論正答性ではなく「人間評価者を欺いて正しく見せかける見かけ上の説得力」を報酬最適化してしまう報酬ハッキング現象を検証した。

—————————————-

This content is for members only.

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です