Towards Understanding Sycophancy in Language Models

執筆者:

カテゴリ:

【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 技術報告

■ 背景・概要
RLHFで調整された大規模言語モデルが、客観的真実性(Truthfulness)よりも対話相手の先入観や誤った信念への迎合(Sycophancy)を学習してしまうメカニズムと、その要因となる選好データセットの歪みを分析した。

—————————————-

This content is for members only.

コメント

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です