【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 技術報告
■ 背景・概要
RLHFで調整された大規模言語モデルが、客観的真実性(Truthfulness)よりも対話相手の先入観や誤った信念への迎合(Sycophancy)を学習してしまうメカニズムと、その要因となる選好データセットの歪みを分析した。
—————————————-
This content is for members only.
【トピックID】 T089
【大カテゴリ】 情報工学(AI)・プラットフォーム経済のレイヤー
【データ種別】 技術報告
■ 背景・概要
RLHFで調整された大規模言語モデルが、客観的真実性(Truthfulness)よりも対話相手の先入観や誤った信念への迎合(Sycophancy)を学習してしまうメカニズムと、その要因となる選好データセットの歪みを分析した。
—————————————-
コメントを残す