AWS Bedrock / 公式ブログ / 2026/07/06 / 重要
Amazon Nova、過剰拒否を抑える選択的な忘却手法rDPOを導入
公式ブログ原文
AWSは、Amazon NovaのCustomizable Content モデレーション Settingsに使う選択的な忘却手法Reverse Direct Preference Optimizationを紹介しました。
要点
- rDPOは、特定領域で学習された拒否傾向を弱め、過剰な回避を減らすことを狙います。
- 全体のモデル品質を保ちながら、安全挙動の一部を選択的に調整します。
- 利用者が同様の選好最適化を実験するための考え方も示しています。
今回のブログ記事で語られていること
安全調整されたモデルは、有害でない質問まで拒否する過剰拒否を起こすことがあります。特定業界や利用場面では、一般向けの安全境界が必要以上に厳しく、正当な分析や創作を妨げる場合があります。rDPOは、安全調整で獲得した拒否傾向のうち対象部分を弱め、許可すべき回答を増やすための選好最適化手法として説明されています。
「忘却」という表現から、学習データや知識を完全に削除する技術と誤解しないことが重要です。記事の中心は、特定入力に対する応答方針を調整し、過剰拒否を減らすことです。モデル内部から特定情報が消えたことや、プライバシー上の削除要求を満たしたことを直接保証するものではありません。用途ごとに、何を忘れたと呼ぶのかを明確にする必要があります。
安全境界を弱める評価では、目的の正当な回答が増えたかだけでなく、隣接する有害要求への応答が増えていないかを測ります。対象領域、言い換え、多言語、複数ターン、道具利用を含む試験を行い、一般能力、事実性、拒否精度を更新前後で比較します。平均値だけでは、小さな利用者群やまれな危険入力での悪化を見落とすため、分類別の結果が必要です。
独自実験へ応用するチームは、学習データの出所、評価データとの重複、変更版の識別、展開範囲、元のモデルへ戻す条件を管理します。コンテンツ調整を製品の管理画面へ公開する場合も、利用者が自由に安全境界を外せる設計にはせず、用途、権限、監査、地域の規則を合わせて制御してください。
評価結果は、許可回答と拒否回答の件数だけでなく、判断理由、入力分類、モデル版と一緒に保存します。運用中に危険な応答が増えた場合は、対象設定だけを戻せる展開単位と停止条件を用意してください。
今回のブログ記事が関係する人
モデルの安全調整を研究するチーム、過剰拒否を評価する製品担当、生成AIの利用方針を管理する責任者に関係します。
結局、今回のブログ記事をどう読むべきか
安全性を単純に弱める話ではなく、拒否の対象をより精密に調整する研究です。「忘却」を知識削除と同一視せず、対象外の危険性と一般品質を同時に評価する必要があります。