Google Gemini / 公式ブログ / 2026/07/15 / 通常
拡散モデルが学習データを越えて新しい画像を作る仕組み
公式ブログ原文
Google Researchは、拡散モデルが訓練画像をそのまま再現するだけでなく、学習データにない画像を生成できる理由を、スコア関数の平滑化という観点から分析しました。生成結果の新しさを、単なるランダム性ではなく学習時の正則化と結びつけています。
要点
- 訓練データへ完全適合したスコアは記憶に近づきますが、平滑化されたスコアはデータ点の間を補間します。
- Weight decay、AdamW、ReLUなど、通常の学習で使われる明示的・暗黙的正則化が平滑化を生みます。
- データ多様体に沿う方向と離れる方向では学習速度が異なり、品質と新規性が両立する過程を説明できます。
今回のブログ記事で語られていること
記事が問うのは、有限の訓練画像から学んだモデルが、なぜ見たことのない画像を作れるのかです。拡散モデルはノイズを加えたデータ分布の勾配であるスコアを学び、ノイズから段階的に画像を復元します。理論上、訓練データに完全適合したスコアを使えば、生成は元のデータ点へ引き戻され、結果は記憶した標本に近づきます。しかし実際の学習では、有限のモデル容量、Weight decay、AdamW、ReLUネットワークの性質などが完全適合を妨げます。Google Researchは、この不完全さを欠陥ではなく、近接するデータ点の間へ滑らかなベクトル場を作る正則化として扱います。
説明の出発点は、1次元上のプラス1とマイナス1という二つの点です。完全なスコアは各点へ鋭く戻りますが、平滑化すると両者の間にも確率の流れができ、訓練点そのものではない標本を生成できます。高次元の画像では、データが存在する低次元の多様体を考えます。多様体から外れる法線方向ではスコアが比較的早く正しい面へ戻す一方、多様体に沿う接線方向では訓練点ごとの細部への収束が遅くなります。その時間差により、画像らしさを保ちながら、個々の訓練画像を複製しない生成が可能になるという整理です。
研究は、創造性を人間と同じ意味で証明したものではありません。ここで測っているのは、訓練標本からの距離と生成品質が両立する仕組みです。また、単純化した理論から大規模モデルの全挙動を説明できるわけではなく、モデル容量、最適化、データ重複、条件付けの影響は追加検証が必要です。それでも、過学習を避けるための正則化が、汎化だけでなく生成の新規性にも直接つながるという見取り図は、記憶検査やデータ設計を考える基礎になります。
今回のブログ記事が関係する人
画像生成モデルの研究者、学習データ重複や記憶を評価する安全・プライバシー担当、生成品質と新規性の両方を測るMLエンジニアに関係します。
結局、今回のブログ記事をどう読むべきか
「創造性」という語を性能宣伝として受け取るのではなく、正則化が記憶と新規性の境界をどう変えるかを示す理論研究として位置づけられます。実運用では最近傍検索などの記憶検査と品質評価を併用する必要があります。