Los modelos de difusión pueden producir imágenes y otros datos que no aparecen de forma exacta en sus conjuntos de entrenamiento. Esta capacidad para generar resultados nuevos suele describirse como una forma de creatividad, pero su origen continúa siendo una cuestión relevante para comprender mejor cómo funcionan estos sistemas.
Una investigación de Google Research propone una explicación matemática: la novedad surge porque las redes neuronales no aprenden una versión perfecta de la función que guía la generación. En su lugar, aprenden una representación suavizada que permite interpolar entre los ejemplos de entrenamiento y producir nuevos puntos dentro de la estructura de los datos.
Del ruido a una imagen reconocible
El entrenamiento de un modelo de difusión comienza con datos reales, como fotografías, que se degradan progresivamente mediante la incorporación de ruido hasta volverse irreconocibles.
El modelo aprende después a invertir ese proceso. Su tarea consiste en eliminar el ruido paso a paso hasta reconstruir un resultado realista. Este procedimiento se conoce como denoising.
La generación parte, por tanto, de ruido aleatorio. A lo largo del proceso, una función aprendida a partir de los datos de entrenamiento determina la dirección en la que debe transformarse cada punto. Esta función, denominada score function, actúa como una especie de campo de fuerzas que conduce el ruido hacia datos con una estructura reconocible.
Una función perfecta conduciría a la memorización
En teoría, un modelo que aprendiera perfectamente el proceso de eliminación de ruido a partir de sus muestras de entrenamiento debería reproducir esas mismas muestras al generar contenido.
Una score function perfecta dirigiría cada punto hacia uno de los ejemplos originales. El resultado sería memorización: el sistema funcionaría como una herramienta de recuperación de datos, no como un modelo capaz de crear resultados nuevos.
Sin embargo, los modelos de difusión suelen generar datos que no son copias exactas de su entrenamiento. La investigación sitúa el origen de esta diferencia en la forma aproximada en la que las redes neuronales aprenden la función de generación.
El papel del score smoothing
Las redes neuronales tienen dificultades para aprender funciones con cambios extremadamente bruscos. Debido a efectos de regularización, como el weight decay, suelen aprender versiones más suaves de la función teórica.
Este fenómeno se denomina score smoothing. En lugar de conducir todos los puntos generados directamente hacia los ejemplos originales, la función suavizada crea zonas intermedias en las que pueden aparecer nuevos datos plausibles.
El proceso puede resumirse así:
- Una función perfecta lleva el resultado hacia una muestra del entrenamiento.
- Una función suavizada reduce esa tendencia a converger exactamente en los datos conocidos.
- El modelo puede detenerse en posiciones intermedias.
- Esas posiciones representan nuevas combinaciones compatibles con la estructura aprendida.
La investigación sostiene que esta interpolación constituye una de las bases matemáticas de la creatividad observada en los modelos de difusión.
Un ejemplo con dos puntos
Para explicar este efecto, los investigadores plantean un espacio de una sola dimensión con dos únicos datos de entrenamiento: −1 y +1.
Con una score function perfecta, los puntos situados a la izquierda serían atraídos hacia −1 y los situados a la derecha hacia +1. Al final, todos convergerían en uno de los dos valores conocidos.
Cuando la función se suaviza, el cambio de dirección entre ambos puntos deja de ser tan abrupto. Algunos puntos avanzan más lentamente y terminan dentro de una zona de interpolación situada entre −1 y +1.
Los experimentos con redes neuronales de dos capas mostraron que un mayor nivel de weight decay producía una función más suave en la región intermedia. El artículo también señala que el score smoothing puede aparecer sin una estrategia explícita de regularización, como consecuencia de la regularización implícita de los algoritmos de entrenamiento basados en gradientes.
De una dimensión al espacio de las imágenes
Los datos reales no se distribuyen en espacios simples de una dimensión. Una imagen de alta resolución se representa dentro de un espacio de píxeles con muchas dimensiones, donde la mayor parte de las combinaciones posibles solo corresponde a ruido sin significado.
Las imágenes reconocibles ocupan una fracción reducida de ese espacio. Esa estructura recibe el nombre de data manifold o variedad de datos.
El modelo no conoce previamente la forma ni la posición de esa variedad. Debe inferirla a partir de un número limitado de muestras y generar nuevos puntos que se mantengan dentro de ella.
En este contexto, el score smoothing actúa de manera diferente según la dirección:
- En las direcciones paralelas a la variedad de datos, reduce la tendencia a converger exactamente en las muestras de entrenamiento.
- En las direcciones que conducen hacia la variedad, apenas ralentiza la convergencia.
Esta diferencia permite que los datos generados alcancen una región con significado sin colapsar necesariamente sobre un ejemplo conocido. El resultado es un equilibrio entre realismo y novedad: las imágenes pueden parecer plausibles y, al mismo tiempo, ser diferentes de las utilizadas durante el entrenamiento.
La creatividad como consecuencia matemática
Los resultados sugieren que la creatividad de los modelos de difusión podría entenderse como una consecuencia predecible del aprendizaje de las redes neuronales.
Al no reproducir con total precisión los cambios bruscos de la función teórica, las redes crean conexiones entre los datos conocidos. Esas conexiones permiten explorar los espacios intermedios y generar nuevas imágenes o configuraciones moleculares que conservan rasgos de los ejemplos aprendidos sin limitarse a copiarlos.
La investigación se presenta como un primer paso para explicar este mecanismo. El propio trabajo reconoce que todavía es necesario estudiar qué ocurre con distribuciones de datos y arquitecturas neuronales más complejas, así como en tareas de generación condicionada.
Comprender esta relación podría ayudar a diseñar modelos que interpolen mejor entre los datos y mantengan su capacidad para generar resultados novedosos, evitando al mismo tiempo una memorización directa de las muestras de entrenamiento. Google Research también ha publicado el código empleado en los experimentos numéricos del estudio.
Fuente
Zhengdao Chen, “Towards demystifying the creativity of diffusion models”, Google Research, 15 de julio de 2026.