Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

No10 - PINNs Pt2

Tips para entrenar PINNs

Fecha: 13/05/2026


Visto en clase anterior

En la clase anterior se introdujeron las PINNs (PINNs) y se analizó la dualidad entre las restricciones suaves y fuertes estableciendo que entrenar una red de estas características es un problema de optimización de alta dificultad dado que consta de minimizar una función de costo que no sólo depende de los datos empíricos, sino también de que se satisfaga una ecuación diferencial sobre el dominio de la misma.

Desafíos en el tratamiento de PINNs

Resulta conveniente mencionar y catalogar las posibles dificultades a las que se enfrentan las PINNs sea en la construcción de estas y/o en su entrenamiento.

1. Mal condicionamiento del problema de optimización

El problema de optimización sobre la función de costo puede ser altamente sensible a variaciones en los parámetros, por ejemplo, por poseer parámetros ajustados sobre escalas ampliamente distintas.

Por ello resulta de interés, encontrar algoritmos de búsqueda eficientes en función a la complejidad del problema y la capacidad disponible. Utilizando métodos de, al menos, primer orden y, preferentemente, cuasi-newton; véase Clase No5.

2. Balanceo de la función de costo

La función de costo total LTOT\mathcal{L}_{TOT} resulta de una combinación lineal

LTOT(θ)=LEMP(θ)+iλiLFIS(i)(θ;x)\mathcal{L}_{TOT}(\theta) = \mathcal{L}_{EMP}(\theta) + \sum_i \lambda_i \mathcal{L}_{FIS}^{(i)}(\theta;x)

de la función de costo empírica LEMP(θ)\mathcal{\mathcal{L}_{EMP}(\theta)} y las dadas por términos físicos LFIS(i)(θ;x)\mathcal{L}_{FIS}^{(i)}(\theta;x) (ecuación diferencial, condiciones iniciales, condiciones de borde, etcétera). ads Es fácil ver que el problema radica en cómo elegir los hiperparámetros λi\lambda_i.

3. Puntos de colocación

Para imponer la restricción de la física, la ecuación diferencial se evalúa en un conjunto discreto de puntos en el dominio; de ahora en más denominado Ω\Omega. Dado que evaluar la red (y calcular derivadas) tiene un alto costo computacional, la elección de estos puntos resulta crítica para el óptimo rendimiento y eficiencia del sistema propuesto.

Para asegurar esa elección existen distintas estrategias de sampleo:

  1. Grilla Uniforme (Latin Hypercube): Distribución uniforme determinística de los puntos a evaluar sobre Ω\Omega como se ve en fig. 3.

    Representación de la grilla de sampleo uniforme sobre dominio arbitrario \Omega.

    Figure 3:Representación de la grilla de sampleo uniforme sobre dominio arbitrario Ω\Omega.

  2. Sampleo Uniforme Aleatorio: Colección aleatoria y uniforme de puntos sobre Ω\Omega que pretende no poseer un claro patrón de sampleo como se puede identificar en fig. 5.

    Representación de sampleo uniformemente aleatorio sobre dominio arbitrario \Omega.La vista en el dominio (derecha) ilustra conceptualmente la grilla uniformemente aleatoria subyacente que genera la distribución en el dominio físico \Omega (izquierda)

    Figure 5:Representación de sampleo uniformemente aleatorio sobre dominio arbitrario Ω\Omega.La vista en el dominio (derecha) ilustra conceptualmente la grilla uniformemente aleatoria subyacente que genera la distribución en el dominio físico Ω\Omega (izquierda)

    En general, elude posibles sinterizaciones con frecuencias características de la ecuación analizada dada la aleatoriedad de la muestra.

  3. Resampleo uniforme por época: Sampleo uniforme de Ω\Omega de manera, o no aleatoria, en la iteración keˊsimak-ésima y, luego, se genera un nuevo muestreo para la siguiente iteración k+1k+1 como se puede apreciar en fig.7. Buscando, de esta manera, no sobrepesar los puntos muestreados evitando comportamientos similares al visto en fig. 6.

    Representación de fenómeno de overfitting visto en residuos de la función de costo.

    Figure 7:Representación de fenómeno de overfitting visto en residuos de la función de costo.

  4. Importance Sampling (Sampleo por Importancia): Estrategia más compleja donde no se samplea uniformemente, sino que se da mayor probabilidad de muestreo a las regiones de Ω\Omega donde la función de costo parece mayor buscando de esta manera que

    P(xik+1)eαLFIS(xik)P(x_{i}^{k+1}) \propto e^{\alpha \mathcal{L}_{FIS}(x_{i}^{k})}

    donde xikx_{i}^{k} es el la posición de sampleo ii en la iteración kk-ésima. Concentrando, así, el poder de computo y el coste del mismo en las regiones de “mayor interés” o donde las pesa más tener un amplio muestreo.

4. Sesgo Espectral (Spectral Bias)

Las redes neuronales clásicas tienen la propiedad intrínseca de aprender bajas frecuencias mejor y más rápido que las altas frecuencias.

Esto es muy problemático en ecuaciones diferenciales (como Navier-Stokes), donde las altas frecuencias tienen un significado físico importante y no son sólo ruido despreciable (por ejemplo, vórtices pequeños, turbulencias o singularidades). Si la red no puede capturar altas frecuencias, no podrá aproximar estas soluciones.

Soluciones al Sesgo Espectral:

References
  1. Hansen, P. C. (2001). The L-curve and its use in the numerical treatment of inverse problems. In Computational Inverse Problems in Electrocardiology (Vol. 5, pp. 119–142). https://www.sintef.no/globalassets/project/evitameeting/2005/lcurve.pdf
  2. Rahaman, N., Baratin, A., Arpit, D., Draxler, F., Lin, M., Hamprecht, F., Bengio, Y., & Courville, A. (2019). On the Spectral Bias of Neural Networks. International Conference on Machine Learning, 5301–5310.
  3. Wang, Y., & Lai, C.-Y. (2023). Multi-stage Neural Networks: Function Approximator of Machine Precision. arXiv. 10.48550/arxiv.2307.08934