Tips para entrenar PINNs¶
Fecha: 13/05/2026
Visto en clase anterior¶
En la clase anterior se introdujeron las PINNs (PINNs) y se analizó la dualidad entre las restricciones suaves y fuertes estableciendo que entrenar una red de estas características es un problema de optimización de alta dificultad dado que consta de minimizar una función de costo que no sólo depende de los datos empíricos, sino también de que se satisfaga una ecuación diferencial sobre el dominio de la misma.
Desafíos en el tratamiento de PINNs¶
Resulta conveniente mencionar y catalogar las posibles dificultades a las que se enfrentan las PINNs sea en la construcción de estas y/o en su entrenamiento.
1. Mal condicionamiento del problema de optimización¶
El problema de optimización sobre la función de costo puede ser altamente sensible a variaciones en los parámetros, por ejemplo, por poseer parámetros ajustados sobre escalas ampliamente distintas.
Por ello resulta de interés, encontrar algoritmos de búsqueda eficientes en función a la complejidad del problema y la capacidad disponible. Utilizando métodos de, al menos, primer orden y, preferentemente, cuasi-newton; véase Clase No5.
2. Balanceo de la función de costo¶
La función de costo total resulta de una combinación lineal
de la función de costo empírica y las dadas por términos físicos (ecuación diferencial, condiciones iniciales, condiciones de borde, etcétera). ads Es fácil ver que el problema radica en cómo elegir los hiperparámetros .
Hiperparámetros fijos: Establezco de antemano los hiperparámetros y los dejo constantes entre iteraciones.
L-Curve Metodología empírica donde se grafica la pérdida empírica contra la pérdida física para diferentes valores de y se toma por adecuado aquel que se encuentra en el punto máximo de curvatura como se ve en fig. 1 a partir de escalar las magnitudes logarítmicamente. Se recomienda ver Hansen (2001).
Figure 1:Selección de hiperparámetro óptimo en función de la L-curve descrita por logaritmos de funciones de costo.
Hiperparámetros Adaptativos: La mejor práctica en PINNs es recurrir a la meta-optimización de estos parámetros actualizando los dinámicamente durante el entrenamiento buscando equiparar peso de las funciones de costo (o su efecto sobre los parámetros). Algunos criterios para la adaptación incluyen:
Forzar a que todos los términos de la función de costo contribuyan de manera similar en magnitud.
Asegurar que los gradientes de la pérdida física y empírica tengan magnitudes similares
De esta manera, se evita que una componente domine la actualización del gradiente y, por ende, el siguente paso en el espacio de parámetros; de forma similar a la vista en fig. 2 .
Figure 2:Trayectoria de elección a través de igualar gradientes de las funciones de costo sobre el espacio de parámetros .
3. Puntos de colocación¶
Para imponer la restricción de la física, la ecuación diferencial se evalúa en un conjunto discreto de puntos en el dominio; de ahora en más denominado . Dado que evaluar la red (y calcular derivadas) tiene un alto costo computacional, la elección de estos puntos resulta crítica para el óptimo rendimiento y eficiencia del sistema propuesto.
Para asegurar esa elección existen distintas estrategias de sampleo:
Grilla Uniforme (Latin Hypercube): Distribución uniforme determinística de los puntos a evaluar sobre como se ve en fig. 3.
Figure 3:Representación de la grilla de sampleo uniforme sobre dominio arbitrario .
Sampleo Uniforme Aleatorio: Colección aleatoria y uniforme de puntos sobre que pretende no poseer un claro patrón de sampleo como se puede identificar en fig. 5.
Figure 5:Representación de sampleo uniformemente aleatorio sobre dominio arbitrario .La vista en el dominio (derecha) ilustra conceptualmente la grilla uniformemente aleatoria subyacente que genera la distribución en el dominio físico (izquierda)
En general, elude posibles sinterizaciones con frecuencias características de la ecuación analizada dada la aleatoriedad de la muestra.
Resampleo uniforme por época: Sampleo uniforme de de manera, o no aleatoria, en la iteración y, luego, se genera un nuevo muestreo para la siguiente iteración como se puede apreciar en fig.7. Buscando, de esta manera, no sobrepesar los puntos muestreados evitando comportamientos similares al visto en fig. 6.
Figure 7:Representación de fenómeno de overfitting visto en residuos de la función de costo.
Importance Sampling (Sampleo por Importancia): Estrategia más compleja donde no se samplea uniformemente, sino que se da mayor probabilidad de muestreo a las regiones de donde la función de costo parece mayor buscando de esta manera que
donde es el la posición de sampleo en la iteración -ésima. Concentrando, así, el poder de computo y el coste del mismo en las regiones de “mayor interés” o donde las pesa más tener un amplio muestreo.
4. Sesgo Espectral (Spectral Bias)¶
Las redes neuronales clásicas tienen la propiedad intrínseca de aprender bajas frecuencias mejor y más rápido que las altas frecuencias.
Esto es muy problemático en ecuaciones diferenciales (como Navier-Stokes), donde las altas frecuencias tienen un significado físico importante y no son sólo ruido despreciable (por ejemplo, vórtices pequeños, turbulencias o singularidades). Si la red no puede capturar altas frecuencias, no podrá aproximar estas soluciones.
Soluciones al Sesgo Espectral:¶
Fourier Features: Se introduce una capa inicial no entrenable que pre-procesa las entradas espaciales/temporales utilizando funciones sinusoidales con desfases (o combinación lineal de senos y coseno) con diferentes frecuencias de manera que
siendo la neurona de la capa “0”, es decir, se mapea la variable de entrada a la red neuronal sobre una base de Fourier utilizando un diccionario de funciones, o en mejor de los casos, Transformada de Fourier (FFT).
Figure 8:Representación de predicciones de una red neuronal clásica con función de activación y otra haciendo uso Fourier Features en 200 iteraciones sobre una ecuación base con dos frecuencias características.
Múltiples Redes Concurrentes (Filosofía Bagging): Otro método es aumentar los valores de entrada para mapear y capturar de mejor manera las frecuencias bajas que tenga la señal. El desempeño de esta metodología se puede ver en fig. 9
Figure 9:Representación de predicciones de una red neuronal aplicando Bagging en 200 iteraciones sobre una ecuación base con dos frecuencias características.
Esquema de la Arquitectura En este diseño, el input escalar se multiplica por factores enteros sucesivos en la primera capa modificada. Cada una de estas entradas escaladas alimenta a una red neuronal independiente (arquitectura tipo Ensemble/Bagging), cuyas salidas parciales se combinan finalmente en una neurona de salida global :
Expresión Formal del Modelo
La salida final del sistema se define como la combinación (frecuentemente un promedio o una suma ponderada) de redes neuronales “vainilla” independientes, donde cada red está parametrizada por sus propios pesos :
Intuición del modelo de Bagging
Si la señal original contiene una frecuencia extremadamente baja o “chiquita” del orden de:
Una red neuronal estándar (vainilla) tendría severas dificultades para aprenderla debido al sesgo hacia las altas frecuencias. Al forzar la multiplicación de por el factor en la -ésima neurona de la primera capa, la frecuencia efectiva se transforma:
Al convertirla en una frecuencia fundamental (1), la red asociada a ese bloque ya tiene la capacidad de aprender esa componente de la señal sin problemas. Finalmente, todas estas capacidades predictivas de diferentes escalas de frecuencia se combinan en la neurona de salida general .
Multistage Networks (Filosofía Boosting): Se entrena una red neuronal que capturará principalmente las frecuencias bajas. Luego, se calcula el residuo (lo que no se pudo aprender, que son, por lo ya mencionado, frecuencias altas) y se entrena una segunda red neuronal para predecir exclusivamente ese residuo e iterar hasta abarcar la totalidad del espectro deseado y componiendo la predicción como la combinación lineal de estas redes, véase Wang & Lai (2023). El ejemplo más común de este sistema es el algoritmo LightGBM (LGBM) que es utilizado para el gráfico presente en fig. 10.
Figure 10:Representación de predicciones de una red neuronal haciendo uso de LightGBM en 200 iteraciones sobre una ecuación base con dos frecuencias características.
Esquema de la Arquitectura
A diferencia de la arquitectura en paralelo de la solución anterior, aquí las redes se encadenan secuencialmente en etapas (multistage). Cada red aprende la señal residual de la etapa previa:
Expresión Formal del Modelo
La predicción final del modelo compuesto por etapas es la suma acumulada de las salidas de cada una de las sub-redes entrenadas individualmente:
Mecanismo de Aprendizaje por Residuos
El entrenamiento se realiza de forma estrictamente secuencial bajo la siguiente lógica:
Etapa 1: Se entrena la primera red con los datos originales. Esta red suele capturar los patrones más fáciles y dominantes de la señal (por ejemplo, las frecuencias bajas).
Etapa 2: Se calcula el primer residuo, es decir, lo que la primera red no pudo aprender:
Luego, la segunda red se entrena utilizando como su objetivo (target). Esta red se ve forzada a capturar detalles más finos (como frecuencias intermedias o altas).
Etapa : De manera general, cada red subsiguiente aprende el residuo acumulado de todas las anteriores:
Al finalizar el proceso, la combinación de todas las etapas permite reconstruir tanto la estructura global de los datos como sus detalles de alta frecuencia.
- Hansen, P. C. (2001). The L-curve and its use in the numerical treatment of inverse problems. In Computational Inverse Problems in Electrocardiology (Vol. 5, pp. 119–142). https://www.sintef.no/globalassets/project/evitameeting/2005/lcurve.pdf
- Rahaman, N., Baratin, A., Arpit, D., Draxler, F., Lin, M., Hamprecht, F., Bengio, Y., & Courville, A. (2019). On the Spectral Bias of Neural Networks. International Conference on Machine Learning, 5301–5310.
- Wang, Y., & Lai, C.-Y. (2023). Multi-stage Neural Networks: Function Approximator of Machine Precision. arXiv. 10.48550/arxiv.2307.08934