Optimization
Es una técnica de ______ que actualiza los pesos de la red usando un pequeño subconjunto aleatorio (minibatch) de los datos de entrenamiento, en lugar de usar todos los datos, lo que reduce el costo computacional y permite entrenamiento en línea.
Apuntes
Optimization ¿Qué es el descenso estocástico del gradiente (SGD)? Es una técnica de optimización que actualiza los pesos de la red usando un pequeño subconjunto aleatorio (minibatch) de los datos de entrenamiento, en lugar de usar todos los datos, lo que reduce el costo computacional y permite entrenamiento en línea. ¿Qué problemas presenta el SGD tradicional? SGD puede tener dificultades en funciones con curvatura desigual (direcciones planas y empinadas), quedarse atascado en mínimos locales o puntos de silla, y oscilar en zonas de alta curvatura. ¿Qué mejora aporta el momentum al SGD? Introduce un 'vector de velocidad' que acumula las actualizaciones anteriores, suavizando las oscilaciones y acelerando el descenso en direcciones coherentes. ¿Qué es el momentum de Nesterov y en qué se diferencia del momentum clásico? Nesterov evalúa el gradiente no en la posición actual, sino en la posición 'futura' estimada por la velocidad. Esto permite ajustar la dirección antes de pasarla, haciendo actualizaciones más suaves y precisas. ¿Qué hace el algoritmo AdaGrad? AdaGrad adapta la tasa de aprendizaje para cada parámetro según su historial de gradientes. Penaliza las dimensiones con ...
Estudia con juegos interactivos
Sube tus apuntes y genera flashcards, examenes y mas con IA
Empezar gratis