Ideal step size estimation for the multinomial logistic regression
dc.contributor.advisor | Rodríguez Valderrama, Paul Antonio | |
dc.contributor.author | Ramirez Orihuela, Gabriel | |
dc.date.accessioned | 2025-01-22T20:44:12Z | |
dc.date.available | 2025-01-22T20:44:12Z | |
dc.date.created | 2024 | |
dc.date.issued | 2025-01-22 | |
dc.description.abstract | At the core of deep learning optimization problems reside algorithms such as the Stochastic Gradient Descent (SGD), which employs a subset of the data per iteration to estimate the gradient in order to minimize a cost function. Adaptive algorithms, based on SGD, are well known for being effective in using gradient information from past iterations, generating momentum or memory that enables a more accurate prediction of the true gradient slope in future iterations, thus accelerating convergence. Nevertheless, these algorithms still need an initial (scalar) learning rate (LR) as well as a LR scheduler. In this work we propose a new SGD algorithm that estimates the initial (scalar) LR via an adaptation of the ideal Cauchy step size for the multinomial logistic regression; furthermore, the LR is recursively updated up to a given number of epochs, after which a decaying LR scheduler is used. The proposed method is assessed for several well-known multiclass classification architectures and favorably compares against other well-tuned (scalar and spatially) adaptive alternatives, including the Adam algorithm. | en_US |
dc.description.abstract | En la base de los problemas de optimización en aprendizaje profundo residen algoritmos como el Gradiente Descendiente Estocástico (SGD, por sus siglas en inglés), el cual emplea un subconjunto de los datos por iteración para estimar el gradiente con el fin de minimizar una función de costo. Los algoritmos adaptativos, basados en el SGD, son ampliamente reconocidos por su efectividad al utilizar la información del gradiente de iteraciones previas, generando un momento o memoria que permite una predicción más precisa de la pendiente real del gradiente en iteraciones futuras, acelerando así la convergencia. No obstante, estos algoritmos aún requieren una tasa de aprendizaje (learning rate o LR) inicial (escalar), así como un programador de LR. En este trabajo proponemos un nuevo algoritmo de SGD que estima la LR inicial (escalar) mediante una adaptación del tamaño de paso ideal de Cauchy para la regresión logística multinomial; además, la LR se actualiza de manera recursiva hasta un número determinado de épocas, tras lo cual se emplea un programador de LR decreciente. El método propuesto se evalúa en varias arquitecturas de clasificación multiclase bien conocidas y se compara favorablemente con otras alternativas adaptativas (escalares y espaciales) bien optimizadas, incluyendo el algoritmo Adam. | es_ES |
dc.identifier.uri | http://hdl.handle.net/20.500.12404/29791 | |
dc.language.iso | eng | |
dc.publisher | Pontificia Universidad Católica del Perú | es_ES |
dc.publisher.country | PE | |
dc.rights | info:eu-repo/semantics/openAccess | |
dc.rights.uri | https://creativecommons.org/licenses/by-sa/2.5/pe/ | |
dc.subject | Aprendizaje automático (Inteligencia artificial) | |
dc.subject | Aprendizaje profundo (Aprendizaje automático) | |
dc.subject | Optimización matemática | |
dc.subject | Análisis de regresión | |
dc.subject.ocde | https://purl.org/pe-repo/ocde/ford#2.00.00 | |
dc.title | Ideal step size estimation for the multinomial logistic regression | en_EN |
dc.type | info:eu-repo/semantics/masterThesis | |
renati.advisor.dni | 07754238 | |
renati.advisor.orcid | https://orcid.org/0000-0002-8501-0907 | |
renati.author.dni | 70352996 | |
renati.discipline | 613077 | |
renati.juror | Silva Obregón, Gustavo Manuel | |
renati.juror | Rodríguez Valderrama, Paul Antonio | |
renati.juror | Beltrán Castañón, César Armando | |
renati.level | https://purl.org/pe-repo/renati/level#maestro | |
renati.type | https://purl.org/pe-repo/renati/type#tesis | |
thesis.degree.discipline | Procesamiento de Señales e Imágenes Digitales | es_ES |
thesis.degree.grantor | Pontificia Universidad Católica del Perú. Escuela de Posgrado | es_ES |
thesis.degree.level | Maestría | es_ES |
thesis.degree.name | Maestro en Procesamiento de Señales e Imágenes Digitales. | es_ES |
Archivos
Bloque original
Bloque de licencias
1 - 1 de 1
Cargando...
- Nombre:
- license.txt
- Tamaño:
- 1.71 KB
- Formato:
- Item-specific license agreed upon to submission
- Descripción: