Abstract
El presente Trabajo de Fin de Grado (TFG) tiene como objetivo aplicar distintos métodos de aprendizaje por refuerzo (Reinforcement Learning, RL) al problema de gestión de ingresos en aerolíneas (Airline Revenue Management, ARM) en redes de transporte aéreo. El RL es una disciplina intermedia entre el aprendizaje automático y la teoría de control, cuya base teórica se fundamenta en los procesos de decisión de Markov. A lo largo de los años, el RL ha evolucionado desde algoritmos basados en programación dinámica hacia novedosos enfoques basados en policy gradient methods, que permiten un mejor aprendizaje de políticas
mediante el uso de redes neuronales, impulsando su adopción en escenarios complejos. Esta evolución ha convertido al RL en un área de gran interés debido a su capacidad de adaptación y versatilidad en entornos de gran escala donde se desconocen las dinámicas reales del problema.
Uno de los campos donde estos algoritmos han encontrado aplicaciones relevantes es el ARM. Tanto la optimización de precios en la venta de asientos, como la protección de los mismos, son factores determinantes en los ingresos de una aerolínea, por lo que el ARM ha sido ampliamente estudiado a lo largo de los años. Entre las distintas técnicas aplicadas hasta la fecha, los enfoques basados en RL se han utilizado en escenarios con un único mercado (es decir, con un único par origen-destino), así como en pequeñas redes, proporcionando resultados prometedores en la toma de decisiones dinámica que implica el ARM.
En este TFG, se explora la aplicación de algoritmos de RL en el ARM, comenzando con experimentos preliminares en entornos de un único mercado, es decir, un origen y un destino. Para ello, se emplean métodos de la literatura, como programación dinámica, Q-learning y deep Q-learning, con el fin de analizar las limitaciones y dinámicas del problema. Posteriormente, se extiende el análisis a entornos con más de un mercado mediante la aplicación del algoritmo
proximal policy optimization, siendo este TFG el primer trabajo que utiliza proximal policy optimization en el contexto del ARM. En este segundo caso, se han considerado dos representaciones del entorno: una representación discreta, donde se deciden los precios de entre un conjunto predefinido, y una representación continua, donde el precio ofertado es una variable continua. Bajo estas condiciones, este TFG lleva a cabo un conjunto de experimentos numéricos que permiten evaluar el desempeño y la eficiencia de los distintos métodos que se presentan.
Journal Title
Journal ISSN
Volume Title
Publisher
Universidad Rey Juan Carlos
URL external
External URL
DOI
Date
Description
Trabajo Fin de Grado leído en la Universidad Rey Juan Carlos en el curso académico 2024/2025. Directores/as: Antonio García Marqués, Luis Cadarso Morga
Citation
Collections
Endorsement
Review
Supplemented By
Referenced By
Document viewer
Select a file to preview:
Reload



