Abstract
En los últimos años, se han producido grandes avances en la generación de contenido sintético, ya sea en forma de imágenes, texto o audio. No solo ha mejorado la calidad del contenido generado, sino también la accesibilidad a las herramientas necesarias para producirlo, disponibles tanto de forma gratuita como mediante servicios de pago. Esta situación plantea importantes riesgos en términos de seguridad y fiabilidad, ya que el nivel de realismo alcanzado dificulta enormemente distinguir entre un contenido genuino y uno generado artificialmente, facilitando prácticas como el fraude o la suplantación de identidad.
Con el objetivo de mitigar estos riesgos, este proyecto se centra en la detección de audios sintéticos mediante el desarrollo de un modelo de inteligencia artificial basado en técnicas de aprendizaje profundo. La solución propuesta se construye sobre una arquitectura de triple rama capaz de procesar espectrogramas de Mel y coeficientes cepstrales LFCC, combinados con embeddings extraídos mediante el modelo preentrenado Wav2Vec2. Estas representaciones se integran a través de redes LSTM bidireccionales y capas densas para llevar a cabo la clasificación.
Además, se ha implementado una aplicación web de mensajería que incorpora este modelo, permitiendo analizar los mensajes de voz enviados entre usuarios y alertar sobre su posible autenticidad. Finalmente, se ha evaluado el rendimiento del sistema utilizando métricas estándar, demostrando su eficacia y viabilidad en escenarios reales.
Journal Title
Journal ISSN
Volume Title
Publisher
Universidad Rey Juan Carlos
URL external
External URL
DOI
Date
Description
Trabajo Fin de Grado leído en la Universidad Rey Juan Carlos en el curso académico 2024/2025. Directores/as: Alberto Fernández Isabel



