Abstract

En los últimos años, se han producido grandes avances en la generación de contenido sintético, ya sea en forma de imágenes, texto o audio. No solo ha mejorado la calidad del contenido generado, sino también la accesibilidad a las herramientas necesarias para producirlo, disponibles tanto de forma gratuita como mediante servicios de pago. Esta situación plantea importantes riesgos en términos de seguridad y fiabilidad, ya que el nivel de realismo alcanzado dificulta enormemente distinguir entre un contenido genuino y uno generado artificialmente, facilitando prácticas como el fraude o la suplantación de identidad. Con el objetivo de mitigar estos riesgos, este proyecto se centra en la detección de audios sintéticos mediante el desarrollo de un modelo de inteligencia artificial basado en técnicas de aprendizaje profundo. La solución propuesta se construye sobre una arquitectura de triple rama capaz de procesar espectrogramas de Mel y coeficientes cepstrales LFCC, combinados con embeddings extraídos mediante el modelo preentrenado Wav2Vec2. Estas representaciones se integran a través de redes LSTM bidireccionales y capas densas para llevar a cabo la clasificación. Además, se ha implementado una aplicación web de mensajería que incorpora este modelo, permitiendo analizar los mensajes de voz enviados entre usuarios y alertar sobre su posible autenticidad. Finalmente, se ha evaluado el rendimiento del sistema utilizando métricas estándar, demostrando su eficacia y viabilidad en escenarios reales.
Loading...

Quotes

plumx
0 citations in WOS
0 citations in

Journal Title

Journal ISSN

Volume Title

Publisher

Universidad Rey Juan Carlos

URL external

External URL

DOI

Description

Trabajo Fin de Grado leído en la Universidad Rey Juan Carlos en el curso académico 2024/2025. Directores/as: Alberto Fernández Isabel

Citation

Endorsement

Review

Supplemented By

Referenced By

Statistics

Views
0
Downloads
0

Bibliographic managers