Por favor, use este identificador para citar o enlazar este ítem:
https://repositorio.ufu.br/handle/123456789/49617Registro completo de metadatos
| Campo DC | Valor | Lengua/Idioma |
|---|---|---|
| dc.creator | Pereira, Guilherme de Sousa | - |
| dc.date.accessioned | 2026-08-18T13:24:28Z | - |
| dc.date.available | 2026-08-18T13:24:28Z | - |
| dc.date.issued | 2026-05-06 | - |
| dc.identifier.citation | PEREIRA, Guilherme de Sousa. A hybrid CNN-LSTM architecture for malware behavioral analysis via API call sequences. 2026. 41 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) - Universidade Federal de Uberlândia, Uberlândia, 2026. | pt_BR |
| dc.identifier.uri | https://repositorio.ufu.br/handle/123456789/49617 | - |
| dc.description.abstract | A detecção e classificação de softwares maliciosos através da análise comportamental de chamadas de Interface de Programação de Aplicações (API) permanece um desafio proeminente na cibersegurança. No entanto, a complexidade estrutural das ameaças modernas e o imenso ruído semântico embutido em longas sequências de execução frequentemente dificultam a precisão dos modelos preditivos tradicionais. Redes neurais puramente recorrentes, como as arquiteturas base Long Short-Term Memory (LSTM), frequentemente sofrem com a saturação do gradiente contextual e severos erros de classificação cruzada ao processar essas sequências não filtradas, particularmente em conjuntos de dados que exibem assimetria estrutural inerente. Para solucionar esse déficit representacional, esta pesquisa propõe e avalia empiricamente uma arquitetura híbrida de aprendizado profundo (CNN-LSTM) para a categorização multiclasse de malwares. O modelo proposto integra Redes Neurais Convolucionais 1D (CNN) como uma fase preliminar de filtragem espacial para extrair assinaturas comportamentais localizadas (n-gramas), seguidas por um bloco LSTM Bidirecional (Bi-LSTM) para mapear a narrativa temporal da execução. Além disso, uma penalização algorítmica de pesos de classe é aplicada para otimizar o aprendizado em famílias sub-representadas e altamente complexas. A avaliação experimental, comparada a um modelo de referência LSTM de camada única rigorosamente replicado, demonstra a superioridade arquitetural da abordagem híbrida. A CNN-LSTM alcançou uma acurácia global de 67,1% — superando o teto de 61,0% da linha de base — enquanto reduziu drasticamente o tempo de treinamento computacional de 407 minutos para apenas 12,4 minutos. Ao isolar efetivamente o ruído semântico, a extração de características espaciais gerou melhorias relativas substanciais no F1-Score em famílias complexas, como Dropper (+31,9%) e Vírus (+21,9%). Estas descobertas empíricas validam de forma definitiva que a redução da dimensionalidade espacial prévia à inferência temporal previne a saturação da memória, estabelecendo a hibridização CNN-LSTM como um paradigma altamente viável, computacionalmente eficiente e robusto para a classificação de ameaças em cenários reais. | pt_BR |
| dc.description.sponsorship | Pesquisa sem auxílio de agências de fomento | pt_BR |
| dc.language | eng | pt_BR |
| dc.publisher | Universidade Federal de Uberlândia | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.rights.uri | http://creativecommons.org/licenses/by/3.0/us/ | * |
| dc.subject | Deep Learning | pt_BR |
| dc.subject | Malware Classification | pt_BR |
| dc.subject | CNN-LSTM | pt_BR |
| dc.subject | API Calls | pt_BR |
| dc.subject | Cybersecurity | pt_BR |
| dc.subject | Behavioral Analysis | pt_BR |
| dc.title | A hybrid CNN-LSTM architecture for malware behavioral analysis via API call sequences | pt_BR |
| dc.title.alternative | Uma arquitetura híbrida CNN-LSTM para análise comportamental de malware via sequências de chamadas de API | pt_BR |
| dc.type | Trabalho de Conclusão de Curso | pt_BR |
| dc.contributor.advisor1 | Abdala, Daniel Duarte | - |
| dc.contributor.advisor1Lattes | http://lattes.cnpq.br/0083781586520627 | pt_BR |
| dc.contributor.referee1 | Miani, Rodrigo Sanches | - |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/2992074747740327 | pt_BR |
| dc.contributor.referee2 | Nascimento, Marcelo Zanchetta do | - |
| dc.contributor.referee2Lattes | http://lattes.cnpq.br/5800175874658088 | pt_BR |
| dc.creator.Lattes | http://lattes.cnpq.br/0980282503727883 | pt_BR |
| dc.description.degreename | Trabalho de Conclusão de Curso (Graduação) | pt_BR |
| dc.description.resumo | The detection and classification of malicious software through the behavioral analysis of Application Programming Interface (API) calls remains a prominent cybersecurity challenge. However, the structural complexity of modern threats and the immense semantic noise embedded within long execution sequences often hinder traditional predictive models. Purely recurrent neural networks, such as baseline Long Short-Term Memory (LSTM) architectures, frequently suffer from contextual gradient saturation and severe cross-misclassification when processing these unfiltered sequences, particularly in datasets exhibiting inherent structural asymmetry. To address this representational deficit, this research proposes and empirically evaluates a hybrid deep learning architecture (CNN-LSTM) for multiclass malware categorization. The proposed model integrates 1DConvolutional Neural Networks (CNN) as a preliminary spatial filtering phase to extract localized behavioral signatures (n-grams), followed by a Bidirectional LSTM (Bi-LSTM) to map the temporal narrative of the execution. Furthermore, algorithmic class weighting is applied to optimize learning across highly complex, underrepresented families. Experimental evaluation against a strictly replicated single-layer LSTM baseline demonstrates the architectural superiority of the hybrid approach. The CNN-LSTM achieved a global accuracy of 67.1%—surpassing the 61.0% baseline ceiling—while drastically reducing the computational training time from 407 minutes to merely 12.4 minutes. By effectively isolating semantic noise, the spatial feature extraction yielded substantial relative F1-Score improvements in complex families, such as Dropper (+31.9%) and Virus (+21.9%). These empirical findings definitively validate that spatial dimensionality reduction prior to temporal inference prevents memory saturation, establishing the CNN-LSTM hybridization as a highly viable, computationally efficient, and robust paradigm for real-world threat classification. | pt_BR |
| dc.publisher.country | Brasil | pt_BR |
| dc.publisher.course | Sistemas de Informação | pt_BR |
| dc.sizeorduration | 41 | pt_BR |
| dc.subject.cnpq | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::SISTEMAS DE COMPUTACAO::ARQUITETURA DE SISTEMAS DE COMPUTACAO | pt_BR |
| dc.orcid.putcode | 224241507 | - |
| Aparece en las colecciones: | TCC - Sistemas de Informação (Uberlândia) | |
Ficheros en este ítem:
| Fichero | Descripción | Tamaño | Formato | |
|---|---|---|---|---|
| HybridCNN-LSTMArchitecture.pdf | TCC | 894.69 kB | Adobe PDF | ![]() Visualizar/Abrir |
Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons
