Please use this identifier to cite or link to this item: https://repositorio.ufu.br/handle/123456789/50259
Full metadata record
DC FieldValueLanguage
dc.creatorSilva, Larissa Alvilino Ferreira da-
dc.date.accessioned2026-09-14T15:41:53Z-
dc.date.available2026-09-14T15:41:53Z-
dc.date.issued2026-08-06-
dc.identifier.citationSILVA, Larissa Alvilino Ferreira da. Modelagem preditiva da estabilidade de formulações cosméticas multicomponentes: um estudo comparativo de modelos de aprendizado de máquina. 2026. 36 f. Trabalho de Conclusão de Curso (Graduação em Engenharia Química) - Universidade Federal de Uberlândia, Uberlândia, 2026.pt_BR
dc.identifier.urihttps://repositorio.ufu.br/handle/123456789/50259-
dc.description.abstractPhysicochemical stability is a critical attribute in the development of multicomponent cosmetic formulations, and its assessment traditionally relies on time-consuming empirical tests. In this context, the present study aimed to compare the performance of tree-based machine learning models, such as Decision Tree, Random Forest and XGBoost, in the classification of shampoo formulation stability, using ingredient mass fractions as predictor variables. As a database, the experimental dataset of 812 formulations available in the literature was employed, from which stability was selected as the binary target variable (stable or unstable). The methodology involved data preparation and exploratory data analysis, followed by stratified splitting into train and test sets, cross-validation and hyperparameter optimization through grid search (GridSearchCV). The exploratory analysis revealed high sparsity, strong asymmetry and the absence of linear separability between classes, which justified the use of non-linear models. Performance was evaluated using F1-score, accuracy, precision and recall metrics, as well as error analysis through confusion matrices. A consistent progression in performance was observed with increasing model complexity: the Decision Tree, used as a reference, achieved an F1-score of 0.66 and accuracy of 68%, while the ensemble models, Random Forest and XGBoost, improved these metrics to an equivalent extent, reaching a test F1-score of 0.71 and accuracy of approximately 77%. Given the statistical equivalence between the two ensemble models on the test set, the mean cross-validation performance was adopted as the selection criterion, in which Random Forest achieved the best result (F1-score of 0.70), being selected as the final model. Feature importance analysis indicated thickeners and conditioning polymers as the most influential ingredients on stability, consistent with the combinatorial nature of the system. The results illustrate the potential of tree-based predictive models as a tool to support more agile and data-driven cosmetic formulation development.pt_BR
dc.language.isopt_BRpt_BR
dc.publisherUniversidade Federal de Uberlândiapt_BR
dc.rightsAcesso Abertopt_BR
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/3.0/us/*
dc.subjectModelagem preditivapt_BR
dc.subjectFormulações cosméticaspt_BR
dc.subjectEstabilidadept_BR
dc.subjectAprendizado de máquinapt_BR
dc.subjectPredictive modelingpt_BR
dc.subjectDecision treespt_BR
dc.subjectCosmetic formulationspt_BR
dc.subjectStabilitypt_BR
dc.subjectMachine learningpt_BR
dc.titleModelagem preditiva da estabilidade de formulações cosméticas multicomponentes: um estudo comparativo de modelos de aprendizado de máquinapt_BR
dc.title.alternativePredictive modeling of the stability of multicomponent cosmetic formulations: a comparative study of machine learning modelspt_BR
dc.typeTrabalho de Conclusão de Cursopt_BR
dc.contributor.advisor1Altino, Sarah Arvelos-
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/8375409235580771pt_BR
dc.contributor.referee1Kyriakidis, Yanne Novais-
dc.contributor.referee1Latteshttp://lattes.cnpq.br/4496520699221094pt_BR
dc.contributor.referee2Silva, Diogo Pimentel de Sá da-
dc.contributor.referee2Latteshttp://lattes.cnpq.br/3465259125832254pt_BR
dc.description.degreenameTrabalho de Conclusão de Curso (Graduação)pt_BR
dc.description.resumoA estabilidade físico-química é um atributo crítico no desenvolvimento de formulações cosméticas multicomponentes, e sua avaliação depende, tradicionalmente, de ensaios empíricos demorados. Neste contexto, o presente trabalho teve como objetivo comparar o desempenho de modelos de aprendizado de máquina baseados em árvores, como os de Árvore de Decisão, Floresta Aleatória e XGBoost, na classificação da estabilidade de formulações de shampoo, utilizando as frações mássicas dos ingredientes como variáveis preditoras. Como base de dados, empregou-se o conjunto experimental de 812 formulações disponibilizado na literatura, do qual se selecionou a estabilidade como variável-alvo binária (estável ou não-estável). A metodologia envolveu a preparação e a análise exploratória dos dados, seguida de divisão estratificada em treino e teste, validação cruzada e otimização de hiperparâmetros por busca em grade (GridSearchCV). A análise exploratória evidenciou elevada esparsidade, forte assimetria e ausência de separabilidade linear entre as classes, o que justificou o emprego de modelos não lineares. O desempenho foi avaliado por meio das métricas F1-score, acurácia, precisão e recall, além da análise dos erros por matrizes de confusão. Observou-se uma progressão consistente do desempenho com o aumento da complexidade dos modelos: a Árvore de Decisão, usada como referência, obteve F1-score de 0,66 e acurácia de 68%, enquanto os modelos de conjunto Random Forest e XGBoost elevaram essas métricas de forma equivalente, com F1-score de teste de 0,71 e acurácia de aproximadamente 77%. Diante da equivalência estatística entre os dois modelos no conjunto de teste, adotou-se como critério de seleção o desempenho médio na validação cruzada, no qual o Random Forest apresentou o melhor resultado (F1-score de 0,70), sendo selecionado como modelo final. A análise de importância das variáveis indicou os espessantes e os polímeros condicionantes como os ingredientes mais influentes sobre a estabilidade, em consonância com o caráter combinatório do sistema. Os resultados ilustram o potencial de modelos preditivos baseados em árvores como ferramenta de apoio ao desenvolvimento de formulações cosméticas mais ágil e orientado por dados.pt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.courseEngenharia Químicapt_BR
dc.sizeorduration36pt_BR
dc.subject.cnpqCNPQ::ENGENHARIAS::ENGENHARIA QUIMICA::TECNOLOGIA QUIMICApt_BR
dc.orcid.putcode226744474-
Appears in Collections:TCC - Engenharia Química

Files in This Item:
File Description SizeFormat 
ModelagemPreditivaEstabilidade.pdfTCC1.08 MBAdobe PDFThumbnail
View/Open


This item is licensed under a Creative Commons License Creative Commons