Por favor, use este identificador para citar o enlazar este ítem: https://repositorio.ufu.br/handle/123456789/49461
Registro completo de metadatos
Campo DCValorLengua/Idioma
dc.creatorDiniz, Lucas de Oliveira-
dc.date.accessioned2026-08-12T14:42:01Z-
dc.date.available2026-08-12T14:42:01Z-
dc.date.issued2026-08-08-
dc.identifier.citationDINIZ, Lucas de Oliveira. Learning Strategic Poker Decision-Making with Large Language Models. 2026. 89 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Uberlândia, Uberlândia, 2026. DOI http://doi.org/10.14393/ufu.di.2026.510.pt_BR
dc.identifier.urihttps://repositorio.ufu.br/handle/123456789/49461-
dc.description.abstractDecision-making in the poker variant No-Limit Texas Hold’em involves integrating categorical, numerical, and sequential information in an imperfect-information environment. These elements can be represented as structured text, enabling the investigation of Large Language Models (LLMs) as predictors of strategic decisions. This dissertation examines that possibility in 6-max No-Limit Texas Hold’em, an imperfect-information setting in which each decision involves an action and, in aggressive cases, a bet or raise sizing. The task is formulated as supervised prediction over textualized states, separating its categorical and numerical components. A hybrid pipeline selects actions through log-probability scoring and obtains sizings through deterministic generation followed by numerical parsing, enabling separate analysis of action selection and numerical parameterization. PokerBench examples are evaluated in preflop and postflop settings. Six open LLMs are compared under few-shot prompting, and the best-performing model, Qwen3-14B, is specialized through supervised fine-tuning with LoRA and QLoRA for each game stage. In addition to Action Accuracy, a continuous formulation of Actionand-Sizing Accuracy (Ac-s) is developed to preserve action-first semantics while assigning proportional credit to sizing predictions when the aggressive action is correct. Few-shot prompting provides an informative baseline but remains below supervised adaptation. After fine-tuning, Qwen3-14B achieves 93.3% Action Accuracy preflop and 91.8% postflop, corresponding to gains of 17.2 and 40.3 percentage points, respectively. Analyses show consistent improvements across actions and contexts, while conditional diagnostics indicate high proportional sizing agreement in both stages after the aggressive action is correctly identified. The dissertation therefore contributes an operational formulation, a continuous metric, a reproducible evaluation pipeline, and an empirical analysis of open LLMs for structured strategic decision-making in an imperfect-information domain.pt_BR
dc.description.sponsorshipCAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superiorpt_BR
dc.languageengpt_BR
dc.publisherUniversidade Federal de Uberlândiapt_BR
dc.rightsAcesso Abertopt_BR
dc.rights.urihttp://creativecommons.org/licenses/by-nd/3.0/us/*
dc.subjectLanguage Modelspt_BR
dc.subjectPokerpt_BR
dc.subjectNo-Limit Texas Hold'empt_BR
dc.subjectSupervised Fine-Tuningpt_BR
dc.subjectStrategic Decision-Makingpt_BR
dc.titleLearning strategic poker decision-making with Large Language Modelspt_BR
dc.title.alternativeAprendizado de decisões estratégicas no pôquer com modelos de linguagem de grande escalapt_BR
dc.typeDissertaçãopt_BR
dc.contributor.advisor1Carneiro, Murillo Guimarães-
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/8158868389973535pt_BR
dc.contributor.referee1Julia, Rita Maria da Silva-
dc.contributor.referee1Latteshttp://lattes.cnpq.br/8032993126633250pt_BR
dc.contributor.referee2Ferreira, Lucas Nascimento-
dc.contributor.referee2Latteshttp://lattes.cnpq.br/5276740700506261pt_BR
dc.creator.Latteshttps://lattes.cnpq.br/0833256052372682pt_BR
dc.description.degreenameDissertação (Mestrado)pt_BR
dc.description.resumoA tomada de decisão no pôquer No-Limit Texas Hold’em envolve a integração de informações categóricas, numéricas e sequenciais sob incerteza. Essas informações podem ser representadas como texto estruturado, permitindo avaliar Large Language Models (LLMs) como preditores de decisões estratégicas. Esta dissertação examina essa possibilidade em No-Limit Texas Hold’em 6-max, modalidade com informação imperfeita na qual cada decisão envolve uma ação e, em casos agressivos, um tamanho de aposta ou aumento. A tarefa é formulada como predição supervisionada sobre estados textualizados, separando os componentes categórico e numérico. Desenvolve-se um pipeline híbrido que seleciona ações por log-probabilidades e obtém tamanhos por geração determinística e parsing numérico, permitindo analisar separadamente a escolha da ação e sua parametrização numérica. A abordagem utiliza exemplos do PokerBench, avaliados em preflop e postflop. Seis LLMs abertos são comparados em few-shot prompting, e o modelo de melhor desempenho, Qwen3-14B, é especializado por fine-tuning supervisionado com LoRA e QLoRA em cada fase. Além da Acurácia de Ação, desenvolve-se uma formulação contínua da Action-and-Sizing Accuracy (Ac-s), que preserva a prioridade da ação e atribui crédito proporcional ao tamanho previsto quando a ação agressiva está correta. Few-shot prompting fornece uma linha de base, mas fica abaixo da adaptação supervisionada. Após o fine-tuning, o Qwen3-14B alcança 93,3% de acurácia de ação no preflop e 91,8% no postflop, com ganhos de 17,2 e 40,3 pontos percentuais, respectivamente. As análises mostram melhorias consistentes entre ações e contextos, enquanto os diagnósticos condicionais indicam elevada concordância proporcional dos sizings em ambos os estágios após o acerto da ação agressiva. Assim, a dissertação contribui com uma formulação operacional, uma métrica contínua, um pipeline reproduzível e uma análise de LLMs abertos para decisão estratégica estruturada em um domínio de informação imperfeitapt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.programPrograma de Pós-graduação em Ciência da Computaçãopt_BR
dc.sizeorduration89pt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRApt_BR
dc.identifier.doihttp://doi.org/10.14393/ufu.di.2026.510pt_BR
dc.orcid.putcode223544134-
dc.crossref.doibatchid2159f96d-8f46-4559-aa8d-0a85fec34fe6-
dc.subject.autorizadoComputaçãopt_BR
dc.subject.odsODS::ODS 9. Indústria, Inovação e infraestrutura - Construir infraestrutura resiliente, promover a industrialização inclusiva e sustentável, e fomentar a inovação.pt_BR
Aparece en las colecciones:DISSERTAÇÃO - Ciência da Computação

Ficheros en este ítem:
Fichero Descripción TamañoFormato 
LearningStrategicPoker.pdfDissertação8.01 MBAdobe PDFVista previa
Visualizar/Abrir


Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons Creative Commons