Use este identificador para citar ou linkar para este item:
https://repositorio.ufu.br/handle/123456789/49461| ORCID: | http://orcid.org/0000-0001-7233-8906 |
| Tipo do documento: | Dissertação |
| Tipo de acesso: | Acesso Aberto |
| Título: | Learning strategic poker decision-making with Large Language Models |
| Título(s) alternativo(s): | Aprendizado de decisões estratégicas no pôquer com modelos de linguagem de grande escala |
| Autor(es): | Diniz, Lucas de Oliveira |
| Primeiro orientador: | Carneiro, Murillo Guimarães |
| Primeiro membro da banca: | Julia, Rita Maria da Silva |
| Segundo membro da banca: | Ferreira, Lucas Nascimento |
| Resumo: | A tomada de decisão no pôquer No-Limit Texas Hold’em envolve a integração de informações categóricas, numéricas e sequenciais sob incerteza. Essas informações podem ser representadas como texto estruturado, permitindo avaliar Large Language Models (LLMs) como preditores de decisões estratégicas. Esta dissertação examina essa possibilidade em No-Limit Texas Hold’em 6-max, modalidade com informação imperfeita na qual cada decisão envolve uma ação e, em casos agressivos, um tamanho de aposta ou aumento. A tarefa é formulada como predição supervisionada sobre estados textualizados, separando os componentes categórico e numérico. Desenvolve-se um pipeline híbrido que seleciona ações por log-probabilidades e obtém tamanhos por geração determinística e parsing numérico, permitindo analisar separadamente a escolha da ação e sua parametrização numérica. A abordagem utiliza exemplos do PokerBench, avaliados em preflop e postflop. Seis LLMs abertos são comparados em few-shot prompting, e o modelo de melhor desempenho, Qwen3-14B, é especializado por fine-tuning supervisionado com LoRA e QLoRA em cada fase. Além da Acurácia de Ação, desenvolve-se uma formulação contínua da Action-and-Sizing Accuracy (Ac-s), que preserva a prioridade da ação e atribui crédito proporcional ao tamanho previsto quando a ação agressiva está correta. Few-shot prompting fornece uma linha de base, mas fica abaixo da adaptação supervisionada. Após o fine-tuning, o Qwen3-14B alcança 93,3% de acurácia de ação no preflop e 91,8% no postflop, com ganhos de 17,2 e 40,3 pontos percentuais, respectivamente. As análises mostram melhorias consistentes entre ações e contextos, enquanto os diagnósticos condicionais indicam elevada concordância proporcional dos sizings em ambos os estágios após o acerto da ação agressiva. Assim, a dissertação contribui com uma formulação operacional, uma métrica contínua, um pipeline reproduzível e uma análise de LLMs abertos para decisão estratégica estruturada em um domínio de informação imperfeita |
| Abstract: | Decision-making in the poker variant No-Limit Texas Hold’em involves integrating categorical, numerical, and sequential information in an imperfect-information environment. These elements can be represented as structured text, enabling the investigation of Large Language Models (LLMs) as predictors of strategic decisions. This dissertation examines that possibility in 6-max No-Limit Texas Hold’em, an imperfect-information setting in which each decision involves an action and, in aggressive cases, a bet or raise sizing. The task is formulated as supervised prediction over textualized states, separating its categorical and numerical components. A hybrid pipeline selects actions through log-probability scoring and obtains sizings through deterministic generation followed by numerical parsing, enabling separate analysis of action selection and numerical parameterization. PokerBench examples are evaluated in preflop and postflop settings. Six open LLMs are compared under few-shot prompting, and the best-performing model, Qwen3-14B, is specialized through supervised fine-tuning with LoRA and QLoRA for each game stage. In addition to Action Accuracy, a continuous formulation of Actionand-Sizing Accuracy (Ac-s) is developed to preserve action-first semantics while assigning proportional credit to sizing predictions when the aggressive action is correct. Few-shot prompting provides an informative baseline but remains below supervised adaptation. After fine-tuning, Qwen3-14B achieves 93.3% Action Accuracy preflop and 91.8% postflop, corresponding to gains of 17.2 and 40.3 percentage points, respectively. Analyses show consistent improvements across actions and contexts, while conditional diagnostics indicate high proportional sizing agreement in both stages after the aggressive action is correctly identified. The dissertation therefore contributes an operational formulation, a continuous metric, a reproducible evaluation pipeline, and an empirical analysis of open LLMs for structured strategic decision-making in an imperfect-information domain. |
| Palavras-chave: | Language Models Poker No-Limit Texas Hold'em Supervised Fine-Tuning Strategic Decision-Making |
| Área(s) do CNPq: | CNPQ::CIENCIAS EXATAS E DA TERRA |
| Assunto: | Computação |
| Idioma: | eng |
| País: | Brasil |
| Editora: | Universidade Federal de Uberlândia |
| Programa: | Programa de Pós-graduação em Ciência da Computação |
| Referência: | DINIZ, Lucas de Oliveira. Learning Strategic Poker Decision-Making with Large Language Models. 2026. 89 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Uberlândia, Uberlândia, 2026. DOI http://doi.org/10.14393/ufu.di.2026.510. |
| Identificador do documento: | http://doi.org/10.14393/ufu.di.2026.510 |
| URI: | https://repositorio.ufu.br/handle/123456789/49461 |
| Data de defesa: | 8-Ago-2026 |
| Objetivos de Desenvolvimento Sustentável (ODS): | ODS::ODS 9. Indústria, Inovação e infraestrutura - Construir infraestrutura resiliente, promover a industrialização inclusiva e sustentável, e fomentar a inovação. |
| Aparece nas coleções: | DISSERTAÇÃO - Ciência da Computação |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| LearningStrategicPoker.pdf | Dissertação | 8.01 MB | Adobe PDF | ![]() Visualizar/Abrir |
Este item está licenciada sob uma Licença Creative Commons
