Please use this identifier to cite or link to this item: https://repositorio.ufu.br/handle/123456789/49461
ORCID:  http://orcid.org/0000-0001-7233-8906
Document type: Dissertação
Access type: Acesso Aberto
Title: Learning strategic poker decision-making with Large Language Models
Alternate title (s): Aprendizado de decisões estratégicas no pôquer com modelos de linguagem de grande escala
Author: Diniz, Lucas de Oliveira
First Advisor: Carneiro, Murillo Guimarães
First member of the Committee: Julia, Rita Maria da Silva
Second member of the Committee: Ferreira, Lucas Nascimento
Summary: A tomada de decisão no pôquer No-Limit Texas Hold’em envolve a integração de informações categóricas, numéricas e sequenciais sob incerteza. Essas informações podem ser representadas como texto estruturado, permitindo avaliar Large Language Models (LLMs) como preditores de decisões estratégicas. Esta dissertação examina essa possibilidade em No-Limit Texas Hold’em 6-max, modalidade com informação imperfeita na qual cada decisão envolve uma ação e, em casos agressivos, um tamanho de aposta ou aumento. A tarefa é formulada como predição supervisionada sobre estados textualizados, separando os componentes categórico e numérico. Desenvolve-se um pipeline híbrido que seleciona ações por log-probabilidades e obtém tamanhos por geração determinística e parsing numérico, permitindo analisar separadamente a escolha da ação e sua parametrização numérica. A abordagem utiliza exemplos do PokerBench, avaliados em preflop e postflop. Seis LLMs abertos são comparados em few-shot prompting, e o modelo de melhor desempenho, Qwen3-14B, é especializado por fine-tuning supervisionado com LoRA e QLoRA em cada fase. Além da Acurácia de Ação, desenvolve-se uma formulação contínua da Action-and-Sizing Accuracy (Ac-s), que preserva a prioridade da ação e atribui crédito proporcional ao tamanho previsto quando a ação agressiva está correta. Few-shot prompting fornece uma linha de base, mas fica abaixo da adaptação supervisionada. Após o fine-tuning, o Qwen3-14B alcança 93,3% de acurácia de ação no preflop e 91,8% no postflop, com ganhos de 17,2 e 40,3 pontos percentuais, respectivamente. As análises mostram melhorias consistentes entre ações e contextos, enquanto os diagnósticos condicionais indicam elevada concordância proporcional dos sizings em ambos os estágios após o acerto da ação agressiva. Assim, a dissertação contribui com uma formulação operacional, uma métrica contínua, um pipeline reproduzível e uma análise de LLMs abertos para decisão estratégica estruturada em um domínio de informação imperfeita
Abstract: Decision-making in the poker variant No-Limit Texas Hold’em involves integrating categorical, numerical, and sequential information in an imperfect-information environment. These elements can be represented as structured text, enabling the investigation of Large Language Models (LLMs) as predictors of strategic decisions. This dissertation examines that possibility in 6-max No-Limit Texas Hold’em, an imperfect-information setting in which each decision involves an action and, in aggressive cases, a bet or raise sizing. The task is formulated as supervised prediction over textualized states, separating its categorical and numerical components. A hybrid pipeline selects actions through log-probability scoring and obtains sizings through deterministic generation followed by numerical parsing, enabling separate analysis of action selection and numerical parameterization. PokerBench examples are evaluated in preflop and postflop settings. Six open LLMs are compared under few-shot prompting, and the best-performing model, Qwen3-14B, is specialized through supervised fine-tuning with LoRA and QLoRA for each game stage. In addition to Action Accuracy, a continuous formulation of Actionand-Sizing Accuracy (Ac-s) is developed to preserve action-first semantics while assigning proportional credit to sizing predictions when the aggressive action is correct. Few-shot prompting provides an informative baseline but remains below supervised adaptation. After fine-tuning, Qwen3-14B achieves 93.3% Action Accuracy preflop and 91.8% postflop, corresponding to gains of 17.2 and 40.3 percentage points, respectively. Analyses show consistent improvements across actions and contexts, while conditional diagnostics indicate high proportional sizing agreement in both stages after the aggressive action is correctly identified. The dissertation therefore contributes an operational formulation, a continuous metric, a reproducible evaluation pipeline, and an empirical analysis of open LLMs for structured strategic decision-making in an imperfect-information domain.
Keywords: Language Models
Poker
No-Limit Texas Hold'em
Supervised Fine-Tuning
Strategic Decision-Making
Area (s) of CNPq: CNPQ::CIENCIAS EXATAS E DA TERRA
Subject: Computação
Language: eng
Country: Brasil
Publisher: Universidade Federal de Uberlândia
Program: Programa de Pós-graduação em Ciência da Computação
Quote: DINIZ, Lucas de Oliveira. Learning Strategic Poker Decision-Making with Large Language Models. 2026. 89 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal de Uberlândia, Uberlândia, 2026. DOI http://doi.org/10.14393/ufu.di.2026.510.
Document identifier: http://doi.org/10.14393/ufu.di.2026.510
URI: https://repositorio.ufu.br/handle/123456789/49461
Date of defense: 8-Aug-2026
Sustainable Development Goals SDGs: ODS::ODS 9. Indústria, Inovação e infraestrutura - Construir infraestrutura resiliente, promover a industrialização inclusiva e sustentável, e fomentar a inovação.
Appears in Collections:DISSERTAÇÃO - Ciência da Computação

Files in This Item:
File Description SizeFormat 
LearningStrategicPoker.pdfDissertação8.01 MBAdobe PDFThumbnail
View/Open


This item is licensed under a Creative Commons License Creative Commons