
Pluribus: o bot de pôquer explicado para desenvolvedores
Pluribus foi o bot que mudou os limites da pesquisa em No-Limit Texas Hold'em 6-max. Ele superou jogadores profissionais de elite em 2019, mas não é uma biblioteca, uma API SaaS nem um atalho que você possa conectar ao seu bot. Para quem desenvolve, a pergunta útil é mais específica: quais ideias do Pluribus podem ser reaproveitadas?
Parte de: O guia completo para construir um bot de IA para poker em 2026 - o pilar completo que cobre estruturas, lógica de decisão, equidade, testes e arenas ao vivo.
Principais conclusões
- Pluribus venceu profissionais de elite no NLHE de seis jogadores em 2019, incluindo um experimento multi-profissional de 10.000 mãos.
- A lição não é “copiar o Pluribus”, mas combinar uma estratégia-base, busca, abstração e ações equilibradas.
- O CFR é importante, mas a maioria dos construtores deve começar com PokerKit, heurística, equidade e testes ao vivo antes do CFR profundo.
O que foi o bot de pôquer Pluribus
Pluribus foi um sistema de IA criado em 2019 pela Carnegie Mellon University e pela Facebook AI que derrotou grandes profissionais no No-Limit Texas Hold'em 6-max (CMU, 2019). O feito importa porque o pôquer com seis jogadores envolve múltiplos agentes e informações imperfeitas, uma situação muito mais complexa do que um confronto heads-up.
Antes de Pluribus, os famosos marcos públicos eram principalmente heads-up. Libratus venceu quatro profissionais no heads-up No-Limit Hold'em em mais de 120.000 mãos, mas o heads-up poker tem uma estrutura de soma zero para dois jogadores que a teoria dos jogos lida de forma mais limpa. Pluribus mudou o marco para o pôquer de seis jogadores, onde vários oponentes atuam com cartas escondidas e diferentes incentivos.
O resultado não veio no formato “baixe este bot”. O artigo científico apresentou um método de pesquisa e um resultado de benchmark. Essa distinção é importante para desenvolvedores: Pluribus demonstrou que uma IA pode superar humanos no pôquer multiplayer, mas não oferece código de produção, cliente WebSocket, gestão de bankroll ou uma arena para competir.
Para uma comparação direta, consulte Open Poker vs Pluribus. Este artigo se concentra no que um desenvolvedor realmente pode aproveitar.
Na prática, Pluribus serve como referência de arquitetura, não como kit inicial. Um bot funcional que joga 1.000 mãos em uma plataforma ao vivo ensina mais do que uma tentativa incompleta de reimplementar o artigo científico.
Como Pluribus venceu os profissionais humanos
Pluribus venceu os profissionais ao combinar uma estratégia-base pré-computada com uma busca limitada em tempo real. O comunicado da CMU relatou dois experimentos: 5.000 mãos contra cada um de dois profissionais identificados e outro teste de 10.000 mãos com 13 profissionais, cinco deles jogando por vez.
A estratégia-base veio primeiro. Pluribus treinou por self-play, com seis cópias do programa jogando entre si. O treinamento produziu uma política para a primeira rodada de apostas e uma estratégia inicial para as decisões posteriores.
Depois veio a busca. Durante uma mão, Pluribus não resolvia toda a árvore do jogo até o river, pois isso custaria caro demais. Em vez disso, resolvia um subjogo menor e limitado e considerava um pequeno conjunto de estratégias de continuação nos nós finais. A CMU descreveu essa busca limitada com informações imperfeitas como o principal avanço.
Essa é a ideia que vale aproveitar. Você não precisa resolver todo o jogo a cada ação do bot. Precisa de uma base razoável, uma forma de refinar os spots difíceis e uma alternativa quando o orçamento computacional acabar.
| Camada | Idéia Pluribus | Versão prática do construtor |
|---|---|---|
| Linha de base | Plano obtido por self-play | Ranges heurísticos e limites de equidade |
| Busca | Resolução de subjogos com profundidade limitada | Monte Carlo ou simulação específica do board |
| Abstração | Grupos de situações semelhantes | Agrupar mãos por força, tipo de draw, posição e profundidade de stack |
| Equilíbrio | Estratégias mistas | Variar as frequências de bet, call e fold em spots próximos |
| Teste | Partidas profissionais | Temporadas ao vivo contra bots que você não escreveu |
O que é CFR no pôquer
A minimização do arrependimento contrafactual, ou CFR, é um método para aprender estratégias em jogos de informação imperfeita. O artigo original do NeurIPS de 2007 introduziu arrependimento contrafactual e mostrou que abstrações de pôquer com até 10^12 estados poderiam ser resolvidas, duas ordens de magnitude maiores que os métodos anteriores (NeurIPS, 2007).
Em termos simples, o CFR pergunta: “Se eu pudesse repetir este ponto de decisão, quanto me arrependeria de não escolher cada ação?” Repita essa pergunta em muitas iterações de self-play e, no longo prazo, as ações com menor arrependimento se tornarão mais prováveis.
O pôquer precisa disso porque você nunca vê o estado completo. Você conhece suas cartas, o board, o histórico de apostas e o tamanho dos stacks. Você não conhece as cartas fechadas do oponente ou a estratégia exata. O CFR oferece uma maneira disciplinada de melhorar sob incerteza, sem fingir que você pode observar tudo.
Para um desenvolvedor, o CFR é um conceito útil antes de ser uma implementação útil. Ele ajuda a entender por que é importante equilibrar blefes, por que regras determinísticas podem ser exploradas e por que uma ação “perfeita” em uma única mão importa menos do que uma estratégia difícil de explorar ao longo de milhares delas.
O Pluribus é de código aberto ou pode ser usado hoje
Pluribus é melhor tratado como um resultado de pesquisa, não como uma ferramenta instalável. Os artefatos públicos são o artigo da Science, a cobertura de apoio e as descrições do método. Não há caminho pip install pluribus oficial, servidor de jogo público ou SDK mantido para os desenvolvedores se conectarem em 2026.
Isso não torna o trabalho inútil. Significa apenas que as peças reutilizáveis são conceituais:
- Use uma estratégia básica em vez de começar cada mão do zero.
- Agrupe estados de pôquer semelhantes para que seu bot possa raciocinar sob pressão de tempo.
- Adicione pesquisa apenas onde a decisão for valiosa o suficiente para justificar a computação.
- Randomize decisões próximas para que seu bot não se torne legível mecanicamente.
- Teste contra oponentes fora do seu próprio simulador.
No Open Poker, os criadores que evoluem mais rápido geralmente começam pela versão simples. Eles colocam no ar um bot heurístico compacto, coletam mãos, encontram vazamentos e só então adicionam mais matemática. O caminho mais lento é começar com “vou reproduzir o Pluribus” e nunca chegar à primeira mão ao vivo.
Se você deseja ferramentas de código aberto, use OpenSpiel para pesquisa de teoria de jogos, RLCard para experimentos de aprendizagem por reforço e PokerKit para simulação prática de pôquer em Python e avaliação de mãos.
O que os construtores podem copiar do Pluribus
Os desenvolvedores devem aproveitar os princípios de arquitetura do Pluribus, não sua ambição computacional. Segundo a CMU, a estratégia-base levou oito dias e 12.400 horas de núcleo para ser calculada, enquanto as partidas ao vivo usaram 28 núcleos. É menos do que muitos imaginavam, mas ainda não é um projeto para iniciantes.
A primeira ideia reutilizável é a separação de responsabilidades. Seu bot deve ter uma política-base, uma representação de estado, um módulo de decisão e um ciclo de testes. Não enterre tudo em uma função decide() gigantesca.
A segunda ideia é a busca seletiva. Não vale a pena gastar muito processamento em todas as mãos. Foldar 9-3 offsuit under the gun não exige uma rede neural. Decidir diante de um jam no river em um pote grande pode justificar esse custo.
A terceira ideia é estratégia mista. CMU observou que Pluribus usou ações equilibradas em mãos possíveis e surpreendeu os profissionais com linhas como donk bets mais frequentes. Isso não significa que você deva donk bet aleatoriamente. Isso significa que mapeamentos um-para-um óbvios, como "aposta grande é igual a valor, aposta pequena é igual a blefe" são fáceis de explorar.
Aqui está uma tradução prática:
def decide_close_spot(equity, pot_odds, board_texture, rng):
edge = equity - pot_odds
if edge > 0.12:
return "raise"
if edge < -0.08:
return "fold"
# Close spots should not be deterministic.
if board_texture == "wet":
return "call" if rng.random() < 0.70 else "raise"
return "call" if rng.random() < 0.85 else "fold"Isso não é CFR. É apenas uma aplicação modesta da mesma lição: em um spot equilibrado, o bot não deve repetir sempre a mesma ação e revelar um padrão fácil de explorar.
Você deveria construir um bot estilo Pluribus primeiro
Não. Comece com um bot mais simples, a menos que seu objetivo seja pesquisa acadêmica. A pesquisa no estilo Deep CFR e Pluribus é poderosa, mas mesmo o artigo Deep CFR enquadra o CFR como uma estrutura líder para grandes jogos de informação imperfeita e aponta os problemas de abstração que tornam o pôquer em grande escala difícil (arXiv, 2019).
Para a maioria dos construtores, a sequência correta é:
- Crie um cliente WebSocket confiável.
- Adicione avaliação de mão com PokerKit.
- Adicione equidade de Monte Carlo para draws e boards incertos.
- Adicione ranges com reconhecimento de posição.
- Acompanhe os oponentes e os resultados das sessões.
- Só então experimente CFR, OpenSpiel ou RL profundo.
Essa ordem gera feedback mais rápido. Você consegue observar um bot heurístico perder por motivos concretos. Não dá para depurar um sistema de busca sem saber se as cargas de ação, os tokens de turno, o controle dos stacks e o parser do estado da mesa funcionam.
OpenSpiel é o melhor lugar para estudar o lado da pesquisa. Seu artigo o descreve como uma estrutura para aprendizagem por reforço, pesquisa e planejamento em jogos de informação perfeita e imperfeita (arXiv, 2020). Use isso quando a pergunta for algorítmica. Use uma arena ao vivo quando a questão for se o seu bot vence.
Onde você pode testar ideias inspiradas em Pluribus
Você pode testar ideias inspiradas em Pluribus em três camadas: simulação local, oponentes de referência e jogo bot-vs-bot ao vivo. PokerKit cobre a mecânica prática do pôquer local, Slumbot cobre benchmarking heads-up e Open Poker cobre competição ao vivo de 6-max contra bots de outros desenvolvedores.
Comece pela simulação local. Ela é barata, rápida e reproduzível. Teste a calculadora de equidade e verifique se a lógica de ranges evita abrir mãos ruins nas posições iniciais. Faça essas validações antes que uma sessão ao vivo custe fichas.
Use um benchmark em segundo lugar. Slumbot é útil se o seu bot tiver um modo heads-up e você quiser um oponente estável. Ele não dirá se o seu bot lida com a dinâmica da mesa de seis jogadores.
Por fim, use partidas ao vivo. Open Poker oferece a peça que faltava: oponentes que você não programou. Isso importa porque o self-play muitas vezes ensina o bot a explorar apenas os próprios pontos cegos. Um ambiente ao vivo apresenta sizings incomuns, jogadores fracos, bots agressivos, timeouts e condições de mesa que o simulador talvez nunca produza.
Para um panorama mais amplo da plataforma, comece com a comparação da plataforma de pôquer AI. Para obter o caminho de construção completo, use o guia principal do bot de pôquer AI.
Perguntas frequentes
Posso baixar Pluribus ou usá-lo como um bot de pôquer
Não existe um SDK oficial e público do Pluribus nem um bot instalável. O material disponível é o artigo científico de 2019 e a documentação técnica que o acompanha. Use o Pluribus como referência de pesquisa e desenvolva com ferramentas práticas como PokerKit, OpenSpiel, RLCard e uma plataforma de testes ao vivo.
Pluribus resolveu o pôquer completamente
Não. Pluribus alcançou um desempenho sobre-humano em experimentos No-Limit Texas Hold'em com seis jogadores, incluindo um teste profissional de 10.000 mãos relatado pela CMU. Isso não é o mesmo que resolver todos os formatos de pôquer, profundidade de stack, modelo de rake, tamanho de mesa ou distribuição de oponentes.
É necessário CFR para construir um bom bot de pôquer
O CFR é importante para entender a IA moderna aplicada ao pôquer, mas um primeiro bot sólido pode usar ranges, equidade, pot odds, modelagem de oponentes e variação aleatória em spots equilibrados. O CFR se torna atraente quando você já tem infraestrutura, dados e um motivo para treinar políticas que vão além das heurísticas.
Qual é a diferença entre Pluribus e OpenSpiel
Pluribus é um sistema de pesquisa específico para No-Limit Hold'em de seis jogadores. OpenSpiel é uma estrutura de código aberto para aprendizado por reforço e pesquisa de teoria de jogos em muitos jogos. Você pode usar o OpenSpiel para estudar ideias semelhantes ao CFR, mas não é o bot Pluribus.
Onde devo testar um bot inspirado em Pluribus
Comece localmente, compare a lógica com um benchmark se necessário e depois teste em um ambiente ativo. Open Poker foi criado para competições 6-max exclusivas entre bots, portanto é a opção prática mais próxima para testar ideias multiplayer sem violar as regras de salas destinadas a humanos.
Comece com a versão menor.
A lição do Pluribus não é “vá construir outro Pluribus”. Bots fortes combinam uma estratégia-base, busca onde ela realmente importa, abstração, ações equilibradas e testes rigorosos.
Coloque a versão menor no ar primeiro. Construa o loop de eventos, adicione a matemática das cartas, varie as decisões em spots equilibrados e jogue mãos reais. Quando o bot já tiver passado por situações concretas, pesquisas no estilo do CFR e do Pluribus farão mais sentido.