La discusión sobre quién manda hoy en el poker impulsado por inteligencia artificial empieza a tener una respuesta más clara. Un nuevo benchmark público de GTO Wizard muestra que su agente especializado se mantiene por delante de los grandes modelos generalistas, incluso en una disciplina tan exigente como el heads-up no-limit Texas Hold’em. El proyecto se presenta como una API pública y un entorno estandarizado de evaluación para medir algoritmos en poker, con un enfoque centrado en resultados comparables y reproducibles.
Un líder construido para jugar poker
El punto de partida del estudio es GTO Wizard AI, descrito por sus creadores como un agente superhumano que aproxima estrategias de equilibrio de Nash. Según el paper del benchmark, este sistema ya había derrotado a Slumbot, campeón de la Annual Computer Poker Competition 2018, con una diferencia de 19,4 bb/100 a lo largo de 150.000 manos, un margen que sirve como antecedente del nivel competitivo con el que ahora se comparan otros modelos.
Los modelos generalistas mejoran, pero siguen atrás
El estudio evaluó a varios modelos de última generación en condiciones zero-shot y concluyó que ninguno logró superar al agente de GTO Wizard. El mejor desempeño entre los modelos generalistas correspondió a GPT-5.3 (Extra High reasoning), con un registro ajustado por varianza de -16,04 bb/100. Detrás aparecieron GPT-5.4 (Extra High reasoning) con -17,84 bb/100, Claude Opus 4.6 con -20,35 bb/100, Gemini 3.1 Pro Preview con -30,83 bb/100 y Grok 4 High reasoning con -59,98 bb/100. El propio leaderboard de GTO Wizard Benchmark resume la situación con una frase contundente: todos los grandes LLM ya fueron probados y ninguno ha ganado.
¿Por qué este resultado pesa tanto?
En poker, una muestra pequeña puede distorsionar cualquier conclusión por la varianza natural del juego. Para corregir ese problema, el benchmark incorpora AIVAT, una técnica de reducción de varianza que, de acuerdo con el estudio, permite alcanzar una significancia estadística equivalente con unas diez veces menos manos que una evaluación Monte Carlo tradicional. En otras palabras, el resultado no se apoya solo en una racha favorable o desfavorable, sino en una metodología diseñada para separar mejor el rendimiento real de la suerte.
La brecha no es solo estratégica
El análisis también plantea que la diferencia entre un agente especializado y un modelo generalista no pasa únicamente por “pensar mejor”, sino por representar con precisión el estado del juego. El paper señala que algunos LLM todavía cometen errores de seguimiento de cartas, palos o bloqueadores, fallas pequeñas en apariencia, pero muy costosas en un formato donde una sola decisión mal interpretada altera el valor esperado de toda una línea. Para los autores, ese tipo de imprecisiones se acumula y termina alejando a los modelos generalistas del nivel que exige un entorno competitivo de heads-up.
Una foto nítida del presente
La conclusión que deja esta medición es clara: la inteligencia artificial generalista ha avanzado de forma notable, pero en poker todavía no alcanza a los motores construidos específicamente para ese terreno. Hoy, al menos bajo este entorno público de evaluación, GTO Wizard AI marca la pauta. Y mientras la industria sigue de cerca la evolución de los grandes modelos, el mensaje que deja este benchmark es simple: en poker no basta con razonar bien; también hay que entender el juego con una precisión casi quirúrgica.
