Experiment 05b · Final Test · No History

One final, ten tries. How much does each model disagree with itself?

25 AI models each simulated the WC26 Final ten times, this time with the tournament match history withheld from the prompt. Same match, ten independent runs — so we can measure the variance in each model's scorelines, scorers, assists and MVPs.

Real final
🇪🇸Spain1
🇦🇷Argentina0
Best model
Perplexity Sonar
95.6%
Worst model
GPT-5 Mini
55.9%
Avg accuracy
83.5%
25 × 10 runs

Leaderboard

25 models · sorted by accuracy
#ModelxG 🇪🇸xG 🇦🇷Modal scoreW / D / L %Top scorerMVPAccuracy
1Perplexity
Perplexity Sonar
Perplexity
1.600.102050%100/0/0Mikel Oyarzabal (1.0/g)Rodri 100%95.6%
2Google
Gemini 2.5 Pro
Google
1.100.201080%90/10/0Mikel Oyarzabal (1.0/g)Rodri 90%93.4%
3Moonshot
Moonshot Kimi K2.6
Moonshot
2.000.202080%100/0/0Mikel Oyarzabal (1.0/g)Rodri 100%92.5%
4Alibaba
Qwen 3.7 Max
Alibaba
1.900.402050%100/0/0Mikel Oyarzabal (1.1/g)Rodri 70%92.3%
5Alibaba
Qwen 3.7 Plus
Alibaba
2.000.302070%100/0/0Mikel Oyarzabal (1.0/g)Lamine Yamal 60%92.1%
6Meta
Llama 4 Maverick
Meta
2.000.402060%100/0/0Lamine Yamal (1.0/g)Lamine Yamal 100%91.7%
7Google
Gemini 2.5 Flash Lite
Google
1.600.502150%100/0/0Mikel Oyarzabal (1.0/g)Rodri 100%89.4%
8Anthropic
Claude Opus 4.8
Anthropic
2.001.0021100%100/0/0Mikel Oyarzabal (1.0/g)Lamine Yamal 90%89.1%
9Mistral
Mixtral 8x22B
Mistral
2.001.0021100%100/0/0Lamine Yamal (1.0/g)Rodri 100%89.1%
10Anthropic
Claude Fable 5
Anthropic
2.001.0021100%100/0/0Mikel Oyarzabal (1.0/g)Mikel Oyarzabal 70%86.9%
11OpenAI
GPT-5.6 Sol
OpenAI
1.700.802170%90/10/0Lionel Messi (0.8/g)Rodri 80%86.8%
12z.ai
GLM 5.2
z.ai
1.900.602150%90/10/0Mikel Oyarzabal (1.0/g)Rodri 70%86.4%
13DeepSeek
DeepSeek V4 Pro
DeepSeek
1.900.602160%100/0/0Mikel Oyarzabal (0.9/g)Rodri 100%84.8%
14OpenAI
GPT-5.5
OpenAI
1.801.002180%80/20/0Lionel Messi (0.9/g)Rodri 70%84.7%
15Google
Gemini 2.5 Flash
Google
1.800.502050%90/0/10Mikel Oyarzabal (1.0/g)Rodri 90%84.5%
16OpenAI
GPT-5.6 Luna
OpenAI
1.801.002180%80/20/0Lionel Messi (1.0/g)Lamine Yamal 90%82.4%
17Anthropic
Claude Sonnet 4.6
Anthropic
1.500.902150%60/40/0Mikel Oyarzabal (1.0/g)Rodri 60%81.3%
18Anthropic
Claude Haiku 4.5
Anthropic
1.800.602060%80/0/20Mikel Oyarzabal (1.0/g)Rodri 80%80.5%
19Mistral
Mistral Large
Mistral
1.700.902170%90/0/10Mikel Oyarzabal (1.0/g)Rodri 90%80.1%
20OpenAI
GPT-5.6 Terra
OpenAI
1.401.001160%40/60/0Mikel Oyarzabal (0.8/g)Rodri 50%75.7%
21xAI
Grok 4.20
xAI
1.501.402150%50/10/40Lamine Yamal (1.0/g)Lionel Messi 50%74.6%
22OpenAI
GPT-5 Nano
OpenAI
1.300.900040%40/60/0Lamine Yamal (0.9/g)Lamine Yamal 80%74.5%
23DeepSeek
DeepSeek R1 0528
DeepSeek
1.100.501030%60/40/0Mikel Oyarzabal (1.0/g)Rodri 90%73.4%
24Meta
Llama 3.3 70B
Meta
1.500.802050%60/0/40Mikel Oyarzabal (1.0/g)Lamine Yamal 50%69.9%
25OpenAI
GPT-5 Mini
OpenAI
1.601.702260%0/90/10Lionel Messi (0.9/g)Lionel Messi 70%55.9%