🌐 LLM Leaderboard Update 🌐
Big moves today! OpenAI's GPT-5.6 family (Sol, Terra, Luna) storms onto nearly every leaderboard, claiming top spots across ARC-AGI-2, TerminalBench, DeepSWE, and CRIPt. GPT-5.6 Sol takes #1 on TerminalBench and DeepSWE, while the previous champ Claude Fable 5 drops to #2 on DeepSWE and #6 on TerminalBench. SimpleBench sees GPT-5.6 Sol Pro debut at #7, and ARC-AGI-1 now has multiple GPT-5.6 variants in the top 10. Humanity Last Exam and MMMU-Pro also see new entries from the GPT-5.6 series.
New Results:
=== LiveBench Leaderboard ===
1. ▸ - 82.4%
2. ▸ - 80.8%
3. ▸ - 79.9%
4. ▸ - 79.8%
5. ▸ - 78.9%
6. ▸ - 78.0%
7. ▸ - 77.1%
8. ▸ - 76.5%
9. ▸ - 76.3%
10. ▸ - 74.8%
11. ▸ - 74.6%
12. ▸ - 74.6%
13. ▸ - 74.5%
14. ▸ - 74.3%
15. ▸ - 74.0%
16. ▸ - 73.2%
17. ▸ - 73.1%
18. ▸ - 73.0%
19. ▸ - 72.6%
20. ▸ - 71.6%
=== SimpleBench Leaderboard ===
1. Highest Human Score* - 95.4%
2. Claude Fable - 81.9%
3. Gemini 3.1 Pro Preview - 79.6%
4. GPT-5.5 Pro - 76.9%
5. Gemini 3.5 Flash - 76.7%
6. Gemini 3 Pro Preview - 76.4%
7. GPT-5.6 Sol Pro - 71.7%
8. Qwen 3.7 Max - 70.4%
9. Grok 4.5 - 70.0%
10. GPT-5.5 - 69.0%
11. Claude Opus 4.6 - 67.6%
12. Claude Opus 4.8 - 64.8%
13. GPT-5.6 Sol - 64.8%
14. Qwen 3.6 Max Preview - 63.0%
15. Gemini 2.5 Pro (06-05) - 62.4%
16. Claude Opus 4.5 - 62.0%
17. Claude Opus 4.7 - 61.7%
18. GPT-5 Pro - 61.6%
19. Gemini 3 Flash Preview - 61.1%
20. Claude Sonnet 5 - 60.6%
=== ARC-AGI-1 Leaderboard ===
1. Human Panel (Human) - 98.0%
2. Stem Grad (Human) - 98.0%
3. Gemini 3.1 Pro (Preview) (Google) - 98.0%
4. GPT-5.6 Sol (xHigh) (OpenAI) - 97.5%
5. GPT-5.6 Sol (High) (OpenAI) - 97.0%
6. GPT-5.5 Pro (High) (OpenAI) - 96.5%
7. GPT-5.6 Sol (Max) (OpenAI) - 96.5%
8. GPT-5.6 Terra (Max) (OpenAI) - 96.5%
9. Gemini 3 Deep Think (2/26) (Google) - 96.0%
10. GPT-5.5 (xHigh) (OpenAI) - 95.0%
11. GPT-5.5 Pro (xHigh) (OpenAI) - 95.0%
12. GPT-5.2 (Refine.) (Johan Land) - 94.5%
13. GPT-5.4 Pro (xHigh) (OpenAI) - 94.5%
14. GPT-5.5 (High) (OpenAI) - 94.5%
15. Claude Opus 4.6 (120K, High) (Anthropic) - 94.0%
16. GPT-5.6 Terra (xHigh) (OpenAI) - 94.0%
17. GPT-5.4 (xHigh) (OpenAI) - 93.7%
18. Claude 4.7 (High) (Anthropic) - 93.5%
19. Claude Opus 4.6 (120K, Max) (Anthropic) - 93.0%
20. GPT-5.4 (High) (OpenAI) - 92.7%
=== ARC-AGI-2 Leaderboard ===
1. Human Panel (Human) - 100.0%
2. GPT-5.6 Sol (Max) (OpenAI) - 92.5%
3. GPT-5.6 Sol (xHigh) (OpenAI) - 90.0%
4. GPT-5.6 Sol (High) (OpenAI) - 85.4%
5. GPT-5.5 (xHigh) (OpenAI) - 85.0%
6. Gemini 3 Deep Think (2/26) (Google) - 84.6%
7. GPT-5.5 Pro (High) (OpenAI) - 84.6%
8. GPT-5.5 Pro (xHigh) (OpenAI) - 84.2%
9. GPT-5.6 Terra (Max) (OpenAI) - 83.9%
10. GPT-5.4 Pro (xHigh) (OpenAI) - 83.3%
11. GPT-5.5 (High) (OpenAI) - 83.3%
12. Gemini 3.1 Pro (Preview) (Google) - 77.1%
13. Claude 4.7 (Max) (Anthropic) - 75.8%
14. GPT-5.6 Terra (xHigh) (OpenAI) - 74.2%
15. GPT-5.4 (xHigh) (OpenAI) - 74.0%
16. GPT-5.2 (Refine.) (Johan Land) - 72.9%
17. Claude Opus 4.8 (High) (Anthropic) - 72.1%
18. Gemini 3.5 Flash (High) (Google) - 72.1%
19. Claude Opus 4.8 (Medium) (Anthropic) - 71.7%
20. GPT-5.5 (Medium) (OpenAI) - 70.4%
=== Humanity Last Exam Leaderboard ===
1. Claude Fable 5 (with fallback) - 53.3%
2. GPT-5.6 Sol (max) - 47.2%
3. Claude Opus 4.8 (max) - 45.7%
4. GPT-5.6 Sol (xhigh) - 44.7%
5. Gemini 3.1 Pro Preview - 44.7%
6. GPT-5.5 (xhigh) - 44.3%
7. GPT-5.6 Terra (max) - 41.8%
8. Gemini 3.5 Flash - 41.0%
9. Grok 4.5 (high) - 40.3%
10. GLM-5.2 (max) - 40.1%
11. Muse Spark - 39.9%
12. Claude Sonnet 5 (max) - 39.6%
13. Qwen3.7 Max - 38.1%
14. GPT-5.6 Luna (max) - 37.2%
15. MiniMax-M3 - 37.1%
16. Kimi K2.6 - 35.9%
17. DeepSeek V4 Pro (max) - 35.9%
18. Grok 4.3 (high) - 35.0%
19. MiMo-V2.5-Pro - 33.8%
20. DeepSeek V4 Flash (max) - 32.1%
=== DeepSWE Leaderboard ===
1. gpt-5-6-sol - 72.7%
2. claude-fable-5 - 69.9%
3. gpt-5-6-terra - 69.6%
4. gpt-5-6-luna - 67.2%
5. gpt-5-5 - 67.0%
6. claude-opus-4-8 - 59.0%
7. claude-sonnet-5 - 53.8%
8. gpt-5-4 - 51.8%
9. glm-5-2 - 43.8%
10. gemini-3-5-flash - 37.4%
11. kimi-k2-7-code - 30.5%
12. claude-sonnet-4-6 - 29.9%
13. gemini-3-1-pro-preview - 11.8%
=== TerminalBench v2.1 Leaderboard ===
1. GPT-5.6 Sol (xhigh) - 89.5%
2. GPT-5.6 Sol (max) - 88.0%
3. GPT-5.6 Terra (max) - 88.0%
4. GPT-5.6 Sol (high) - 87.3%
5. GPT-5.6 Sol (medium) - 86.1%
6. Claude Fable 5 (with fallback) - 84.6%
7. Claude Opus 4.8 (max) - 84.6%
8. GPT-5.5 (xhigh) - 84.3%
9. Grok 4.5 (high) - 81.6%
10. GPT-5.6 Luna (max) - 80.9%
11. Claude Sonnet 5 (max) - 80.5%
12. Gemini 3.5 Flash - 78.7%
13. GLM-5.2 (max) - 77.9%
14. Qwen3.7 Max - 74.5%
15. Gemini 3.1 Pro Preview - 73.8%
16. Kimi K2.6 - 65.9%
17. MiniMax-M3 - 65.2%
18. MiMo-V2.5-Pro - 65.2%
19. DeepSeek V4 Pro (max) - 64.0%
20. Muse Spark - 62.2%
=== CRIPt Leaderboard ===
1. GPT-5.6 Sol (max) - 32.3%
2. GPT-5.5 Pro (xhigh) - 30.6%
3. GPT-5.6 Terra (max) - 30.0%
4. GPT-5.4 Pro (xhigh) - 30.0%
5. GPT-5.6 Sol (xhigh) - 28.6%
6. Claude Fable 5 (with fallback) - 28.6%
7. GPT-5.5 (xhigh) - 27.1%
8. Claude Opus 4.8 (max) - 20.9%
9. GLM-5.2 (max) - 20.9%
10. GPT-5.6 Luna (max) - 20.6%
11. Gemini 3.1 Pro Preview - 17.7%
12. Claude Sonnet 5 (max) - 16.9%
13. Grok 4.5 (high) - 15.4%
14. Qwen3.7 Max - 13.4%
15. Gemini 3.5 Flash - 13.1%
16. DeepSeek V4 Pro (max) - 12.9%
17. Muse Spark - 11.3%
18. Grok 4.3 (high) - 8.0%
19. Kimi K2.6 - 8.0%
20. DeepSeek V4 Flash (max) - 7.1%
=== MMMU-Pro Leaderboard ===
1. Gemini 3.5 Flash - 84%
2. Gemini 3.5 Flash (medium) - 84%
3. GPT-5.6 Sol (max) - 83%
4. GPT-5.6 Sol (xhigh) - 83%
5. Gemini 3.1 Pro Preview - 82%
6. GPT-5.6 Terra (max) - 81%
7. Muse Spark - 81%
8. Grok 4.5 (high) - 80%
9. GPT-5.5 (xhigh) - 80%
10. Kimi K2.6 - 79%
11. GPT-5.6 Luna (max) - 79%
12. MiniMax-M3 - 79%
13. Grok 4.3 (high) - 78%
14. Claude Sonnet 5 (max) - 77%
15. Qwen3.5 397B A17B - 77%
16. Gemma 4 31B - 73%
17. Mistral Medium 3.5 - 65%
18. Claude 4.5 Haiku - 59%
#ai #LLM #LiveBench #SimpleBench #ARC-AGI-1 #ARC-AGI-2 #HumanityLastExam #DeepSWE #TerminalBench #CRIPt #MMMU-Pro

