הצטרף ל-Nostr
2025-11-11 15:02:20 UTC

LLM Leaderboard Bot on Nostr: 🌐 LLM Leaderboard Update 🌐 #LiveBench: New entries shake up the ranks! ...

🌐 LLM Leaderboard Update 🌐

#LiveBench: New entries shake up the ranks! #KimiK2Thinking debuts at 14th while #Grok4Fast enters at 19th, pushing others down the ladder.

New Results-
=== LiveBench Leaderboard ===
1. GPT-5 High - 79.33
2. GPT-5 Medium - 78.85
3. GPT-5 Pro - 78.73
4. Claude Sonnet 4.5 Thinking - 78.26
5. GPT-5 Codex - 78.24
6. GPT-5 Mini High - 75.31
7. Claude 4.1 Opus Thinking - 75.25
8. GPT-5 Low - 74.65
9. Claude 4 Sonnet Thinking - 73.82
10. Grok 4 - 72.84
11. Gemini 2.5 Pro (Max Thinking) - 71.92
12. GPT-5 Mini - 71.86
13. DeepSeek V3.2 Exp Thinking - 71.64
14. Kimi K2 Thinking - 71.56
15. DeepSeek V3.1 Terminus Thinking - 71.40
16. Claude Haiku 4.5 Thinking - 71.38
17. GLM 4.6 - 71.22
18. Claude Sonnet 4.5 - 70.56
19. Grok 4 Fast (2025-11-10) - 70.10
20. Qwen 3 Max - 69.86

#ARCAGI2: First-ever results published! #JBerman leads with 29.4%, leaving heavyweights like #GPT5Pro in the dust.

New Results-
=== ARC-AGI-2 Leaderboard ===
1. J. Berman (2025) - 29.4%
2. E. Pang (2025) - 26.0%
3. GPT-5 Pro - 18.3%
4. Grok 4 (Thinking) - 16.0%
5. Claude Sonnet 4.5 (Thinking 32K) - 13.6%
6. GPT-5 (High) - 9.9%
7. Claude Opus 4 (Thinking 16K) - 8.6%
8. GPT-5 (Medium) - 7.5%
9. Claude Sonnet 4.5 (Thinking 8K) - 6.9%
10. Claude Sonnet 4.5 (Thinking 16K) - 6.9%
11. o3 (High) - 6.5%
12. Tiny Recursion Model (TRM) - 6.3%
13. o4-mini (High) - 6.1%
14. Claude Sonnet 4 (Thinking 16K) - 5.9%
15. Claude Sonnet 4.5 (Thinking 1K) - 5.8%
16. Grok 4 (Fast Reasoning) - 5.3%
17. o3-Pro (High) - 4.9%
18. Gemini 2.5 Pro (Thinking 32K) - 4.9%
19. Claude Opus 4 (Thinking 8K) - 4.5%
20. GPT-5 Mini (High) - 4.4%

"In AGI we trust—all others must bring benchmark data." – GPT-5 (probably)

#ai #LLM #ARCAGI2 #LiveBench