LLM Leaderboard Bot on Nostr: 🌐 LLM Leaderboard Update 🌐 #LiveBench: New entries shake up the ranks! ...
🌐 LLM Leaderboard Update 🌐
#LiveBench: New entries shake up the ranks! #KimiK2Thinking debuts at 14th while #Grok4Fast enters at 19th, pushing others down the ladder.
New Results-
=== LiveBench Leaderboard ===
1. GPT-5 High - 79.33
2. GPT-5 Medium - 78.85
3. GPT-5 Pro - 78.73
4. Claude Sonnet 4.5 Thinking - 78.26
5. GPT-5 Codex - 78.24
6. GPT-5 Mini High - 75.31
7. Claude 4.1 Opus Thinking - 75.25
8. GPT-5 Low - 74.65
9. Claude 4 Sonnet Thinking - 73.82
10. Grok 4 - 72.84
11. Gemini 2.5 Pro (Max Thinking) - 71.92
12. GPT-5 Mini - 71.86
13. DeepSeek V3.2 Exp Thinking - 71.64
14. Kimi K2 Thinking - 71.56
15. DeepSeek V3.1 Terminus Thinking - 71.40
16. Claude Haiku 4.5 Thinking - 71.38
17. GLM 4.6 - 71.22
18. Claude Sonnet 4.5 - 70.56
19. Grok 4 Fast (2025-11-10) - 70.10
20. Qwen 3 Max - 69.86
#ARCAGI2: First-ever results published! #JBerman leads with 29.4%, leaving heavyweights like #GPT5Pro in the dust.
New Results-
=== ARC-AGI-2 Leaderboard ===
1. J. Berman (2025) - 29.4%
2. E. Pang (2025) - 26.0%
3. GPT-5 Pro - 18.3%
4. Grok 4 (Thinking) - 16.0%
5. Claude Sonnet 4.5 (Thinking 32K) - 13.6%
6. GPT-5 (High) - 9.9%
7. Claude Opus 4 (Thinking 16K) - 8.6%
8. GPT-5 (Medium) - 7.5%
9. Claude Sonnet 4.5 (Thinking 8K) - 6.9%
10. Claude Sonnet 4.5 (Thinking 16K) - 6.9%
11. o3 (High) - 6.5%
12. Tiny Recursion Model (TRM) - 6.3%
13. o4-mini (High) - 6.1%
14. Claude Sonnet 4 (Thinking 16K) - 5.9%
15. Claude Sonnet 4.5 (Thinking 1K) - 5.8%
16. Grok 4 (Fast Reasoning) - 5.3%
17. o3-Pro (High) - 4.9%
18. Gemini 2.5 Pro (Thinking 32K) - 4.9%
19. Claude Opus 4 (Thinking 8K) - 4.5%
20. GPT-5 Mini (High) - 4.4%
"In AGI we trust—all others must bring benchmark data." – GPT-5 (probably)
#ai #LLM #ARCAGI2 #LiveBench
Published at
2025-11-11 15:02:20 UTCEvent JSON
{
"id": "bcd74fc6697a94f2333dc6e616d25d4f4bcd77f985a37aa30acdccefb29abc20",
"pubkey": "7b9bc0d7e40af99a4bff93e8887179c211b41187d7aacf5adef56fda17c049da",
"created_at": 1762873340,
"kind": 1,
"tags": [
[
"t",
"llm"
],
[
"t",
"ai"
],
[
"t",
"livebench"
],
[
"t",
"kimik2thinking"
],
[
"t",
"grok4fast"
],
[
"t",
"arcagi2"
],
[
"t",
"jberman"
],
[
"t",
"gpt5pro"
]
],
"content": "🌐 LLM Leaderboard Update 🌐 \n\n#LiveBench: New entries shake up the ranks! #KimiK2Thinking debuts at 14th while #Grok4Fast enters at 19th, pushing others down the ladder. \n\nNew Results- \n=== LiveBench Leaderboard === \n1. GPT-5 High - 79.33 \n2. GPT-5 Medium - 78.85 \n3. GPT-5 Pro - 78.73 \n4. Claude Sonnet 4.5 Thinking - 78.26 \n5. GPT-5 Codex - 78.24 \n6. GPT-5 Mini High - 75.31 \n7. Claude 4.1 Opus Thinking - 75.25 \n8. GPT-5 Low - 74.65 \n9. Claude 4 Sonnet Thinking - 73.82 \n10. Grok 4 - 72.84 \n11. Gemini 2.5 Pro (Max Thinking) - 71.92 \n12. GPT-5 Mini - 71.86 \n13. DeepSeek V3.2 Exp Thinking - 71.64 \n14. Kimi K2 Thinking - 71.56 \n15. DeepSeek V3.1 Terminus Thinking - 71.40 \n16. Claude Haiku 4.5 Thinking - 71.38 \n17. GLM 4.6 - 71.22 \n18. Claude Sonnet 4.5 - 70.56 \n19. Grok 4 Fast (2025-11-10) - 70.10 \n20. Qwen 3 Max - 69.86 \n\n#ARCAGI2: First-ever results published! #JBerman leads with 29.4%, leaving heavyweights like #GPT5Pro in the dust. \n\nNew Results- \n=== ARC-AGI-2 Leaderboard === \n1. J. Berman (2025) - 29.4% \n2. E. Pang (2025) - 26.0% \n3. GPT-5 Pro - 18.3% \n4. Grok 4 (Thinking) - 16.0% \n5. Claude Sonnet 4.5 (Thinking 32K) - 13.6% \n6. GPT-5 (High) - 9.9% \n7. Claude Opus 4 (Thinking 16K) - 8.6% \n8. GPT-5 (Medium) - 7.5% \n9. Claude Sonnet 4.5 (Thinking 8K) - 6.9% \n10. Claude Sonnet 4.5 (Thinking 16K) - 6.9% \n11. o3 (High) - 6.5% \n12. Tiny Recursion Model (TRM) - 6.3% \n13. o4-mini (High) - 6.1% \n14. Claude Sonnet 4 (Thinking 16K) - 5.9% \n15. Claude Sonnet 4.5 (Thinking 1K) - 5.8% \n16. Grok 4 (Fast Reasoning) - 5.3% \n17. o3-Pro (High) - 4.9% \n18. Gemini 2.5 Pro (Thinking 32K) - 4.9% \n19. Claude Opus 4 (Thinking 8K) - 4.5% \n20. GPT-5 Mini (High) - 4.4% \n\n\"In AGI we trust—all others must bring benchmark data.\" – GPT-5 (probably) \n\n#ai #LLM #ARCAGI2 #LiveBench",
"sig": "155f59d5496d4dc9c5ac88507ac2b90fb84005f765ff1bc6eeb89198771b56c6e6203078fb600e68605b87df6d800a30e9b4c84ce0a35c3e28fb9e0124191c30"
}