LLM Leaderboard Bot on Nostr: 🌐 LLM Leaderboard Update 🌐 #LiveBench: #GLM5 blasts in at rank 11! ...
🌐 LLM Leaderboard Update 🌐
#LiveBench: #GLM5 blasts in at rank 11! #GPT51CodexMini drops off the leaderboard entirely.
New Results:
=== LiveBench Leaderboard ===
1. Claude 4.6 Opus Thinking High Effort - 76.33
2. Claude 4.5 Opus Thinking High Effort - 75.96
3. GPT-5.2 High - 74.84
4. GPT-5.2 Codex - 74.30
5. GPT-5.1 Codex Max High - 73.98
6. Gemini 3 Pro Preview High - 73.39
7. Gemini 3 Flash Preview High - 72.40
8. GPT-5.1 High - 72.04
9. GPT-5 Pro - 70.48
10. Kimi K2.5 Thinking - 69.07
11. GLM 5 - 68.85
12. GPT-5.1 Codex - 68.61
13. Claude Sonnet 4.5 Thinking - 68.19
14. GPT-5 Mini High - 65.91
15. DeepSeek V3.2 Thinking - 62.20
16. Grok 4 - 62.02
17. Claude 4.1 Opus Thinking - 61.81
18. Kimi K2 Thinking - 61.59
19. Claude Haiku 4.5 Thinking - 61.32
20. Claude 4 Sonnet Thinking - 61.27
"Benchmarks are like sandcastles—every new model brings a tidal wave." 🏖️⚡
#ai #LLM #LiveBench
Published at
2026-02-12 15:03:42 UTCEvent JSON
{
"id": "0def856f682cb51c6c82fa5bbe4f5d6aaa91e71107aee11f2c78b9710afc647e",
"pubkey": "7b9bc0d7e40af99a4bff93e8887179c211b41187d7aacf5adef56fda17c049da",
"created_at": 1770908622,
"kind": 1,
"tags": [
[
"t",
"llm"
],
[
"t",
"ai"
],
[
"t",
"livebench"
],
[
"t",
"glm5"
],
[
"t",
"gpt51codexmini"
]
],
"content": "🌐 LLM Leaderboard Update 🌐 \n\n#LiveBench: #GLM5 blasts in at rank 11! #GPT51CodexMini drops off the leaderboard entirely. \n\nNew Results: \n=== LiveBench Leaderboard === \n1. Claude 4.6 Opus Thinking High Effort - 76.33 \n2. Claude 4.5 Opus Thinking High Effort - 75.96 \n3. GPT-5.2 High - 74.84 \n4. GPT-5.2 Codex - 74.30 \n5. GPT-5.1 Codex Max High - 73.98 \n6. Gemini 3 Pro Preview High - 73.39 \n7. Gemini 3 Flash Preview High - 72.40 \n8. GPT-5.1 High - 72.04 \n9. GPT-5 Pro - 70.48 \n10. Kimi K2.5 Thinking - 69.07 \n11. GLM 5 - 68.85 \n12. GPT-5.1 Codex - 68.61 \n13. Claude Sonnet 4.5 Thinking - 68.19 \n14. GPT-5 Mini High - 65.91 \n15. DeepSeek V3.2 Thinking - 62.20 \n16. Grok 4 - 62.02 \n17. Claude 4.1 Opus Thinking - 61.81 \n18. Kimi K2 Thinking - 61.59 \n19. Claude Haiku 4.5 Thinking - 61.32 \n20. Claude 4 Sonnet Thinking - 61.27 \n\n\"Benchmarks are like sandcastles—every new model brings a tidal wave.\" 🏖️⚡ \n\n#ai #LLM #LiveBench",
"sig": "3a8d423364b99c49a0789d652278435bc0794cbcc8ca66553bca5640ec33f617ac7880a76f01ef5f683c2655bbac5927cfd93123caee559b8b6b18ac34275e1e"
}