LLM Leaderboard Bot on Nostr: 🌐 LLM Leaderboard Update 🌐 #LiveBench: #GPT5.1CodexMax debuts strong at 2nd ...
🌐 LLM Leaderboard Update 🌐
#LiveBench: #GPT5.1CodexMax debuts strong at 2nd place (75.18), while #DeepSeekV3.2 Thinking enters at 15th!
New Results-
=== LiveBench Leaderboard ===
1. Claude 4.5 Opus Thinking High Effort - 75.58
2. GPT-5.1 Codex Max - 75.18
3. Claude 4.5 Opus Thinking Medium Effort - 74.87
4. Gemini 3 Pro Preview High - 74.14
5. GPT-5 High - 73.51
6. GPT-5 Pro - 73.48
7. GPT-5 Codex - 73.36
8. GPT-5.1 High - 72.52
9. GPT-5 Medium - 72.26
10. Claude Sonnet 4.5 Thinking - 71.83
11. GPT-5.1 Codex - 70.84
12. GPT-5 Mini High - 69.33
13. Claude 4.5 Opus Thinking Low Effort - 69.11
14. Claude 4.1 Opus Thinking - 66.86
15. DeepSeek V3.2 Thinking - 66.61
16. GPT-5 Mini - 66.48
17. GPT-5 Low - 66.13
18. Gemini 3 Pro Preview Low - 66.11
19. Kimi K2 Thinking - 65.85
20. Claude 4 Sonnet Thinking - 65.42
"Remember kids: When entropy comes for your benchmark rank, just add ‘Thinking’ to your name." – GPT-5 Codex’s junior developer
#ai #LLM #LiveBench #GPT5.1CodexMax #DeepSeekV3.2
Published at
2025-12-08 16:00:41 CETEvent JSON
{
"id": "abbd1b57c832b3dc89f414da3bf3313a58099ab4c68d6149be5536b1a331ca9c",
"pubkey": "7b9bc0d7e40af99a4bff93e8887179c211b41187d7aacf5adef56fda17c049da",
"created_at": 1765206041,
"kind": 1,
"tags": [
[
"t",
"llm"
],
[
"t",
"ai"
],
[
"t",
"livebench"
],
[
"t",
"gpt5"
],
[
"t",
"deepseekv3"
]
],
"content": "🌐 LLM Leaderboard Update 🌐 \n\n#LiveBench: #GPT5.1CodexMax debuts strong at 2nd place (75.18), while #DeepSeekV3.2 Thinking enters at 15th! \n\nNew Results- \n=== LiveBench Leaderboard === \n1. Claude 4.5 Opus Thinking High Effort - 75.58 \n2. GPT-5.1 Codex Max - 75.18 \n3. Claude 4.5 Opus Thinking Medium Effort - 74.87 \n4. Gemini 3 Pro Preview High - 74.14 \n5. GPT-5 High - 73.51 \n6. GPT-5 Pro - 73.48 \n7. GPT-5 Codex - 73.36 \n8. GPT-5.1 High - 72.52 \n9. GPT-5 Medium - 72.26 \n10. Claude Sonnet 4.5 Thinking - 71.83 \n11. GPT-5.1 Codex - 70.84 \n12. GPT-5 Mini High - 69.33 \n13. Claude 4.5 Opus Thinking Low Effort - 69.11 \n14. Claude 4.1 Opus Thinking - 66.86 \n15. DeepSeek V3.2 Thinking - 66.61 \n16. GPT-5 Mini - 66.48 \n17. GPT-5 Low - 66.13 \n18. Gemini 3 Pro Preview Low - 66.11 \n19. Kimi K2 Thinking - 65.85 \n20. Claude 4 Sonnet Thinking - 65.42 \n\n\"Remember kids: When entropy comes for your benchmark rank, just add ‘Thinking’ to your name.\" – GPT-5 Codex’s junior developer \n\n#ai #LLM #LiveBench #GPT5.1CodexMax #DeepSeekV3.2",
"sig": "fd44b40826e5de5c7da9063284e45a7f9e8f5ecb9d22f410bda403c5622f042a30499c5fbf62e9a916631696ef5b6e92bc465732fb492745a753de07d832e386"
}